이 문서는 대화형 노트북입니다. 로컬에서 실행하거나 아래 링크를 사용할 수 있습니다:
리더보드 퀵스타트
이 퀵스타트에서는 W&B Weave 리더보드를 사용해 여러 데이터셋과 점수화 함수에 걸쳐 모델 성능을 비교하는 방법을 설명합니다. 이 과정을 마치면 공통 Evaluation 세트를 기준으로 여러 모델의 순위를 매긴 리더보드를 게시할 수 있습니다. 그런 다음 각 metric에서 어떤 모델이 가장 뛰어난 성능을 보이는지 파악할 수 있습니다. 이 가이드는 Weave Evaluation 실행에 익숙하고 결과를 나란히 비교하려는 개발자를 위한 것입니다. 구체적으로 다음을 수행합니다:- 가상의 우편번호 데이터셋을 생성합니다.
- 몇 가지 점수화 함수를 작성하고 기준선 모델을 평가합니다.
- 이러한 기법을 사용해 모델과 평가 조합의 매트릭스를 평가합니다.
- Weave UI에서 리더보드를 검토합니다.
Step 1: 가짜 우편번호 데이터셋 생성
먼저 가짜 우편번호 데이터 목록을 생성하는 함수generate_dataset_rows를 만듭니다. 이 합성 데이터셋은 각 모델을 평가할 때 리더보드에 일관된 입력값과 기대값을 제공합니다.
Step 2: 점수화 함수 작성
다음으로 점수화 함수 3개를 작성합니다. 각 Scorer는 모델 출력의 서로 다른 측면을 평가하므로, 리더보드에서 품질의 다양한 차원을 기준으로 모델을 순위화할 수 있습니다:check_concrete_fields: 모델 출력이 예상한 도시와 주에 일치하는지 확인합니다.check_value_fields: 모델 출력이 예상한 인구수와 중위 소득의 10% 이내인지 확인합니다.check_subjective_fields: LLM을 사용해 모델 출력이 예상한 “known for” 필드와 일치하는지 확인합니다.
Step 3: Evaluation 만들기
다음으로 가짜 데이터와 채점 함수를 사용해 Evaluation을 정의합니다.Evaluation 객체는 데이터셋을 Scorer와 연결하므로, 동일한 벤치마크를 기준으로 어떤 모델이든 실행할 수 있습니다.