9/10, 모델 B는 8/10)은 일반적으로 상대적 기준(예: 모델 A가 모델 B보다 더 우수함)보다 부여하기가 더 어렵습니다. 쌍대 비교 평가를 사용하면 두 모델의 출력을 서로 비교해 상대적으로 순위를 매길 수 있습니다. 이 접근 방식은 텍스트 생성, 요약, 질문 응답처럼 주관적인 작업에서 어떤 모델이 더 잘 수행하는지 확인하려는 경우에 유용합니다. 쌍대 비교 평가를 사용하면 특정 입력에 대해 어떤 모델이 더 나은지 보여주는 상대적 선호 순위를 얻을 수 있습니다.
다음 코드 샘플은 PreferenceScorer라는 class-based scorer를 만들어 Weave에서 쌍대 비교 평가를 구현하는 방법을 보여줍니다. PreferenceScorer는 ModelA와 ModelB 두 모델을 비교하고, 입력 텍스트의 명시적인 힌트를 바탕으로 모델 출력의 상대 점수를 반환합니다.
PreferenceScorer 결과를 기준으로 ModelA와 ModelB의 상대적 선호도 순위를 확인할 수 있습니다.
평가