9/10 pour le modèle A et 8/10 pour le modèle B) sont généralement plus difficiles à attribuer que les métriques relatives (par exemple, le modèle A est plus performant que le modèle B). L’évaluation par paires vous permet de comparer les sorties de deux modèles en les classant l’une par rapport à l’autre. Cette approche est utile lorsque vous souhaitez déterminer quel modèle est le plus performant pour des tâches subjectives comme la génération de texte, la synthèse ou les questions-réponses. Avec l’évaluation par paires, vous obtenez un classement relatif des préférences qui indique quel modèle est le meilleur pour des entrées précises.
L’exemple de code suivant montre comment implémenter une évaluation par paires dans Weave en créant un scorer basé sur une classe nommé PreferenceScorer. PreferenceScorer compare deux modèles, ModelA et ModelB, et renvoie un score relatif des sorties des modèles, basé sur des indices explicites dans le texte d’entrée.
ModelA et ModelB, basé sur les résultats de PreferenceScorer.
Évaluation