Il s’agit d’un notebook interactif. Vous pouvez l’exécuter en local ou utiliser les liens ci-dessous :
Démarrage rapide du Leaderboard
Ce démarrage rapide vous montre comment utiliser le leaderboard W&B Weave pour comparer les performances de modèles sur plusieurs jeux de données et avec plusieurs fonctions de score. À la fin, vous aurez publié un leaderboard qui classe plusieurs modèles à partir d’un ensemble commun d’évaluations. Vous pourrez ensuite identifier le modèle le plus performant pour chaque métrique. Ce guide s’adresse aux développeurs déjà familiers avec l’exécution d’évaluations Weave et qui souhaitent comparer les résultats côte à côte. Plus précisément, vous allez :- Générer un jeu de données factice de codes postaux.
- Créer quelques fonctions de score et évaluer un modèle de référence.
- Utiliser ces techniques pour évaluer une matrice de modèles et d’évaluations.
- Consulter le leaderboard dans l’interface Weave.
Étape 1 : Générer un jeu de données fictif de codes postaux
Créez d’abord une fonctiongenerate_dataset_rows qui génère une liste de données fictives de codes postaux. Ce jeu de données synthétique fournit au leaderboard un ensemble cohérent d’entrées et de valeurs attendues pour attribuer un score à chaque modèle.
Étape 2 : Créez des fonctions de score
Créez ensuite trois fonctions de score. Chaque scorer évalue un aspect différent de la sortie du modèle afin que le leaderboard puisse classer les modèles selon des dimensions distinctes de la qualité :check_concrete_fields: vérifie si la sortie du modèle correspond à la ville et à l’État attendus.check_value_fields: vérifie si la sortie du modèle se situe dans une marge de 10 % par rapport à la population et au revenu médian attendus.check_subjective_fields: utilise un LLM pour vérifier si la sortie du modèle correspond au champ “known for” attendu.
Étape 3 : Créer une évaluation
Définissez ensuite une évaluation à l’aide des données factices et des fonction de score. L’objetEvaluation associe le jeu de données aux évaluateurs, afin que vous puissiez exécuter n’importe quel modèle sur le même benchmark.