Quelles tâches contient-il ?
Couverture, difficulté, langage, actualité et éventuelle contamination.
ÉchantillonUne métrique n'est utile que lorsque nous connaissons la tâche, les conditions et l'erreur importante.
Le résultat commence par la conception du test.
Couverture, difficulté, langage, actualité et éventuelle contamination.
ÉchantillonPrécision, préférence humaine, coût, délai ou taux de réussite.
ButInvite, outils, raisonnement, échantillons et budget.
ÉquitéTransformez les besoins réels en un petit ensemble reproductible.
Comprend les cas normaux, les bords et les échecs coûteux.
CasSépare l'exactitude, l'utilité, la sécurité et le format.
CritèreModèle, récupération, outils, latence et coût.
ProductionUn benchmark public fournit une orientation, mais ne remplace pas une évaluation avec vos données, outils, budget et tolérance à l’erreur.
Un alias mobile et un snapshot peuvent produire des résultats différents. Consignez le modèle, la date et le fournisseur.
Le prompt, le raisonnement, les outils, le nombre de tentatives et le budget doivent être équivalents pour comparer.
Une petite différence peut disparaître d’une exécution à l’autre. Conservez les échantillons, la dispersion et les défaillances, pas seulement la moyenne.
Validez si l’amélioration se maintient dans différentes langues, formats et cas réels proches de votre produit.
Referencias utilizadas para ampliar y revisar esta página.