Version exacte
Vérifiez l’identifiant du modèle, la date et si l’alias peut changer.
Résultats publiés et conditions déclarées par leurs sources. Les chiffres ne sont comparables que si la version, la configuration, la métrique et la date coïncident.
| Modèle | Organisation | Résultat | Métrique | Conditions |
|---|---|---|---|---|
| Claude Haiku 4.5 | Anthropic | 73,3 % | Résolu | Moyenne de 50 essais ; scaffold décrit par Anthropic. |
| Mistral Medium 3.5 | Mistral AI | 77,6 % | Résolu | Résultat publié par Mistral. |
| GPT‑4.1 | OpenAI | 54,6 % | Problèmes résolus publiés | Résultat ou évaluation publié par le fournisseur ; vérifiez la méthodologie et les conditions dans la source. |
| Qwen3‑Coder 480B A35B | Alibaba Qwen | Résultat SOTA ouvert publié | Problèmes logiciels résolus | Résultat ou évaluation publié par le fournisseur ; vérifiez la méthodologie et les conditions dans la source. |
Vérifiez l’identifiant du modèle, la date et si l’alias peut changer.
Vérifiez les outils, l’effort, le nombre d’essais, le prompt et le budget d’inférence.
Validez le résultat avec des tâches, langues, formats et erreurs représentatifs de votre produit.
Un benchmark public fournit une orientation, mais ne remplace pas une évaluation avec vos données, outils, budget et tolérance à l’erreur.
Un alias mobile et un snapshot peuvent produire des résultats différents. Consignez le modèle, la date et le fournisseur.
Le prompt, le raisonnement, les outils, le nombre de tentatives et le budget doivent être équivalents pour comparer.
Une petite différence peut disparaître d’une exécution à l’autre. Conservez les échantillons, la dispersion et les défaillances, pas seulement la moyenne.
Validez si l’amélioration se maintient dans différentes langues, formats et cas réels proches de votre produit.
Une métrique n'est utile que lorsque nous connaissons la tâche, les conditions et l'erreur importante. Le résultat commence par la conception du test.