Version exacte
Vérifiez l’identifiant du modèle, la date et si l’alias peut changer.
Résultats publiés et conditions déclarées par leurs sources. Les chiffres ne sont comparables que si la version, la configuration, la métrique et la date coïncident.
| Modèle | Organisation | Résultat | Métrique | Conditions |
|---|---|---|---|---|
| GPT‑5.6 Sol | OpenAI | 52,7 % | Exactitude | Tableau officiel de GPT‑5.6. |
| GPT‑5.6 Terra | OpenAI | 50,4 % | Exactitude | Tableau officiel de GPT‑5.6. |
| GPT‑5.6 Luna | OpenAI | 50,3 % | Exactitude | Tableau officiel de GPT‑5.6. |
Vérifiez l’identifiant du modèle, la date et si l’alias peut changer.
Vérifiez les outils, l’effort, le nombre d’essais, le prompt et le budget d’inférence.
Validez le résultat avec des tâches, langues, formats et erreurs représentatifs de votre produit.
Un benchmark public fournit une orientation, mais ne remplace pas une évaluation avec vos données, outils, budget et tolérance à l’erreur.
Un alias mobile et un snapshot peuvent produire des résultats différents. Consignez le modèle, la date et le fournisseur.
Le prompt, le raisonnement, les outils, le nombre de tentatives et le budget doivent être équivalents pour comparer.
Une petite différence peut disparaître d’une exécution à l’autre. Conservez les échantillons, la dispersion et les défaillances, pas seulement la moyenne.
Validez si l’amélioration se maintient dans différentes langues, formats et cas réels proches de votre produit.
Une métrique n'est utile que lorsque nous connaissons la tâche, les conditions et l'erreur importante. Le résultat commence par la conception du test.
AutomationBench évalue la capacité d’un agent à mener à bien des workflows entre applications SaaS simulées et à les amener à un état final vérifiable. Ce guide explique ce que cette preuve signifie, comment lire ses métriques et quels tests supplémentaires sont nécessaires avant d’extrapoler un résultat à une entreprise réelle.
22 sept. 2026 ↗ PAPERAgents’ Last Exam évalue des agents sur des tâches professionnelles dans des environnements de système d’exploitation, avec des résultats vérifiables. Sa conception est utile pour étudier l’exécution de flux de travail, mais un chiffre agrégé de réussite ne démontre pas qu’un emploi peut être automatisé. Pour l’interpréter, il faut connaître les tâches, l’environnement, le harness, le modèle, les outils, le budget et la version évaluée.
22 sept. 2026 ↗