Laboratoire
Entité qui développe ou publie le modèle et maintient sa documentation technique et de sécurité.
Consultez les modèles documentés, les évaluations publiées et les sources primaires associées à cette organisation.
Modèle orienté vers le travail de code et de connaissances, avec des contrôles qui permettent d'ajuster l'effort à chaque tâche.
16 SEPT. 2026↗ RAISONNEMENT PROLONGÉRaisonnement et agents de longue durée.
16 SEPT. 2026↗ ÉQUILIBRE COÛT/CAPACITÉCode, recherche et flux professionnels avec outils.
16 SEPT. 2026↗ HAUTE EFFICACITÉVolume élevé, sous-agents et extraction structurée.
16 SEPT. 2026↗ FRONTIÈRE ANTÉRIEURE · AGENTSVersion antérieure d’Opus orientée vers le code, les agents et l’utilisation d’ordinateur, conservée pour la migration et la comparaison historique.
18 SEPT. 2026↗ AGENTS ET UTILISATION D’ORDINATEURGénération Sonnet antérieure pour le code, les agents et l’automatisation d’interfaces, avec des résultats officiels de computer use.
18 SEPT. 2026↗ PROGRAMMATION AGENTIQUE ET TRAVAIL INTELLECTUELNouvelle génération Opus pour le codage agentique, l’utilisation de l’ordinateur et le travail professionnel de longue durée, avec une fenêtre de contexte d’un million de tokens.
29 SEPT. 2026↗ INTELLIGENCE ET VITESSE ÉQUILIBRÉESMise à jour de Sonnet pour les tâches quotidiennes, le code et les documents, avec une vitesse accrue et un million de jetons de contexte.
29 SEPT. 2026↗Les chiffres sont présentés avec le contexte communiqué par leur source. Un résultat du fournisseur n’est pas une comparaison indépendante et ne remplace pas votre propre évaluation.
| Modèle | Benchmark | Résultat | Métrique |
|---|---|---|---|
| Claude Opus 5 | Terminal-Bench Science 0.1 | 29,0 % | Exactitude |
| Claude Opus 5 | CursorBench 3.2 | 70,0 % | Exactitude |
| Claude Opus 5 | AutomationBench | 26,9 % | Exactitude |
| Claude Fable 5.1 | Terminal-Bench Science 0.1 | 52,6 % | Exactitude |
| Claude Fable 5.1 | CursorBench 3.2 | 73,4 % | Exactitude |
| Claude Fable 5.1 | Humanity's Last Exam | 65,0 % | Avec outils |
| Claude Sonnet 5 | OSWorld-Verified | Courbe selon l’effort | Réussite et coût |
| Claude Sonnet 5 | BrowseComp | Courbe selon l’effort | Exactitude et coût |
| Claude Haiku 4.5 | SWE-bench Verified | 73,3 % | Résolu |
| Claude Haiku 4.5 | Terminal-Bench | 41,75 % | Avec raisonnement |
| Claude Opus 4.5 | Evaluaciones Claude Opus 4.5 | Publiées | Code, agents et ordinateur |
| Claude Sonnet 4.5 | OSWorld | 61,4 % | Tâches informatiques résolues |
| Claude Opus 5.5 | Terminal-Bench 4.0 | 66,4 % | Exactitude |
| Claude Opus 5.5 | GDPval-AA v2.1 | 1.846 | Elo |
| Claude Sonnet 5.5 | Terminal-Bench 4.0 | 70,6 % | Exactitude |
Une organisation, un produit et un modèle ne constituent pas la même unité. Inferama les distingue afin d’éviter d’attribuer des capacités ou des conditions commerciales au mauvais élément.
Entité qui développe ou publie le modèle et maintient sa documentation technique et de sécurité.
Version identifiable avec des limites, des modalités et un comportement susceptibles de changer entre les lancements.
API, application, cloud associé ou offre commerciale ; chaque canal peut avoir des tarifs, une rétention et des limites différents.
Chaque affirmation doit conserver la page officielle consultée et la date de vérification.
Un modèle pour estimer le coût d’un flux d’outils par cycle, distinguer les tokens d’entrée et de sortie des frais supplémentaires, puis confronter le calcul aux données d’utilisation.
28 sept. 2026 ↗ GUIAUn tarif par million de tokens ne suffit pas pour budgéter un flux en plusieurs étapes. Apprenez à additionner l’entrée, la sortie, le cache, les nouvelles tentatives et la révision, puis à fixer des limites avant l’exécution.
25 sept. 2026 ↗ ANALISISAnthropic indique qu’un même texte peut être converti en davantage de tokens avec Sonnet 5 qu’avec Sonnet 4.6. Un protocole fondé sur votre propre corpus permet de vérifier si cela réduit le contexte utile ou modifie le coût par tâche dans une intégration donnée.
23 sept. 2026 ↗ ANALISISLes scores de Sonnet 4.5 sur des tâches de recherche biologique justifient une évaluation interne, pas une conclusion sur sa fiabilité expérimentale. Que mesurent Protocol QA, LAB-Bench et BixBench, que ne mesurent-ils pas, et comment concevoir un test rétrospectif contrôlé ?
23 sept. 2026 ↗ GUIALe tarif par appel ne suffit pas à révéler le coût d’une réponse acceptée par l’équipe. Ce guide présente une formule reproductible qui additionne les tokens d’entrée et de sortie, les nouvelles tentatives et la révision, ainsi que trois scénarios illustratifs pour Claude Haiku 4.5.
23 sept. 2026 ↗ ANALISISUn score de benchmark ne prouve pas qu’un modèle sait utiliser une application en toute sécurité. Nous proposons une évaluation circonscrite pour mesurer la réussite, les erreurs, la récupération, la latence et le besoin de supervision.
23 sept. 2026 ↗