Labor
Organisation, die das Modell entwickelt oder veröffentlicht und dessen technische und Sicherheitsdokumentation pflegt.
Entdecke die dokumentierten Modelle, veröffentlichten Bewertungen und Primärquellen dieser Organisation.
Auf Code- und Wissensarbeit ausgerichtetes Modell mit Steuerelementen, die eine Anpassung des Aufwands an jede Aufgabe ermöglichen.
16 SEP 2026↗ LANG ANDAUERNDES SCHLUSSFOLGERNLang andauerndes Schlussfolgern und Agenten.
16 SEP 2026↗ AUSGEWOGENES KOSTEN-LEISTUNGS-VERHÄLTNISCode, Recherche und professionelle Abläufe mit Werkzeugen.
16 SEP 2026↗ HOHE EFFIZIENZHohes Volumen, Unteragenten und strukturierte Extraktion.
16 SEP 2026↗ FRÜHERE FRONTIER-GENERATION · AGENTENFrühere Opus-Version für Code, Agenten und Computernutzung, beibehalten für Migration und historischen Vergleich.
18 SEP 2026↗ AGENTEN UND COMPUTERNUTZUNGFrühere Sonnet-Generation für Code, Agenten und Schnittstellenautomatisierung mit offiziellen Ergebnissen für Computernutzung.
18 SEP 2026↗ AGENTISCHES PROGRAMMIEREN UND WISSENSARBEITOpus der nächsten Generation für agentisches Programmieren, Computernutzung und längere professionelle Arbeit mit einem Kontext von einer Million Tokens.
29 SEP 2026↗ AUSGEWOGENE INTELLIGENZ UND GESCHWINDIGKEITSonnet-Update für alltägliche Aufgaben, Code und Dokumente – mit höherer Geschwindigkeit und einer Million Token Kontext.
29 SEP 2026↗Die Zahlen werden mit dem von der Quelle angegebenen Kontext dargestellt. Ein Anbieterergebnis ist kein unabhängiger Vergleich und ersetzt keine eigene Bewertung.
| Modell | Benchmark | Ergebnis | Metrik |
|---|---|---|---|
| Claude Opus 5 | Terminal-Bench Science 0.1 | 29,0 % | Genauigkeit |
| Claude Opus 5 | CursorBench 3.2 | 70,0 % | Genauigkeit |
| Claude Opus 5 | AutomationBench | 26,9 % | Genauigkeit |
| Claude Fable 5.1 | Terminal-Bench Science 0.1 | 52,6 % | Genauigkeit |
| Claude Fable 5.1 | CursorBench 3.2 | 73,4 % | Genauigkeit |
| Claude Fable 5.1 | Humanity's Last Exam | 65,0 % | Mit Werkzeugen |
| Claude Sonnet 5 | OSWorld-Verified | Kurve nach Aufwand | Erfolg und Kosten |
| Claude Sonnet 5 | BrowseComp | Kurve nach Aufwand | Genauigkeit und Kosten |
| Claude Haiku 4.5 | SWE-bench Verified | 73,3 % | Gelöst |
| Claude Haiku 4.5 | Terminal-Bench | 41,75 % | Mit Schlussfolgern |
| Claude Opus 4.5 | Evaluaciones Claude Opus 4.5 | Veröffentlicht | Code, Agenten und Computer |
| Claude Sonnet 4.5 | OSWorld | 61,4 % | Gelöste Computeraufgaben |
| Claude Opus 5.5 | Terminal-Bench 4.0 | 66,4 % | Genauigkeit |
| Claude Opus 5.5 | GDPval-AA v2.1 | 1.846 | Elo |
| Claude Sonnet 5.5 | Terminal-Bench 4.0 | 70,6 % | Genauigkeit |
Eine Organisation, ein Produkt und ein Modell sind nicht dieselbe Einheit. Inferama trennt sie, um Fähigkeiten oder kommerzielle Bedingungen nicht dem falschen Element zuzuschreiben.
Organisation, die das Modell entwickelt oder veröffentlicht und dessen technische und Sicherheitsdokumentation pflegt.
Identifizierbare Version mit Limits, Modalitäten und Verhalten, die sich zwischen Veröffentlichungen ändern können.
API, Anwendung, angebundene Cloud oder kommerzieller Tarif; jeder Kanal kann unterschiedliche Preise, Aufbewahrungsfristen und Limits haben.
Zu jeder Aussage müssen die konsultierte offizielle Seite und das Prüfdatum festgehalten werden.
Eine Vorlage zur Schätzung der Kosten eines Tool-Workflows über mehrere Runden hinweg. Sie trennt Eingabe- und Ausgabetokens von zusätzlichen Gebühren und hilft, die Berechnung mit Nutzungsprotokollen abzugleichen.
28 Sep 2026 ↗ GUIADer Preis pro Million Tokens reicht nicht aus, um einen mehrstufigen Ablauf zu budgetieren. Erfahre, wie du Eingabe, Ausgabe, Cache, Wiederholungen und Prüfung zusammenzählst und vor dem Start Grenzen festlegst.
25 Sep 2026 ↗ ANALISISAnthropic zufolge kann derselbe Text mit Sonnet 5 in mehr Tokens umgewandelt werden als mit Sonnet 4.6. Mit einem eigenen Testkorpus lässt sich prüfen, ob das in einer konkreten Integration den nutzbaren Kontext oder die Kosten pro Aufgabe verändert.
23 Sep 2026 ↗ ANALISISDie Ergebnisse von Sonnet 4.5 bei Aufgaben der biologischen Forschung rechtfertigen eine interne Evaluierung, aber keine Schlussfolgerung über seine experimentelle Zuverlässigkeit. Was Protocol QA, LAB-Bench und BixBench messen, was sie nicht messen und wie sich eine kontrollierte retrospektive Prüfung gestalten lässt.
23 Sep 2026 ↗ GUIADer Preis pro API-Aufruf verrät nicht, was eine Antwort kostet, die Ihr Team tatsächlich verwenden kann. Dieser Leitfaden bietet eine nachvollziehbare Formel, die Eingabe- und Ausgabetokens, Wiederholungsversuche und Prüfung berücksichtigt – ergänzt durch drei beispielhafte Szenarien für Claude Haiku 4.5.
23 Sep 2026 ↗ ANALISISEin Benchmark-Ergebnis belegt nicht, dass ein Modell eine Anwendung sicher bedienen kann. Wir schlagen eine begrenzte Evaluation vor, die Erfolg, Fehler, Wiederherstellung, Latenz und erforderliche Aufsicht misst.
23 Sep 2026 ↗