VERIFIZIERTE ORGANISATION

Anthropic

Entdecke die dokumentierten Modelle, veröffentlichten Bewertungen und Primärquellen dieser Organisation.

01 / MODELLE

Verifizierter Katalog

02 / BEWERTUNGEN

Veröffentlichte Ergebnisse

Die Zahlen werden mit dem von der Quelle angegebenen Kontext dargestellt. Ein Anbieterergebnis ist kein unabhängiger Vergleich und ersetzt keine eigene Bewertung.

ModellBenchmarkErgebnisMetrik
Claude Opus 5Terminal-Bench Science 0.129,0 %Genauigkeit
Claude Opus 5CursorBench 3.270,0 %Genauigkeit
Claude Opus 5AutomationBench26,9 %Genauigkeit
Claude Fable 5.1Terminal-Bench Science 0.152,6 %Genauigkeit
Claude Fable 5.1CursorBench 3.273,4 %Genauigkeit
Claude Fable 5.1Humanity's Last Exam65,0 %Mit Werkzeugen
Claude Sonnet 5OSWorld-VerifiedKurve nach AufwandErfolg und Kosten
Claude Sonnet 5BrowseCompKurve nach AufwandGenauigkeit und Kosten
Claude Haiku 4.5SWE-bench Verified73,3 %Gelöst
Claude Haiku 4.5Terminal-Bench41,75 %Mit Schlussfolgern
Claude Opus 4.5Evaluaciones Claude Opus 4.5VeröffentlichtCode, Agenten und Computer
Claude Sonnet 4.5OSWorld61,4 %Gelöste Computeraufgaben
Claude Opus 5.5Terminal-Bench 4.066,4 %Genauigkeit
Claude Opus 5.5GDPval-AA v2.11.846Elo
Claude Sonnet 5.5Terminal-Bench 4.070,6 %Genauigkeit
03 / VERFAHREN

So liest du das Verzeichnis

Eine Organisation, ein Produkt und ein Modell sind nicht dieselbe Einheit. Inferama trennt sie, um Fähigkeiten oder kommerzielle Bedingungen nicht dem falschen Element zuzuschreiben.

01

Labor

Organisation, die das Modell entwickelt oder veröffentlicht und dessen technische und Sicherheitsdokumentation pflegt.

02

Modell

Identifizierbare Version mit Limits, Modalitäten und Verhalten, die sich zwischen Veröffentlichungen ändern können.

03

Zugangskanal

API, Anwendung, angebundene Cloud oder kommerzieller Tarif; jeder Kanal kann unterschiedliche Preise, Aufbewahrungsfristen und Limits haben.

04

Quelle und Datum

Zu jeder Aussage müssen die konsultierte offizielle Seite und das Prüfdatum festgehalten werden.

ANALYSE

Verwandte Analysen

Claude Sonnet 4.5 mit Tools: Berechne die Kosten einer Aufgabe, nicht nur eines Aufrufs
GUIA

Claude Sonnet 4.5 mit Tools: Berechne die Kosten einer Aufgabe, nicht nur eines Aufrufs

Eine Vorlage zur Schätzung der Kosten eines Tool-Workflows über mehrere Runden hinweg. Sie trennt Eingabe- und Ausgabetokens von zusätzlichen Gebühren und hilft, die Berechnung mit Nutzungsprotokollen abzugleichen.

28 Sep 2026
Claude Opus 4.5 bei längeren Aufgaben: Kosten pro abgeschlossener Arbeit berechnen
GUIA

Claude Opus 4.5 bei längeren Aufgaben: Kosten pro abgeschlossener Arbeit berechnen

Der Preis pro Million Tokens reicht nicht aus, um einen mehrstufigen Ablauf zu budgetieren. Erfahre, wie du Eingabe, Ausgabe, Cache, Wiederholungen und Prüfung zusammenzählst und vor dem Start Grenzen festlegst.

25 Sep 2026
Claude Sonnet 5: So messen Sie vor der Migration die Auswirkungen des neuen Tokenizers
ANALISIS

Claude Sonnet 5: So messen Sie vor der Migration die Auswirkungen des neuen Tokenizers

Anthropic zufolge kann derselbe Text mit Sonnet 5 in mehr Tokens umgewandelt werden als mit Sonnet 4.6. Mit einem eigenen Testkorpus lässt sich prüfen, ob das in einer konkreten Integration den nutzbaren Kontext oder die Kosten pro Aufgabe verändert.

23 Sep 2026
Claude Sonnet 4.5 in den Lebenswissenschaften: Was die Ergebnisse belegen – und wie sie sich erneut prüfen lassen
ANALISIS

Claude Sonnet 4.5 in den Lebenswissenschaften: Was die Ergebnisse belegen – und wie sie sich erneut prüfen lassen

Die Ergebnisse von Sonnet 4.5 bei Aufgaben der biologischen Forschung rechtfertigen eine interne Evaluierung, aber keine Schlussfolgerung über seine experimentelle Zuverlässigkeit. Was Protocol QA, LAB-Bench und BixBench messen, was sie nicht messen und wie sich eine kontrollierte retrospektive Prüfung gestalten lässt.

23 Sep 2026
Claude Haiku 4.5: So berechnen Sie die Kosten pro nutzbarer Antwort
GUIA

Claude Haiku 4.5: So berechnen Sie die Kosten pro nutzbarer Antwort

Der Preis pro API-Aufruf verrät nicht, was eine Antwort kostet, die Ihr Team tatsächlich verwenden kann. Dieser Leitfaden bietet eine nachvollziehbare Formel, die Eingabe- und Ausgabetokens, Wiederholungsversuche und Prüfung berücksichtigt – ergänzt durch drei beispielhafte Szenarien für Claude Haiku 4.5.

23 Sep 2026
Claude Opus 5 bei Desktop-Aufgaben: Welche Nachweise nötig sind, bevor man einer Oberfläche die Kontrolle überlässt
ANALISIS

Claude Opus 5 bei Desktop-Aufgaben: Welche Nachweise nötig sind, bevor man einer Oberfläche die Kontrolle überlässt

Ein Benchmark-Ergebnis belegt nicht, dass ein Modell eine Anwendung sicher bedienen kann. Wir schlagen eine begrenzte Evaluation vor, die Erfolg, Fehler, Wiederherstellung, Latenz und erforderliche Aufsicht misst.

23 Sep 2026
04 / QUELLEN

Rückverfolgbarkeit