Die Entscheidung lautet nicht, welches Modell besser ist, sondern welches Ergebnis jeder Workflow einkauft
Claude Haiku 4.5 und Claude Opus 5 decken innerhalb des Angebots von Anthropic unterschiedliche operative Anforderungen ab. Ein für Produkt, Engineering und Betrieb nützlicher Vergleich darf sich nicht darauf beschränken festzustellen, dass ein Modell leistungsfähiger ist oder ein anderes pro Token weniger kostet. Die maßgebliche Entscheidungseinheit muss die akzeptierte Aufgabe sein: eine Ausgabe, die funktionale und qualitative Anforderungen erfüllt, ohne dass eine menschliche Korrektur ihren Inhalt wesentlich verändert.
Der Preis pro Token bleibt relevant, weil er die Grenzkosten beeinflusst, fasst die Produktionskosten aber nicht zusammen. Eine günstige Antwort kann letztlich teurer sein, wenn Anfragen wiederholt, Formate validiert, Auslassungen korrigiert oder Fälle an ein Expertenteam eskaliert werden müssen. Umgekehrt kann eine anfangs teurere Antwort gerechtfertigt sein, wenn sie einen Compliance-Fehler verhindert, Ablehnungen nachweisbar verringert oder eine Prüfung löst, die sonst spezialisierte Intervention erfordern würde.
Für den beschriebenen Versuch wurden keine Ausführungen, kein Korpus, keine Tokenprotokolle, keine Latenzmessungen und keine menschlichen Bewertungen bereitgestellt. Dieser Artikel präsentiert daher keine empirische Rangfolge von Gewinnern und schreibt den beiden Modellen keine Qualitätsprozentsätze zu. Er beschreibt eine Methode zur Erzeugung dieser Evidenz und eine bedingte Entscheidungsmatrix. Jede Aussage über Überlegenheit bei einer konkreten Aufgabe muss den Ergebnissen unter diesem Verfahren vorbehalten bleiben.
Die verfügbare offizielle Dokumentation weist auf wesentliche Unterschiede hin, die das Versuchsdesign beeinflussen. Dazu gehören ein größeres Kontextfenster für Opus 5 als für Haiku 4.5, Fähigkeiten und Reasoning-Konfigurationen, die dokumentiert werden müssen, sowie Preisbedingungen, die je nach Zugangskanal, Modus und Caching-Mechanismen variieren können. Diese Unterschiede sind Teil der realen Entscheidung; sie können einen scheinbar symmetrischen Test aber auch unfair machen, wenn sie nicht offengelegt werden.
Was konstant bleiben muss und was zu protokollieren ist
Der Vergleich muss mit einem vor der Ausführung eingefrorenen Protokoll beginnen. Das Korpus braucht eine eindeutig identifizierbare Version, ohne während der Bewertung hinzugefügte Elemente. Ebenfalls konstant bleiben müssen, soweit dies mit beiden Modellen vereinbar ist, die Systemnachricht, die Aufgabenanweisung, angehängte Dokumente, verfügbare Werkzeuge, das Ausgabeschema, das Ausgabelimit und die Richtlinie für Wiederholungsversuche.
Wörtlich identische Parameter bedeuten nicht immer funktionale Gleichheit. Wenn ein Modell Reasoning-, Aufwands- oder strukturierte-Ausgabe-Optionen mit unterschiedlicher Semantik bietet, muss das Protokoll die Konfiguration jedes Arms beschreiben und begründen, weshalb sie eine angemessene Produktionsnutzung darstellt. Eine wesentliche Fähigkeit eines Modells sollte nicht nur für nominelle Symmetrie deaktiviert werden; ebenso sollten Fähigkeiten nicht nur in einem Arm aktiviert werden, ohne ihre Wirkung auf Qualität, Latenz und Abrechnung offenzulegen.
Für jede Ausführung sind die exakten Modellkennungen, Datum und Uhrzeit, die geltende Region oder Datenresidenz, der Anbieter oder API-Zugangskanal, die Parameter, die Fallkennung, die vollständige Antwort, der Beendigungsgrund, die abgerechneten Tokens und die Ende-zu-Ende-Latenz zu speichern. Der aktive Status eines Handelsnamens reicht nicht aus: Konkrete Snapshots oder Kennungen sind erforderlich, weil Modelle aktualisiert oder eingestellt werden können.
Das Kontextfenster verlangt eine ausdrückliche Regel. Passen alle Fälle in das Limit von Haiku 4.5, können beide Modelle denselben Vorgang ohne Kürzung verarbeiten. Überschreiten einige Fälle dieses Limit, passen aber in Opus 5, sind zwei unterschiedliche Bewertungen valide: ein Vergleich auf einer gemeinsamen Teilmenge und eine operative Bewertung, die anerkennt, dass Haiku Fragmentierung, dokumentenbasierte Retrieval-Verfahren oder einen anderen Hilfsmechanismus benötigt. Diese Differenz zu verschweigen würde die Ergebnisse schwer interpretierbar machen.
Mindestprotokoll pro Ausführung
| Element | Was erfasst wird | Warum es wichtig ist |
|---|---|---|
| Modell | Exakte Kennung oder exakter Snapshot und Zugangskanal | Ermöglicht die Wiederholung des Tests und das Erkennen späterer Änderungen. |
| Konfiguration | Anweisungen, Werkzeuge, Format, Limits, Reasoning und Wiederholungsrichtlinie | Verhindert, dass Unterschiede aus dem Request-Design dem Modell zugeschrieben werden. |
| Kosten | Eingabe-, Ausgabe-, Cache- und Wiederholungstokens; angewandter Tarif | Ermöglicht die Berechnung effektiver statt nur nominaler Kosten. |
| Ergebnis | Akzeptanz, Fehlertyp, Bearbeitungsbedarf und verblindete Bewertung | Verbindet Ausgaben mit überprüfbarem Nutzen. |
| Zeit | Beginn, Ende und Ende-zu-Ende-Latenz | Trennt mögliche Qualität von der operativen Erfahrung. |
Reproduzierbares Protokoll vor der Messung
- 01Akzeptanzkriterien und eine Fehlertaxonomie definieren, bevor Antworten vorliegen.
- 02Korpus, Vorlagen, Ausgabeschema, Werkzeugsatz und Validierungsschwellen einfrieren.
- 03Jeden Fall mit randomisierter Reihenfolge in beiden Modellen ausführen und bei Variabilität mehrfach wiederholen.
- 04Die Ausgaben bewerten, ohne den Bewertenden zu zeigen, welches Modell sie erzeugt hat.
- 05Akzeptanzraten, Wiederholungsversuche, Latenz, Verbrauch und Kosten pro akzeptiertem Ergebnis berechnen.
- 06Aggregierte Daten und methodische Entscheidungen veröffentlichen, damit Unterschiede interpretiert werden können.
Test 1: regelbasierte Klassifikation und strukturierte Extraktion
Die erste Arbeitslast sollte Vorgänge abbilden, bei denen Volumen und Konsistenz entscheidend sind: Tickets routen, Dokumente taggen, Felder aus Formularen extrahieren oder feststellen, ob ein Fall explizite Bedingungen erfüllt. Der Datensatz sollte gewöhnliche Beispiele, unvollständige Eingaben, Grenzfälle zwischen Kategorien, interne Widersprüche und Fälle enthalten, die wegen unzureichender Evidenz abgelehnt werden müssen.
Die Bewertung darf sich nicht darauf beschränken, ob eine Antwort plausibel wirkt. Sie muss Feldgenauigkeit, Übereinstimmung der Klassifikation, syntaktische Gültigkeit der Ausgabe, Schema-Konformität und korrekte Ablehnung messen. Insbesondere darf ein valides JSON, das einen erforderlichen Wert erfindet, nicht als Erfolg gelten. Wenn der Produktionsworkflow nach einem Schemafehler eine automatische Reparatur zulässt, muss diese Reparatur als Wiederholungsversuch erfasst und in die Kosten einbezogen werden.
Die bereitgestellten Prompting-Leitlinien empfehlen, das Ausgabeformat präzise festzulegen und strukturierte Ausgaben oder Werkzeuge mit Aufzählungswerten für Klassifikationsaufgaben einzusetzen. Dies begünstigt ein Design, in dem das Modell die Form der Antwort nicht erraten muss. Es ersetzt jedoch nicht die Validierung der Werte gegenüber den Quellen des jeweiligen Falls.
In dieser Aufgabe ist Haiku 4.5 eine rationale Entscheidung, wenn es die vereinbarte Akzeptanzrate hält, seine Kosten pro akzeptiertem Fall niedriger sind und seine Fehler deterministisch erkennbar bleiben. Opus 5 ist gerechtfertigt, wenn es semantische Fehler, die der Validator nicht erkennt, falsche Ablehnungen oder menschlichen Debugging-Aufwand ausreichend reduziert. Diese Schlussfolgerung kann nur aus Daten realer oder repräsentativer Fälle gezogen werden.
Test 2: quellentreue Dokumentensynthese mit interner Evidenz
Die zweite Arbeitslast muss eine andere Fähigkeit messen: einen Dokumentensatz in eine Synthese zu überführen, die relevante Anforderungen, Bedingungen, Ausnahmen und Meinungsverschiedenheiten bewahrt. Das Ziel ist nicht, längere Texte oder überzeugenderen Stil zu belohnen, sondern zu prüfen, ob jede wichtige Behauptung mit Abschnitten des im Vorgang bereitgestellten Materials verknüpft werden kann.
Das Korpus sollte kohärente Dokumente ebenso mischen wie Dokumente mit Lücken oder Abweichungen. Es sollte Anforderungen aus Anhängen, Definitionen mit begrenztem Geltungsbereich, unvereinbare Daten oder Versionen und Fragen enthalten, die sich mit der verfügbaren Evidenz nicht beantworten lassen. So lassen sich Abdeckung, kritische Auslassungen, unbelegte Zuschreibungen und das Verhalten bei Unsicherheit messen.
Eine praxistaugliche Rubrik trennt vier Dimensionen: Abdeckung der Anforderungen, Treue der Zuschreibungen, Umgang mit Konflikten und Nutzen der Endstruktur. Die Bewertenden sollten über eine Referenzantwort oder eine Liste überprüfbarer Aussagen verfügen; die Qualitätsprüfung muss jedoch hinsichtlich des Modells verblindet sein. Wenn die Synthese Unsicherheit korrekt benennt, darf sie nicht dafür bestraft werden, eine in den Quellen vorhandene Mehrdeutigkeit nicht aufzulösen.
Das für Opus 5 angekündigte größere Kontextfenster kann relevant sein, wenn der vollständige Vorgang nicht in das Limit von Haiku 4.5 passt. Dennoch darf nicht angenommen werden, dass ein größeres Kontextfenster automatisch zu einer treueren Synthese führt. Der Test muss die Vorteile der Verarbeitung von mehr Dokumentation von Vorteilen trennen, die aus dem Verhalten des Modells selbst entstehen. Deshalb empfiehlt es sich, sowohl eine gemeinsame Teilmenge als auch umfangreiche Vorgänge zu messen, die für Haiku eine zusätzliche Strategie erfordern.
Fehler, die die Rubrik unterscheiden muss
| Ergebnistyp | Beispiel für die Bewertung | Behandlung |
|---|---|---|
| Kritische Auslassung | Eine Ausnahme wird nicht erwähnt, obwohl sie eine zentrale Verpflichtung verändert. | Nicht akzeptiert, wenn dies die operative Entscheidung verändert. |
| Unbelegte Zuschreibung | Eine nicht im Vorgang enthaltene Interpretation wird als Anforderung dargestellt. | Nicht akzeptiert; die Behauptung und die fehlende Evidenz erfassen. |
| Erkannter Konflikt | Zwei unvereinbare Anforderungen werden dargestellt und eine Entscheidung oder Eskalation wird verlangt. | Akzeptiert, wenn der Vorgang getreu wiedergegeben wird. |
| Korrekte Unsicherheit | Es wird angegeben, dass die Dokumente eine Schlussfolgerung zu einem Punkt nicht zulassen. | Akzeptiert, wenn keine ausreichende Evidenz vorlag. |
| Verbesserungsfähiger Stil | Wenig prägnante Formulierung ohne Verlust an Treue. | Kann eine Bearbeitung erfordern, muss aber von einem sachlichen Fehler getrennt werden. |
Test 3: komplexe Prüfung mit widersprüchlichen Anweisungen
Der dritte Test sollte technische Änderungen, Compliance-Vorgänge, Richtlinienprüfungen oder operative Vorschläge abbilden, bei denen die Anweisungen mehrere und teilweise gegensätzliche Einschränkungen enthalten. Das Modell muss Konflikte erkennen, die vom Protokoll festgelegten Einschränkungen priorisieren und erläutern, welche Informationen für eine sichere Empfehlung fehlen.
Die Fälle müssen Einschränkungen verschiedener Art enthalten: funktionale Anforderungen, Kompatibilität, Sicherheit, Fristen, Änderungsgrenzen und Freigabebedingungen. Es ist wichtig, absichtliche Konflikte einzubeziehen, nicht jedoch bösartige Anweisungen oder Daten, die nicht verantwortungsvoll bewertet werden können. Die erwartete Antwort muss nicht immer eine vollständige Lösung sein: In manchen Fällen besteht das korrekte Ergebnis darin, einen Konflikt zu identifizieren, von einer Handlungsempfehlung abzusehen oder die Entscheidung an eine verantwortliche Person zu eskalieren.
Die Bewertung muss die Einhaltung von Einschränkungen, die Erkennung von Unvereinbarkeiten, die Genauigkeit der Empfehlungen und den Bedarf an menschlicher Eskalation bewerten. Nützlichkeit bedeutet nicht, einen Vorschlag vorbehaltlos zu akzeptieren. Eine Empfehlung, die entschieden wirkt, aber ein ausdrückliches Verbot ignoriert, ist schlechter als eine Antwort, die ihre Unsicherheit abgrenzt und die nötige Genehmigung anfordert.
Dies ist die Arbeitslast, bei der ein Kapazitätsaufschlag den größten Wert schaffen könnte, da die Kosten eines Fehlers hoch sein können und automatische Validierung meist unvollständig ist. Daraus folgt jedoch nicht, dass Opus 5 immer verwendet werden sollte. Wenn Fälle in unabhängige Prüfungen zerlegt werden, Regeln kodifiziert sind und menschliche Überprüfung ohnehin verpflichtend ist, kann ein kostengünstigeres Modell als erste Schicht genügen. Der Versuch muss die Kombination aus Modell, Validatoren und Überprüfung messen, nicht das Modell isoliert in einem Vakuum.
Sichere Eskalation bei Prüfungen mit hoher Auswirkung
- 01Explizite Einschränkungen und ihre Quelle innerhalb des Vorgangs extrahieren.
- 02Unvereinbarkeiten anhand einer validierbaren Regelliste prüfen.
- 03Verlangen, dass die Antwort Evidenz, Annahmen und ungelöste Konflikte ausweist.
- 04Jeden Fall mit wesentlichem Konflikt, unzureichender Evidenz oder hoher Auswirkung zur menschlichen Prüfung senden.
- 05Erfassen, ob die prüfende Person die Empfehlung akzeptiert, verändert oder ablehnt, sowie die aufgewendete Zeit.
So werden die Kosten pro korrekt abgeschlossener Aufgabe berechnet
Die zentrale Kennzahl sind die effektiven Kosten pro akzeptiertem Ergebnis. Ihr Zähler summiert den Betrag der Anfragen, die nötig sind, um den Fallsatz abzuschließen: Eingabe- und Ausgabetokens, gegebenenfalls Cache-Nutzung, dem Reasoning zugeordnete Tokens, wenn sie abrechenbar sind, automatische Wiederholungsversuche und unverzichtbare Hilfsaufrufe. Enthält der Workflow menschliche Prüfung, müssen die im Protokoll definierten Kosten dieser Prüfung mit einem ausgewiesenen Tarif und einer Zeitregel ergänzt werden.
Der Nenner ist weder die Gesamtzahl der Anfragen noch die Anzahl der Antworten, die Text zurückgeben. Er ist die Zahl der nach der Rubrik akzeptierten Fälle. Wenn eine geringfügige menschliche Bearbeitung zulässig ist, muss das Protokoll festlegen, was geringfügig bedeutet. Eine Korrektur der Zeichensetzung könnte beispielsweise weiterhin als mit Bearbeitung akzeptiert zählen; das Hinzufügen einer ausgelassenen Anforderung oder das Entfernen einer unbelegten Behauptung muss als wesentliche Änderung gelten.
Zusätzlich müssen Median und ein hohes Perzentil der Ende-zu-Ende-Latenz veröffentlicht werden, nicht nur der Durchschnitt. Durchschnittswerte können Warteschlangen am Rand der Verteilung verdecken, die interaktive Oberflächen oder Service-Level-Vereinbarungen beeinträchtigen. Die Latenz ist vom Absenden der Anfrage durch den Client bis zum Empfang und zur Validierung der Ausgabe zu messen; es ist anzugeben, ob sie Wiederholungsversuche und Werkzeuge umfasst.
Offizielle Tarife und Preisfaktoren erfordern eine datierte Erfassung des verwendeten Kanals. Ein Vergleich durch Dritte kann als methodischer Kontext dienen, ersetzt jedoch nicht das Abrechnungsprotokoll des Versuchs: Er kann sich auf andere Reasoning- oder Aufwandskonfigurationen als die hier gewählten beziehen. Ökonomische Schlussfolgerungen müssen auf den tatsächlich gemessenen Modus begrenzt bleiben.
Entscheidungsmatrix und Grenzen der Evidenz
Die endgültige Wahl sollte pro Workflow erfolgen, nicht für die gesamte Organisation. Klassifikationen mit hohem Volumen und geringer Auswirkung, strikten Schemata und robusten Validatoren sind Kandidaten für Haiku 4.5, wenn der Test eine ausreichende Akzeptanzrate bestätigt. Dokumentensynthesen aus Vorgängen, die in den gemeinsamen Kontext passen, können ebenfalls mit Haiku beginnen, wenn Auslassungen durch angemessene Prüfung erkennbar sind. In beiden Fällen ist die Ersparnis nur dann real, wenn sie nicht in Form von Wiederholungsversuchen oder menschlicher Prüfung zurückkehrt.
Opus 5 verdient eine vorrangige Bewertung bei Vorgängen, die ein größeres Kontextfenster benötigen, bei Prüfungen mit voneinander abhängigen Einschränkungen oder bei Aufgaben, in denen ein semantischer Fehler kostspielig und schwer automatisch zu erkennen ist. Auch in diesen Situationen muss die Entscheidung von der beobachteten Differenz bei Akzeptanz und Gesamtkosten abhängen, nicht von der Modellbezeichnung oder einem Benchmark mit einem anderen Korpus.
Die Ergebnisse unterliegen Grenzen der Übertragbarkeit. Ein internes Korpus, eine bestimmte Vorlage, eine Sprache, eine Region, ein Zugangskanal und eine Wiederholungsrichtlinie können das Ergebnis verändern. Ausführungen müssen nach Änderungen an Snapshot, Preisen, Limits oder Produktmechanismen wiederholt werden. Die Dokumentation zu Einstellungen ist besonders wichtig, damit Schlussfolgerungen nicht auf zurückgezogenen Kennungen beruhen.
Die zentrale Unsicherheit dieses Vergleichs ist empirisch: Die bereitgestellten Quellen beschreiben Fähigkeiten, Preise und Plattformbedingungen, enthalten aber nicht die Ergebnisse der drei vorgeschlagenen Tests. Bis ein Satz reproduzierbarer Messungen veröffentlicht wird, lautet die angemessene Empfehlung, einen begrenzten Test umzusetzen, Akzeptanzschwellen festzulegen und nach Risikostufen auszurollen.
Vorläufige Entscheidung nach Workflow-Typ
| Workflow | Zunächst zu prüfende Option | Bedingung für die Beibehaltung | Wann eskalieren |
|---|---|---|---|
| Strukturierte, validierbare Klassifikation | Haiku 4.5 | Die Akzeptanzrate erfüllt die Schwelle und Fehler werden automatisch erkannt. | Häufige semantische Fehler oder Wiederholungskosten übersteigen die Ersparnis. |
| Dokumentensynthese innerhalb des gemeinsamen Kontexts | Haiku 4.5 und verblindete Vergleichsbewertung | Abdeckung und Treue erreichen die Schwelle mit angemessenem Prüfaufwand. | Kritische Auslassungen, unbelegte Zuschreibungen oder Vorgänge über dem gemeinsamen Limit. |
| Sehr umfangreiche Vorgänge | Opus 5 | Der zusätzliche Kontext verhindert Fragmentierung oder Evidenzverlust und verbessert die Kosten pro akzeptiertem Fall. | Eine Retrieval- oder Segmentierungsstrategie zeigt gleichwertige Ergebnisse zu geringeren Kosten. |
| Komplexe technische oder Compliance-Prüfung | Opus 5 als Referenzarm | Die Verbesserung der Akzeptanz oder die Verringerung des Prüfaufwands kompensiert den Aufschlag. | Deterministische Regeln und menschliche Eskalation machen ein kostengünstigeres Modell ausreichend. |
Offene Fragen
- Es wurden kein Korpus, keine Ausgaben, keine Anzahl an Ausführungen, keine menschlichen Bewertungen, keine Latenzen und keine Rechnungen des Experiments bereitgestellt; quantitative Ergebnisse oder ein beobachteter Vorteil lassen sich nicht berichten.
- Tarife, Limits, Snapshots, regionale Verfügbarkeit und Reasoning-Optionen können sich ändern; sie müssen unmittelbar vor der Ausführung geprüft und datiert werden.
- Der Modellvergleich kann seine Symmetrie verlieren, wenn ein Vorgang den Kontext von Haiku 4.5 überschreitet; in diesem Fall müssen sowohl eine gemeinsame als auch eine operative Bewertung berichtet werden.
- Ergebnisse aus einem Korpus, einer Sprache, einer Vorlage und einem Zugangskanal lassen sich nicht automatisch auf andere Workflows übertragen.
Weiter entdecken
Verwendete Quellen
Korrekturen und Transparenz
Wenn du falsche oder veraltete Angaben findest, sende uns die Seite und die zu prüfende Quelle.
Korrektur vorschlagen