Das Problem ist nicht die Wahl eines kleinen Modells, sondern die Erhaltung eines operativen Vertrags
Die Einstellung von Claude Haiku 3.5 erfordert mehr als eine Überprüfung der scheinbaren Qualität von Antworten. Anthropic dokumentiert, dass die Haiku-3.5-Kennung seit dem 19. Februar 2026 nicht mehr verfügbar ist, und empfiehlt Claude Haiku 4.5 als Ersatz. Diese Empfehlung macht Haiku 4.5 zu einem plausiblen Kandidaten für eine Bewertung, beweist aber nicht, dass es in einer konkreten Anwendung austauschbar ist.
Ein Team, das Anfragen klassifiziert, Felder extrahiert, Menschen in Echtzeit unterstützt oder Subagenten mit begrenztem Umfang ausführt, nutzt nicht nur ein Modell. Es nutzt eine Kombination aus Kennung, Zugangsprovider, Region oder Endpoint, SDK, Generierungsparametern, System-Prompt, Tools, Validator, Retry-Strategie und Zeitbudget. Schon die Änderung einer dieser Komponenten kann das beobachtete Ergebnis verändern.
Die Migrationseinheit muss deshalb der vollständige Ablauf sein. Eine Änderung, die die durchschnittliche Genauigkeit erhält, aber die Wartezeit erhöht oder den Anteil der Dokumente mit erforderlicher JSON-Reparatur steigert, kann den Dienst verschlechtern. Ebenso garantiert eine schnellere Modellantwort keine bessere End-to-End-Latenz, wenn der gewählte Kanal, ein externes Tool oder ein Retry den verfügbaren Spielraum aufbraucht.
Diese Analyse konzentriert sich darauf, ob Haiku 4.5 einen steuerbaren schnellen Pfad tragen kann. Sie soll weder belegen, dass es einem leistungsfähigeren Modell überlegen ist, noch Benchmark-Ergebnisse auf einen Produktions-Workload übertragen. Die entscheidende Evidenz für diese Entscheidung entsteht aus reproduzierbaren Tests des Teams mit dem eigenen Traffic, den eigenen Schemata und Abhängigkeiten.
Lebenszyklusstatus: Ein Mindestdatum ist kein offenes Versprechen
Die Deprecation-Dokumentation von Anthropic führt `claude-haiku-4-5-20251001` in der direkten API als aktiv auf und besagt, dass die Einstellung nicht vor dem 15. Oktober 2026 erfolgt. Diese Formulierung ist wesentlich: Sie setzt eine untere Grenze für die Aufbewahrung, aber weder ein bestätigtes Einstellungsdatum noch eine Verfügbarkeitsgarantie nach diesem Tag.
Zum Stichtag 22. September 2026 kann die Kennung auf Grundlage der bereitgestellten Dokumentation daher als verfügbar gelten. Sie sollte jedoch als Abhängigkeit mit nahendem Prüfzeitraum behandelt werden. Ein System, das „nicht vor“ als „bleibt verfügbar“ übersetzt, führt eine durch diese Quelle nicht gedeckte Annahme ein.
Google Cloud nennt für Claude Haiku 4.5 in seinem Katalog der Partner-Modelle ebenfalls den 15. Oktober 2026 als Mindestdatum für eine Einstellung. Die Übereinstimmung eines Mindestdatums über Kanäle hinweg beseitigt nicht die Notwendigkeit, den spezifischen Status jeder Integration zu prüfen. Die exponierte Kennung, aktivierte Regionen, Kapazität und Support-Richtlinie gehören zum Zugangskanal und nicht allein zum Modell.
Die zentrale Unsicherheit ist nicht semantischer Art: Die bereitgestellten Quellen bestätigen kein endgültiges Einstellungsdatum für Haiku 4.5. Sie enthalten ebenso keine Kapazitätsreservierung für jedes Konto, jede Region oder jede Aufrufart. Der Plan muss daher sowohl eine formale Lebenszyklusankündigung als auch eine operative Verschlechterung eines Kanals berücksichtigen, bevor eine Einstellung angekündigt wurde.
So ist der dokumentierte Status zu interpretieren
| Signal | Was sich daraus ableiten lässt | Was sich daraus nicht ableiten lässt | Operative Maßnahme |
|---|---|---|---|
| Modell als aktiv markiert | Es kann innerhalb des dokumentierten Providerumfangs verwendet werden | Dass es unbegrenzt verfügbar bleibt | Nutzer inventarisieren und Status regelmäßig prüfen |
| Einstellung „nicht vor“ einem Datum | Laut Dokumentation sollte es nicht vor dieser Grenze eingestellt werden | Dass es nach dem Datum verfügbar bleibt | Ersatz vor Ablauf der Grenze vorbereiten und testen |
| Modell als Ersatz empfohlen | Es ist ein vom Provider vorgeschlagenes Ziel | Gleichwertigkeit bei Latenz, Schema oder Tools | Regression mit eigenen Fällen ausführen |
| In einer Region oder an einem Endpoint verfügbar | Es gibt einen dokumentierten Zugangsweg | Gleiche Quote, Kapazität oder Latenz für jedes Konto | Aus Produktionsregion und mit Produktionszugang messen |
Die Definition eines schnellen Pfads muss Warteschlange, Validierung und Abbruch einschließen
Eine isolierte Generierungsmetrik reicht nicht aus. Bei Interaktionen, die eine Oberfläche, eine synchrone Automatisierung oder eine Online-Entscheidung beeinflussen, sollte vom Eingang der Anfrage beim Service bis zur Rückgabe einer nutzbaren Antwort durch die Anwendung gemessen werden. Dieses Intervall umfasst Serialisierung, Netzwerk, Warten in der Warteschlange, erstes Byte oder erstes Token, Generierung, Tool-Aufrufe, Validierung, Reparatur und Auslieferung.
Das minimale Dashboard muss die Latenz bis zum ersten Token von der Gesamtlatenz trennen. Erstere nähert die Fähigkeit an, eine Streaming-Antwort zu beginnen; letztere bestimmt, wann Nutzer oder Prozess handeln können. Beide müssen nach Perzentilen, mindestens p50, p95 und p99, sowie nach Workload-Typ ausgewertet werden. Ein niedriger Mittelwert kann eine Warteschlange langsamer Fälle verdecken, die Zeitlimits ausschöpft.
Auch der Anteil der im ersten Versuch akzeptierten Ausgaben muss gemessen werden. Bei strukturierter Extraktion ist das sinnvolle Signal nicht, dass das Modell Text erzeugt, der wie JSON aussieht. Entscheidend ist, dass das Objekt geparst werden kann, das Schema erfüllt und die Geschäftsregeln besteht. Bei Tools lautet das Signal, dass der Aufruf gültig, autorisiert und ausführbar ist und das Ergebnis ohne Schleifen oder doppelte Effekte eingebunden wird.
Fehler zuzuordnen ist ebenso wichtig wie sie zu zählen. Ein Zeitanstieg kann vom Modell, Netzpfad, Rate Limit, SDK, externen Tool oder Validator stammen. Wenn die Protokolle Kanal, Region, angeforderte Version, Dauer jeder Phase und Retry-Grund nicht bewahren, kann die Organisation nicht entscheiden, was zurückgerollt werden muss.
Instrumentierung einer Low-Latency-Anfrage
- 01Vor dem Provider-Aufruf eine Korrelationskennung vergeben und Modell, Kanal, Endpoint oder Region sowie die wirksame Konfiguration speichern.
- 02Eingang, Start des Aufrufs, erstes Token oder erstes Byte, Antwortende, Validierung, Tool-Ausführung und Auslieferung an den Client getrennt erfassen.
- 03Retries mit Ursache markieren: Rate Limit, Zeitüberschreitung, ungültige Ausgabe, Tool-Fehler oder nicht klassifizierter transienter Fehler.
- 04p50, p95 und p99 nach Ablauf, Eingabegröße, Antwortmodus und Zeitfenster berechnen; interaktiven Traffic und Batch-Aufgaben nicht vermischen.
- 05Abbrüche und stornierte Antworten messen: Eine Antwort, die endet, nachdem der Client gegangen ist, erfüllt das Ziel des schnellen Pfads nicht zwingend.
Regressionstests: Aufgaben bewerten, nicht einen aggregierten Wert
Die Bewertung sollte einen eingefrorenen, repräsentativen Korpus verwenden und, sofern sicher, durch Shadow-Traffic ergänzt werden. Der Korpus muss kurze und lange Eingaben, häufige Fälle und bekannte Grenzfälle, relevante Sprachen, Dokumente mit unregelmäßiger Struktur sowie Bedingungen enthalten, die Tools aktivieren. Es ist sinnvoll, ihn gemeinsam mit Prompt, Schema, Validator und Evaluierungscode zu versionieren.
Bei Klassifikation messen Sie die Übereinstimmung mit einer überprüften Referenz sowie die Kosten falsch positiver und falsch negativer Ergebnisse je Kategorie. Bei Extraktion messen Sie korrekte Felder, Auslassungen, halluzinierte Werte und vollständige Schemaakzeptanz. Bei kurzen begründeten Antworten definieren Sie, welche Quellen oder Eingabedaten enthalten sein müssen und wie eine durch diesen Kontext nicht gestützte Behauptung gewichtet wird.
Subagenten benötigen eine besondere Behandlung. Ihr Erfolg beschränkt sich nicht auf eine plausible Endantwort: Er umfasst die Anzahl der Schritte, Tool-Aufrufe, Einhaltung von Berechtigungen, das Anhalten nach Zielerreichung und das Ausbleiben doppelter Änderungen. Führen Sie Tests zuerst ohne Seiteneffekte oder gegen Testressourcen aus. Ein Modellvergleich darf nicht in Produktionssysteme schreiben.
Anthropic führt Haiku 4.5 in seinen Prompting-Hinweisen unter den Modellen mit Kontextbewusstsein auf. Das kann bei der Anpassung von Vorlagen und Variablen relevant sein, ersetzt aber keine Regression. Prompt-Form, Ausgabeanweisungen und Tool-Verhalten bleiben Eigenschaften, die das Team im implementierten Ablauf prüfen muss.
Der Kanal verändert den Betrieb: direkte API, Amazon Bedrock und Vertex AI
Es darf nicht angenommen werden, dass der Handelsname eines Modells eine identische Schnittstelle bedeutet. Die direkte API von Anthropic dokumentiert die datierte Kennung `claude-haiku-4-5-20251001`. Die bereitgestellte Amazon-Bedrock-Dokumentation beschreibt regionale, geografische und globale Inferenzkennungen sowie Verfügbarkeit nach Regionen und Endpoints. Diese Unterscheidung kann die Routenauswahl und die Observability beeinflussen, die die Anwendung bewahren muss.
In Google Cloud verwendet die Beschreibung von Claude Haiku 4.5 die ID `claude-haiku-4-5` und nennt Text-, Bild- und PDF-Eingaben, Textausgaben, Funktionen, Prompt Caching, Extended Thinking und Batch-Vorhersagen. Sie führt außerdem die Regionen `us-east5`, `europe-west1` und einen globalen Endpoint auf. Diese dokumentierten Fähigkeiten sind weder als Verpflichtung zu ihrer Aktivierung noch als identische Konfiguration zur direkten API zu verstehen.
Das Google-Cloud-Material zu Multiregion-Endpoints erläutert einen operativ relevanten Unterschied: Globale, multiregionale und regionale Endpoints bedeuten unterschiedliche Entscheidungen bei Datenresidenz, Quote, Resilienz und Latenzprofil. Ein Test an einem globalen Endpoint beantwortet daher nicht allein, was geschieht, wenn der Produktionsservice eine bestimmte Region oder Residenzbeschränkungen verlangt.
Der Vergleich der Kanäle muss Authentifizierung, wirksame Limits, Anfrage- und Streaming-Formate, Nachverfolgbarkeit, Fehlerrichtlinie und Deprecation-Support umfassen. Die Amazon-Bedrock-Quelle bestätigt Varianten von Kennungen und Inferenzrouten; sie reicht nicht aus, um die Leistung eines konkreten Kontos zu behaupten. Ebenso beweisen die von Google Cloud aufgeführten Fähigkeiten nicht, dass ein Modus in allen Organisationen aktiviert ist oder sein Einsatz das Latenzbudget einhält.
Entscheidungsfragen je Kanal
| Dimension | Direkte Anthropic-API | Amazon Bedrock | Vertex AI | Erforderliche eigene Prüfung |
|---|---|---|---|---|
| Identifikation | Dokumentierte datierte Kennung | Dokumentierte regionale, geografische und globale Kennungen | Undatierte ID in der bereitgestellten Beschreibung | Die exakte vom Umfeld akzeptierte Kennung erfassen |
| Standort | Abhängig von vertraglicher und dokumentierter Konfiguration | Verfügbarkeit nach Region und Endpoint | Konkrete Regionen und globaler Endpoint dokumentiert | Von dem tatsächlichen Standort des Workloads testen |
| Fähigkeiten | Abhängig von Modell und API | Im Kanal abgleichen | Funktionen, Caching, Thinking und Batch in der Beschreibung aufgeführt | Konfiguration, Berechtigungen und zusätzliche Latenz bestätigen |
| Lebenszyklus | Mindestdatum dokumentiert | Kanalstatus abfragen | Mindestdatum ebenfalls angegeben | Warnungen und Fallback je Kanal vorhalten |
Kontrollierter Rollout: Shadow-Ausführung, Canary und expliziter Rollback
Eine Modelländerung muss mit einem Inventar beginnen. Ermitteln Sie direkte und indirekte Aufrufe, einschließlich Worker, Drittintegrationen, eingebetteter Prompts, Fallback-Regeln und Batch-Jobs. Dokumentieren Sie für jeden Nutzer Serviceziel, erwartete Ausgabe, Kanal, Region, technischen Verantwortlichen und alternatives Modell. Ohne dieses Inventar kann eine Einstellung vergessene Pfade hinterlassen, die im Haupttest nicht auftauchen.
Die doppelte Ausführung ohne Seiteneffekte ermöglicht Ergebnisvergleiche, ohne das führende System zu verändern. Senden Sie eine repräsentative Stichprobe an den bestehenden Ablauf und an Haiku 4.5, wenden Sie dieselben Validatoren an und speichern Sie anonymisierte Unterschiede, wenn die Datenpflichten dies erlauben. Bei Subagenten ersetzen Sie schreibende Tools durch Simulatoren oder führen sie in isolierten Umgebungen aus.
Danach sollte ein Canary einen kleinen, reversiblen Anteil des realen Traffics aussetzen. Schwellenwerte für Promotion und Rollback müssen vor dem Deployment vereinbart werden: etwa eine Verschlechterung von Perzentilen, sinkende Schemaakzeptanz, mehr Tool-Fehler oder zunehmende Abbrüche. Der numerische Wert jedes Schwellenwerts hängt vom Ablauf ab und lässt sich nicht aus der Dokumentation eines Providers ableiten.
Fallback darf nicht nur ein konfiguriertes, aber nie erprobtes Label sein. Er muss Kapazität, Berechtigungen, eine kompatible Vorlage, bekannte Limits und einen Aktivierungspfad mit Verantwortlichen besitzen. Testen Sie sowohl manuelles Umschalten als auch, falls vorhanden, automatisches Umschalten. Messen Sie, wie lange die Aktivierung dauert und welche Anfragen während des Wechsels noch laufen.
Empfohlene Übergangssequenz
- 01Nutzer, Ausgabeformate, Tool-Abhängigkeiten und Zeitbudgets inventarisieren.
- 02Einen Regressionskorpus einfrieren sowie Metriken und Akzeptanzschwellen festlegen.
- 03Doppelte Ausführung ohne Seiteneffekte durchführen und Unterschiede nach Modell, Kanal, Validator oder Tool klassifizieren.
- 04Prompts, Schemata oder Adapter korrigieren, ohne Fehler durch unbegrenzte Retries zu verdecken.
- 05Einen Canary mit segmentierter Telemetrie und einer vorab genehmigten Rollback-Regel ausrollen.
- 06Nur stufenweise fördern, wenn Latenz, Validität und Geschäftsergebnisse gleichzeitig erfüllt sind.
- 07Fallback erproben und Bericht, Konfigurationen sowie Entscheidungen für den nächsten Austausch aufbewahren.
Ausstiegsplan: Die Anwendung von einer konkreten Kennung entkoppeln
Die beste Vorbereitung auf eine Lebenszyklusänderung ist eine stabile Anwendungsgrenze. Der übrige Teil des Produkts sollte eine Operation anfordern – klassifizieren, extrahieren, antworten oder ein erlaubtes Tool ausführen – und nicht die konkrete Modellkennung kennen. Ein Adapter kann diese Operation in die Formate jedes Kanals übersetzen, Streaming-Ereignisse normalisieren und einen gemeinsamen Validator anwenden.
Diese Entkopplung verlangt nicht, so zu tun, als seien alle Modelle gleich. Der Vertrag muss relevante Unterschiede sichtbar machen: unterstützte Modalitäten, Länge und Struktur der Ausgabe, Tool-Richtlinie, Streaming-Möglichkeit, maximale Zeiten und Verhalten bei Nichtverfügbarkeit. Nicht kompatible Fähigkeiten sollten explizit fehlschlagen oder eine bekannte Degradierung auslösen; sie sollten nicht durch eine Konvertierung verschleiert werden, welche die Semantik verändert.
Bewahren Sie für jede Änderung Evidenz auf: Prompt-Version, Testkorpus, segmentierte Ergebnisse, Kanalkonfiguration, Ausführungsdaten, Vorfälle und Akzeptanzentscheidung. Diese Akte ermöglicht, eine spätere Modellregression von einer Änderung an Prompt, SDK, Netzwerk oder Validator zu unterscheiden. Sie verkürzt außerdem die Reaktionszeit, wenn der Provider eine Einstellung ankündigt oder ein Endpoint das operative Budget nicht mehr einhält.
Die Schlussfolgerung ist bedingt. Für Haiku 4.5 gibt es Dokumentation, die es als Ersatz für Haiku 3.5 und als verfügbare Option in den untersuchten Kanälen darstellt. Nur eine End-to-End-Bewertung kann jedoch zeigen, dass es für eine konkrete Organisation einen schnellen Pfad aufrechterhält. Das Mindestaufbewahrungsdatum sollte als Frist genutzt werden, diese Bewertung abzuschließen und einen Ausstieg zu üben – nicht als Grund, sie aufzuschieben.
Offene Fragen
- Die bereitgestellten Quellen bestätigen nach dem 15. Oktober 2026 kein endgültiges Einstellungsdatum für Claude Haiku 4.5.
- Aus der Dokumentation lassen sich Kapazität, Quote, Latenz oder tatsächliche Verfügbarkeit für ein bestimmtes Konto, eine Region und einen konkreten Zeitpunkt nicht ableiten.
- Es wurde keine vergleichende Evidenz zu p50, p95, p99, Schemavalidität oder Tool-Fehlern für einen konkreten Workload bereitgestellt.
- Die Verfügbarkeit von Modi und Konfigurationen kann von Berechtigungen, Region, Endpoint und Einrichtung des Kanalproviders abhängen.
Weiter entdecken
Verwendete Quellen
Korrekturen und Transparenz
Wenn du falsche oder veraltete Angaben findest, sende uns die Seite und die zu prüfende Quelle.
Korrektur vorschlagen