Die angekündigte Änderung betrifft den Ausgabevertrag, nicht nur die Zeichenerkennung
Mistral AI bezeichnet die Version als `mistral-ocr-4-1`. Die Dokumentation des Anbieters datiert die Veröffentlichung auf den 16. Juli 2026 und verzeichnet die allgemeine Verfügbarkeit zum 31. August desselben Jahres. Das Changelog hält außerdem fest, dass die Aliasse `mistral-ocr-latest` und `mistral-ocr-4` anschließend auf OCR 4.1 aufgelöst wurden. Für ein Team, das einen dieser Aliasse verwendet, kann die Aktualisierung eintreten, ohne dass sich der in der Anfrage verwendete Name zwingend ändert.
Damit wird das Update zu einer Frage der betrieblichen Kompatibilität. Ein System, das OCR als ersten Schritt für die Indexierung von Akten, die Extraktion von Feldern, die Klassifizierung von Dokumenten oder die Vorbereitung einer manuellen Prüfung nutzt, erhält nicht nur eine Zeichenkette. Es kann von Seiten, Markdown-Fragmenten, Blöcken, strukturellen Tags, Tabellen, Dokumentabmessungen und räumlichen Positionen abhängen. Ändert sich eine dieser Repräsentationen, kann ein nachgelagerter Prozess ausfallen oder an Qualität verlieren, auch wenn der sichtbare Text besser erscheint.
Die Modellseite nennt Begrenzungsrahmen auf Absatzebene, strukturelle Tags und Konfidenzwerte pro Block. Das Changelog erwähnt wiederum die Einführung einer Konfidenzgranularität auf Blockebene. Solche Funktionen können zusätzliche Signale liefern, um Prüfungen zu priorisieren. Sie verpflichten jedoch dazu, festzulegen, wie diese Signale gespeichert, verglichen und verarbeitet werden. Ein Konfidenzsignal darf nicht mit einer Garantie für die semantische Korrektheit einer Klausel, eines Betrags oder einer Identität gleichgesetzt werden.
Was der Endpoint bereitstellt und weshalb es vor der Migration verglichen werden muss
Die Referenz des OCR-Endpoints beschreibt eine Anfrage an `POST /v1/ocr` sowie Optionen, welche die Verarbeitung und Rückgabe eines Dokuments beeinflussen. Dazu gehören der Dokumentmodus, die Auswahl von Seiten, die Einbeziehung von Blöcken, das Tabellenformat, Annotationsformate und die Granularität der Konfidenzwerte. Nicht alle diese Optionen müssen in einer bestehenden Integration aktiviert sein. Gerade deshalb muss die wirksame Konfiguration Bestandteil des Tests sein.
Der Leitfaden zum OCR-Prozessor beschreibt nach Seiten organisierte Ergebnisse sowie Inhalte, die Markdown, Tabellen, Kopf- und Fußzeilen, Abmessungen, Bilder und Blöcke enthalten können. Er weist außerdem darauf hin, dass `include_blocks` OCR 4 oder neuer erfordert, während Informationen zu Tabellen, Kopfzeilen und Fußzeilen OCR 2512 oder neuer erfordern. Ein Team sollte die tatsächlich aufgerufene Version und die für sein Konto akzeptierten Optionen bestätigen, bevor es daraus ableitet, dass ein Feld verfügbar sein wird.
Der Vergleich darf sich nicht darauf beschränken, ob das JSON weiterhin gültig ist. Zu prüfen sind das Schema jedes von der Anwendung verwendeten Objekts, das Vorhandensein oder Fehlen von Werten, die Lesereihenfolge der Blöcke, die Zuordnung zu Seiten sowie Koordinaten oder Begrenzungsrahmen, wenn sie zum Hervorheben von Belegen verwendet werden. Ebenso sollte geprüft werden, dass Tabellenextraktoren keine Spalten, Überschriften oder Zeilenumbrüche voraussetzen, die das OCR in anderer Form darstellen könnte.
Minimale Kompatibilitätsmatrix
| Integrationsfläche | Was zu vergleichen ist | Risiko bei Änderungen | Abnahmekriterium |
|---|---|---|---|
| Text und Markdown | Inhalt, Umbrüche, Kopf- und Fußzeilen sowie Lesereihenfolge | Musterbasierte Extraktoren oder Textausschnitte werden fehlerhaft | Kritische Felder behalten Präzision und auffindbare Belege |
| Blöcke und Tags | Anzahl, Typ, Reihenfolge, Konfidenz und Begrenzungsrahmen | Fehler in Prüfoberflächen oder Regeln pro Block | Der Verbraucher toleriert zusätzliche, fehlende oder neu segmentierte Blöcke |
| Tabellen | Zeilen, Spalten, leere Zellen und Überschriften | Beträge oder Codes werden zwischen Spalten verschoben | Kritische Tabellen werden innerhalb des festgelegten Schwellenwerts rekonstruiert |
| Seite und Geometrie | Seitenindex, Abmessungen und Koordinaten | Zitate, Hervorhebungen und Prüfpfade zeigen auf den falschen Bereich | Der Beleg stimmt mit der erwarteten Seite und Region überein |
| Betrieb | Latenz, Fehler, Wiederholungen, Limits und Ausführungsmodus | Überlastete Warteschlangen oder mehr manuelle Arbeit | Service- und Kapazitätsziele werden eingehalten |
Fünf Kompatibilitätsprüfungen, die sich in Tests überführen lassen
Die erste Prüfung betrifft das Schema. Speichern Sie Referenzantworten der vorherigen Version und von OCR 4.1 für dieselben Dokumente mit identischen Optionen. Vergleichen Sie Feldnamen, Typen, optionale Felder und Nullwerte. Wenn das System die Antwort vor der Speicherung transformiert, testen Sie sowohl die ursprüngliche Antwort als auch das transformierte JSON. Viele Probleme entstehen in Adaptern, Schemavalidierern oder Serialisierern und nicht im isolierten OCR.
Die zweite Prüfung betrifft die Segmentierung. Ein Modell kann einen Absatz aufteilen, zwei nahe Blöcke zusammenführen oder Kopf- und Fußzeilen anders erkennen. Solche Abweichungen können Regeln verändern, die Text einem Vertragsabschnitt zuordnen oder wiederholte Elemente ausschließen. Messen Sie, wie viele Blöcke sich ändern, und vor allem, ob die Änderung die Ausgabe der konsumierenden Prozesse beeinflusst.
Die dritte Prüfung ist die Rekonstruktion von Tabellen. Wählen Sie Dokumente mit komplexen Tabellen, verbundenen Zellen, Formularen, schmalen Spalten, gescannter Handschrift und geringer Bildqualität aus. Bewerten Sie konkrete Geschäftsfelder und nicht nur die globale Ähnlichkeit mit einer Transkription. Bei einer Rechnung können das beispielsweise Gesamtbetrag, Währung, Steuern, Kennungen von Positionen und ihre Zuordnung zur korrekten Zeile sein.
Die vierte Prüfung ist die räumliche Rückverfolgbarkeit. Wenn eine Anwendung einer prüfenden Person die Quelle einer Extraktion zeigt, muss sie sicherstellen, dass Text, Seite und markierte Region weiterhin übereinstimmen. Die Verfügbarkeit von Begrenzungsrahmen je Absatz erlaubt ohne eigenen Test nicht den Schluss, dass alle früher erzeugten Zitate dieselbe Geometrie oder Segmentierung behalten.
Die fünfte Prüfung betrifft das Betriebsverhalten. Erfassen Sie Antwortzeiten, Fehler, Wiederholungen, verarbeitetes Volumen und den Anteil der Fälle, die eine manuelle Korrektur benötigen. Die Endpoint-Dokumentation sieht Verarbeitungsmodi und -parameter vor; Last, Dateityp und Konfiguration können das beobachtete Ergebnis beeinflussen. Limits und tatsächliches Verhalten müssen in der Umgebung und mit dem Konto validiert werden, die später eingesetzt werden sollen.
Migrationstest: eingefrorener Korpus, doppelte Ausführung und Rückfallbedingungen
Der Mindesttest sollte einen eingefrorenen, repräsentativen Korpus mit menschlicher Referenz für kritische Elemente verwenden. Nehmen Sie native und gescannte Dokumente, in der Produktion vorkommende Sprachen, unterschiedliche Auflösungen, gedrehte Seiten, Formulare, Tabellen, wiederkehrende Kopfzeilen und die Fälle auf, die in der Vergangenheit Vorfälle verursacht haben. Trennen Sie eine Entwicklungsmenge von einer finalen Menge, die während der Migration nicht zur Anpassung von Regeln verwendet wird.
Führen Sie beide Wege mit demselben Eingabedokument aus und bewahren Sie Modellkennung, Parameter, Zeitpunkt, ursprüngliches Ergebnis und transformiertes Ergebnis auf. Die regionale Inferenz von Mistral empfiehlt, Hostname, Modell, Zeitpunkt und Anforderungskennung für Prüfzwecke zu protokollieren. Diese Disziplin ermöglicht die Untersuchung einer Differenz, ohne sie sofort dem Modell zuzuschreiben.
Legen Sie Schwellenwerte fest, bevor Sie Ergebnisse betrachten. Dazu können die Genauigkeit kritischer Felder, der Anteil korrekter Zitate je Seite, die Tabellenintegrität, die technische Fehlerrate, Latenz-Perzentile und die Rate manueller Prüfung oder Korrektur zählen. Definieren Sie auch, welche Abweichung den Rollout stoppen muss. Ein Canary mit begrenztem Datenverkehr und eine doppelte Ausführung, ohne die Geschäftsentscheidung zu beeinflussen, reduzieren das Risiko meist stärker, als das Modell auf einmal für den gesamten Datenverkehr zu ersetzen.
Die Entscheidung muss nicht binär sein. Wenn OCR 4.1 einige Dokumenttypen verbessert und andere verschlechtert, kann das Team getrennte Routen beibehalten, während es seine Verbraucher anpasst oder das Auswahlkriterium überarbeitet. Das ist eine Architektur- und Betriebsentscheidung auf Grundlage interner Messungen, keine Schlussfolgerung, die sich allein aus den vom Anbieter erklärten Fähigkeiten ableiten lässt.
Migrationsprozess in sieben Schritten
- 01Modelle, Aliasse, Parameter, Transformationen und Verbraucher der OCR-Ausgabe inventarisieren.
- 02Einen repräsentativen Korpus einfrieren und kritische Felder, Tabellen und Seitenreferenzen kennzeichnen.
- 03Die aktuelle Version und `mistral-ocr-4-1` mit derselben dokumentierten Konfiguration ausführen.
- 04Text, Struktur, Blöcke, Tabellen, Geometrie, Fehler, Latenz und Prüfaufwand vergleichen.
- 05Unterschiede untersuchen, die Entscheidungen, Auditierbarkeit, Oberflächen oder Datenextraktion beeinflussen.
- 06Mit Canary, versionsbezogener Telemetrie und einem vorab getesteten Rückfallpfad ausrollen.
- 07Ergebnisse versionieren und ausreichende Belege aufbewahren, um spätere Vorfälle reproduzieren zu können.
Aufbewahrung, Dateien und Region: Aspekte, die nicht aus der Bewertung fallen dürfen
Die Dokumentation zur Zero Data Retention führt den OCR-Endpoint unter den Endpoints auf, die mit diesem Modus kompatibel sind. Dieselbe Dokumentation schließt jedoch die Files API und Dateien der Batch-Verarbeitung von dieser Abdeckung aus. Es reicht daher nicht aus, das ausgewählte Modell zu kennen: Das Team muss überprüfen, über welchen Weg jedes Dokument bereitgestellt wird und welche Zusatzdienste im Ablauf beteiligt sind.
Die Dokumentation zur regionalen Inferenz beschreibt regionale Endpoints, einschließlich eines europäischen Endpoints. Die Wahl einer Region kann, soweit sie für die Integration verfügbar ist, für interne Anforderungen an Auditierung, Datenresidenz oder Rückverfolgbarkeit relevant sein. Die Existenz eines regionalen Endpoints ersetzt jedoch nicht die rechtliche, vertragliche und sicherheitsbezogene Prüfung, die für jede Organisation erforderlich ist.
Es ist sinnvoll, Aufbewahrung, Upload-Weg, Region, Zugriffsberechtigungen, interne Aufbewahrungsfristen und die Löschung abgeleiteter Artefakte getrennt zu dokumentieren. Dies sind Kontrollen des gesamten Workflows und keine Eigenschaften, die sich aus der Erkennungsqualität ableiten lassen. Verarbeitet die Anwendung sensible Informationen, sollte diese Prüfung dem Rollout vorausgehen und aktualisiert werden, wenn sich eingesetzte Komponenten ändern.
Fazit: Die Beleglage festlegen, bevor der Produktionspfad geändert wird
Mistral OCR 4.1 bietet eine identifizierbare Version, dokumentierte allgemeine Verfügbarkeit und strukturelle Signale, die für Dokumentenanwendungen nützlich sein können. Für eine bestehende Integration ist besonders relevant, dass bestimmte Aliasse nun auf diese Version zeigen. Teams, die von Aliassen abhängen, sollten die Änderung deshalb als potenzielle Vertragsänderung und nicht als transparentes Update behandeln.
Eine vorsichtige Validierung vergleicht Ausgaben und Folgen: nicht nur erkannte Zeichen, sondern Geschäftsfelder, Tabellenstruktur, Seitenreferenzen, Geometrie, Leistung und Prüfaufwand. Die für die Migrationsfreigabe benötigte Evidenz sollte aus einem reproduzierbaren Protokoll mit eigenen Dokumenten, expliziten Schwellenwerten und verfügbarem Rückfallpfad stammen. Die Aussagen des Anbieters helfen dabei, den Prüfbereich einzugrenzen; sie ersetzen diese Überprüfung nicht.
Offene Fragen
- Die bereitgestellten Quellen veröffentlichen keinen vollständigen Feld-für-Feld-Vergleich zwischen der Antwort von OCR 4.1 und allen früheren Versionen; Unterschiede müssen in jeder Integration gemessen werden.
- Es wurde keine unabhängige Bewertung mit veröffentlichtem Protokoll bereitgestellt, die die Leistung von OCR 4.1 auf einem bestimmten externen Korpus belegt.
- Tatsächliche Limits, die Verfügbarkeit von Optionen und das Betriebsverhalten können vom Konto, von der Konfiguration, vom Eingabetyp und von der Region abhängen und müssen vor dem Rollout geprüft werden.
- Die untersuchte Dokumentation erlaubt nicht die Aussage, dass Koordinaten, Segmentierung oder Lesereihenfolge gegenüber den historischen Ergebnissen einer Organisation stabil bleiben.
Weiter entdecken
Verwendete Quellen
Korrekturen und Transparenz
Wenn du falsche oder veraltete Angaben findest, sende uns die Seite und die zu prüfende Quelle.
Korrektur vorschlagen