Exakte Version
Prüfe Modellkennung, Datum und ob sich der Alias ändern kann.
Veröffentlichte Ergebnisse und von den Quellen angegebene Bedingungen. Zahlen sind nur vergleichbar, wenn Version, Konfiguration, Metrik und Datum übereinstimmen.
| Modell | Organisation | Ergebnis | Metrik | Bedingungen |
|---|---|---|---|---|
| GPT‑6 Astra | OpenAI | 96,0 % | Genauigkeit | Ergebnis des Anbieters. |
| DeepSeek V4.1 Flash | DeepSeek | 90,9 % | Genauigkeit | DeepSeek-Harness, Aufwand max und veröffentlichte Konfiguration. |
| Qwen3‑Max Thinking | Alibaba Qwen | 92,8 % | Genauigkeit | Von Qwen veröffentlichte Inferenzskalierung. |
Prüfe Modellkennung, Datum und ob sich der Alias ändern kann.
Prüfe Werkzeuge, Aufwand, Anzahl der Versuche, Prompt und Inferenzbudget.
Validiere das Ergebnis mit Aufgaben, Sprachen, Formaten und Fehlern, die für dein Produkt repräsentativ sind.
Ein öffentlicher Benchmark bietet Orientierung, ersetzt jedoch keine Bewertung mit deinen Daten, Tools, deinem Budget und deiner Fehlertoleranz.
Ein beweglicher Alias und ein Snapshot können unterschiedliche Ergebnisse liefern. Erfasse Modell, Datum und Anbieter.
Prompt, Reasoning, Tools, Anzahl der Versuche und Budget müssen für einen Vergleich gleichwertig sein.
Ein kleiner Unterschied kann zwischen Ausführungen verschwinden. Bewahre Stichproben, Streuung und Fehler auf, nicht nur den Mittelwert.
Validiere, ob die Verbesserung über Sprachen, Formate und reale Fälle hinweg Bestand hat, die deinem Produkt nahekommen.
Eine Metrik ist nur dann nützlich, wenn wir die Aufgabe, die Bedingungen und den Fehler kennen, auf die es ankommt. Das Ergebnis beginnt bereits bei der Gestaltung des Tests.
Ein sinnvoller Vergleich von DeepSeek R1 und DeepSeek V3.2 beginnt nicht mit einem veröffentlichten Benchmark, sondern mit einer eigenen Aufgabe, einem eingefrorenen Korpus und einer expliziten Definition wesentlicher Fehler. Dieses Protokoll zeigt, wie sich messen lässt, ob die zusätzliche Deliberation von R1 Fehler und menschliche Nacharbeit senkt oder ob V3.2 denselben Schwellenwert mit geringerer Latenz, geringerem Verbrauch und weniger Integrationsaufwand erreicht.
22 Sep 2026 ↗ ANALISISEine AIME-2024-Zahl wirkt einfach, kann jedoch sehr unterschiedliche Protokolle zusammenfassen. Dieser Leitfaden erklärt, was der Datensatz repräsentiert, wie Anzahl der Versuche, Antwortauswahl, Tools und Evaluierungs-Harness das Ergebnis verändern und welche Angaben vor einem Modellvergleich erforderlich sind.
22 Sep 2026 ↗