DOKUMENTIERTER BENCHMARK

GPQA Diamond

Veröffentlichte Ergebnisse und von den Quellen angegebene Bedingungen. Zahlen sind nur vergleichbar, wenn Version, Konfiguration, Metrik und Datum übereinstimmen.

01 / ERGEBNISSE

Veröffentlichte Messungen

ModellOrganisationErgebnisMetrikBedingungen
GPT‑6 AstraOpenAI96,0 %GenauigkeitErgebnis des Anbieters.
DeepSeek V4.1 FlashDeepSeek90,9 %GenauigkeitDeepSeek-Harness, Aufwand max und veröffentlichte Konfiguration.
Qwen3‑Max ThinkingAlibaba Qwen92,8 %GenauigkeitVon Qwen veröffentlichte Inferenzskalierung.
02 / INTERPRETATION

Vor dem Vergleichen

01

Exakte Version

Prüfe Modellkennung, Datum und ob sich der Alias ändern kann.

02

Gleichwertige Konfiguration

Prüfe Werkzeuge, Aufwand, Anzahl der Versuche, Prompt und Inferenzbudget.

03

Übertragung auf deinen Anwendungsfall

Validiere das Ergebnis mit Aufgaben, Sprachen, Formaten und Fehlern, die für dein Produkt repräsentativ sind.

03 / VERFAHREN

Vom Indikator zu einer reproduzierbaren Entscheidung

Ein öffentlicher Benchmark bietet Orientierung, ersetzt jedoch keine Bewertung mit deinen Daten, Tools, deinem Budget und deiner Fehlertoleranz.

01

Identifiziere die genaue Version

Ein beweglicher Alias und ein Snapshot können unterschiedliche Ergebnisse liefern. Erfasse Modell, Datum und Anbieter.

02

Rekonstruiere die Bedingungen

Prompt, Reasoning, Tools, Anzahl der Versuche und Budget müssen für einen Vergleich gleichwertig sein.

03

Suche nach Unsicherheit

Ein kleiner Unterschied kann zwischen Ausführungen verschwinden. Bewahre Stichproben, Streuung und Fehler auf, nicht nur den Mittelwert.

04

Prüfe die Übertragbarkeit

Validiere, ob die Verbesserung über Sprachen, Formate und reale Fälle hinweg Bestand hat, die deinem Produkt nahekommen.

Eine Metrik ist nur dann nützlich, wenn wir die Aufgabe, die Bedingungen und den Fehler kennen, auf die es ankommt. Das Ergebnis beginnt bereits bei der Gestaltung des Tests.

ANALYSE

Verwandte Analysen

04 / QUELLEN

Rückverfolgbarkeit