Exakte Version
Prüfe Modellkennung, Datum und ob sich der Alias ändern kann.
Veröffentlichte Ergebnisse und von den Quellen angegebene Bedingungen. Zahlen sind nur vergleichbar, wenn Version, Konfiguration, Metrik und Datum übereinstimmen.
| Modell | Organisation | Ergebnis | Metrik | Bedingungen |
|---|---|---|---|---|
| GPT‑5.6 Sol | OpenAI | 52,7 % | Genauigkeit | Offizielle Tabelle von GPT‑5.6. |
| GPT‑5.6 Terra | OpenAI | 50,4 % | Genauigkeit | Offizielle Tabelle von GPT‑5.6. |
| GPT‑5.6 Luna | OpenAI | 50,3 % | Genauigkeit | Offizielle Tabelle von GPT‑5.6. |
Prüfe Modellkennung, Datum und ob sich der Alias ändern kann.
Prüfe Werkzeuge, Aufwand, Anzahl der Versuche, Prompt und Inferenzbudget.
Validiere das Ergebnis mit Aufgaben, Sprachen, Formaten und Fehlern, die für dein Produkt repräsentativ sind.
Ein öffentlicher Benchmark bietet Orientierung, ersetzt jedoch keine Bewertung mit deinen Daten, Tools, deinem Budget und deiner Fehlertoleranz.
Ein beweglicher Alias und ein Snapshot können unterschiedliche Ergebnisse liefern. Erfasse Modell, Datum und Anbieter.
Prompt, Reasoning, Tools, Anzahl der Versuche und Budget müssen für einen Vergleich gleichwertig sein.
Ein kleiner Unterschied kann zwischen Ausführungen verschwinden. Bewahre Stichproben, Streuung und Fehler auf, nicht nur den Mittelwert.
Validiere, ob die Verbesserung über Sprachen, Formate und reale Fälle hinweg Bestand hat, die deinem Produkt nahekommen.
Eine Metrik ist nur dann nützlich, wenn wir die Aufgabe, die Bedingungen und den Fehler kennen, auf die es ankommt. Das Ergebnis beginnt bereits bei der Gestaltung des Tests.
AutomationBench bewertet, ob ein Agent Abläufe zwischen simulierten SaaS-Anwendungen abschließen und sie in einen überprüfbaren Endzustand überführen kann. Dieser Leitfaden erklärt, was diese Evidenz bedeutet, wie die Metriken zu lesen sind und welche zusätzlichen Prüfungen nötig sind, bevor sich ein Ergebnis auf ein reales Unternehmen übertragen lässt.
22 Sep 2026 ↗ PAPERAgents’ Last Exam bewertet Agenten bei beruflichen Aufgaben in Betriebssystemumgebungen mit überprüfbaren Ergebnissen. Das Design eignet sich, um die Ausführung von Arbeitsabläufen zu untersuchen. Eine aggregierte Erfolgszahl belegt jedoch nicht, dass sich ein Beruf automatisieren lässt. Für ihre Einordnung sind Details zu Aufgaben, Umgebung, Harness, Modell, Werkzeugen, Budget und der bewerteten Version erforderlich.
22 Sep 2026 ↗