Ilustración editorial para Sora 2 Pro en los benchmarks de vídeo: qué mide una preferencia ciega y qué deja sin responder
Imagen generada con gpt-image-2.5-sunburst para InferamaQuelle ↗
01

Eine Videobewertung ist keine umfassende Evaluation

Wenn es heißt, Sora 2 Pro schneide in einem Videobenchmark „gut“ ab, kann das Verschiedenes bedeuten. Vielleicht bevorzugten Menschen seine Clips in einem Paarvergleich, vielleicht erzielte es bei einer automatischen Messung für eine bestimmte Dimension einen hohen Wert oder erfüllte einen Satz von Anweisungen besser. Diese Aussagen sind nicht austauschbar: Jede hängt davon ab, was gemessen wurde, welche Stichproben einbezogen waren und unter welchen Bedingungen die Evaluation stattfand.

Die Unterscheidung ist wichtig, weil ein aggregiertes Ranking eine allgemeine Präferenz zusammenfassen kann, aber nicht unbedingt diagnostiziert, welche Eigenschaft des Videos diese Präferenz ausgelöst hat. Ein Clip kann bei einer Abstimmung besser ankommen und zugleich Kontinuitätsfehler enthalten, Elemente aus dem Prompt auslassen oder den Ton schlecht synchronisieren. Wer eine konkrete Stärke belegen möchte, muss die passende Aufgabe und Metrik heranziehen, statt sie aus der Position in einer Rangliste abzuleiten.

Die verfügbaren Quellen ermöglichen es, die Methoden mehrerer Evaluationen und einige von einer Arena veröffentlichte Daten zu beschreiben sowie die Optionen der Sora-API einzuordnen. Sie belegen nicht, dass Sora 2 Pro mit den Benchmarks VBench oder Video-Bench getestet wurde. Diese Arbeiten dienen hier dazu, zu veranschaulichen, welche Dimensionen ein Benchmark getrennt betrachten kann; sie dürfen nicht als Ergebnisse des Modells dargestellt werden.

02

Zuerst die untersuchte Einheit bestimmen

„Sora 2 Pro“ allein ist keine ausreichende Beschreibung eines Experiments. Ein aussagekräftiger Bericht sollte die genaue bezeichnete Variante, den Zugangsweg und das Generierungsdatum angeben. Außerdem sollte er klären, ob die Stichproben über die API oder eine andere Oberfläche erzeugt wurden, welche Optionen verfügbar waren und ob eine Nachbearbeitung stattfand. Ohne diese Angaben lässt sich eine beobachtete Differenz nicht zuverlässig dem Modell allein zuschreiben.

Die OpenAI-Dokumentation nennt sora-2-pro und beschreibt Parameter wie Größe und Dauer sowie die Möglichkeit, ein Referenzbild zu verwenden. Das erlaubt konkrete Fragen bei der Prüfung eines Ergebnisses: Wurde Text-zu-Video oder Bild-zu-Video verwendet? Welche Größe wurde angefordert? Wie lang war der Clip? Wurde Audio generiert? Dass eine Option dokumentiert ist, beweist nicht, dass sie in einem bestimmten Benchmark aktiviert war; dazu muss das Protokoll Auskunft geben.

Auch das Datum sollte dokumentiert werden, denn Systeme, Oberflächen und Zugangsbedingungen können sich ändern. Das Änderungsprotokoll von Arena vermerkt die Aufnahme von Sora 2 und Sora 2 Pro in die Text-zu-Video-Rangliste. Der Eintrag zur Aufnahme beschreibt für sich genommen jedoch nicht alle Einzelheiten der Generierung und garantiert auch nicht, dass sich zwei Zeiträume der Rangliste direkt vergleichen lassen.

Mindestangaben für die Beschreibung eines Tests

Prüfe vor einem Ergebnisvergleich, ob der Bericht diese Bedingungen nennt. „Nicht angegeben“ ist eine Einschränkung der Dokumentation und kein Anlass, einen Wert anzunehmen.

ElementWas dokumentiert werden sollteWas sich aus fehlenden Angaben nicht schließen lässt
SystemExakter Name und Variante; ZugangswegDass die Differenz allein vom Modell stammt
EingabeText-zu-Video oder Bild-zu-Video; verwendeter Prompt oder ReferenzDass die Aufgaben gleichwertig sind
KonfigurationGröße beziehungsweise Auflösung, Dauer und relevante OptionenDass die Clips unter vergleichbaren Bedingungen entstanden
StichprobenziehungGenerierungen je Eingabe und Regel zur Auswahl des gezeigten BeispielsDass der veröffentlichte Clip eine typische Ausgabe darstellt
EvaluationKriterium, Zahl der Vergleiche oder Bewertenden und AggregationsmethodeDass der Wert eine bestimmte Fähigkeit misst
03

Was eine Präferenz-Arena leistet

Eine Präferenz-Arena zeigt üblicherweise Ausgaben, zwischen denen jemand auswählt, ohne dass der Name des Systems die Antwort gezielt beeinflussen soll. Bei einem Blindvergleich liefert die Wahl einen Hinweis auf die Präferenz in diesem Format: Welcher Clip gefiel den Teilnehmenden angesichts der gezeigten Stichproben besser? Das ist ein relevantes Signal für die menschliche Wahrnehmung, muss aber innerhalb dieses Aussagebereichs bleiben.

Die Text-zu-Video-Rangliste von Arena zeigt Sora 2 Pro mit einer Bewertung und einem Intervall sowie einem auf der Seite angegebenen Stichtag. Verantwortungsbewusst formuliert lautet die Aussage, dass dieser Wert zu dieser Rangliste und dieser Momentaufnahme gehört – nicht, dass er eine universelle Qualitätsmessung darstellt. Das Intervall drückt die Unsicherheit der Schätzung nach der Methode der Plattform aus. Es sollte weder weggelassen noch zu einer Garantie umgedeutet werden, dass ein System bei jedem Prompt besser abschneidet.

Die Ranking-Methode von Arena erklärt die Berechnung sowie den Umgang mit Unsicherheit und Rangplätzen. Um die Belastbarkeit einer Aussage einzuschätzen, sollte man dennoch prüfen, welche Vergleiche eingingen, wie sie zugeteilt wurden, wie viele Beobachtungen dem Ergebnis zugrunde liegen und welche Prompt-Population vertreten war. Falls die aufgerufene Seite nicht alle diese Einzelheiten zeigt, dürfen sie nicht durch Vermutungen ergänzt werden.

Eine Blindpräferenz verrät auch nicht von selbst, warum jemand eine Ausgabe ausgewählt hat. Bewertende können Komposition, Stil, Lesbarkeit der Bewegung oder die scheinbare Passung zum Prompt bevorzugen; mehrere Faktoren können zugleich eine Rolle spielen. Eine Stimme ist nicht automatisch gleichbedeutend mit einem Bewertungsraster für Anweisungsbefolgung, zeitliche Kontinuität oder audiovisuelle Synchronisierung.

04

Warum Benchmarks einzelne Dimensionen betrachten müssen

Benchmarks, die ausdrücklich auf Aufgaben oder Dimensionen ausgerichtet sind, ermöglichen die Frage, welcher Aspekt bewertet wird. VBench organisiert die Evaluation von Videogenerierungsmodellen beispielsweise nach verschiedenen Dimensionen, darunter Konsistenz, zeitliches Flimmern und Bewegungsruhe. Video-Bench versteht sich als Benchmark, der an menschlichen Urteilen ausgerichtet ist. Diese Ansätze zeigen Alternativen dazu, die Evaluation auf eine einzige allgemeine Präferenz zu reduzieren; sie sind jedoch kein Beleg dafür, dass Sora 2 Pro dort ein konkretes Ergebnis erzielt hat.

Der Vorteil einer Trennung nach Dimensionen liegt in der Diagnose. Weist eine Evaluation eine Schwäche bei der zeitlichen Konsistenz aus, bedeutet das nicht zwangsläufig, dass die allgemeine visuelle Qualität gering ist. Ist eine visuelle Dimension stark, beweist das wiederum nicht, dass das Modell sämtliche Einzelheiten einer Anweisung beachtet. Messwerte müssen gemäß Definition und Verfahren des jeweiligen Benchmarks interpretiert werden. Ein automatischer Wert sollte nicht ohne Weiteres mit einer menschlichen Bewertung gleichgesetzt werden.

Ein Vergleich mit einer Arena kann ergänzend sein. Ein Präferenztest fasst zusammen, welche Ausgabe unter einem bestimmten Protokoll ausgewählt wird; eine Batterie von Dimensionstests versucht, getrennte Eigenschaften zu beschreiben. Für alle Fragestellungen reicht keines der Verfahren allein aus: Das erste liefert nicht automatisch eine Kausaldiagnose, und das zweite muss nicht widerspiegeln, welche Clips Menschen in einer konkreten Nutzungssituation bevorzugen.

Belege passend zur Fragestellung auswählen

Welche Evaluation geeignet ist, hängt von der Aussage ab, die überprüft werden soll.

FragePassender BelegZu nennende Einschränkung
Welche Ausgabe bevorzugen Menschen in einem Vergleich?Paarvergleichs-Arena mit dokumentiertem Abstimmungsverfahren und UnsicherheitsschätzungDie Präferenz benennt nicht automatisch die Ursache und misst nicht alle Fähigkeiten
Bleibt das Aussehen von Elementen über den Clip hinweg erhalten?Für eine konkrete Aufgabe definierte Messung zeitlicher KonsistenzDas Ergebnis hängt von der operationalen Definition und den Stichproben ab
Hält die Ausgabe die Bestandteile einer Anweisung ein?Evaluation der Anweisungsbefolgung anhand expliziter KriterienEine allgemeine Präferenz ersetzt diesen Test nicht
Sind Ton und Bild aufeinander abgestimmt?Protokoll, das Synchronisierung und audiovisuelle Inhalte ausdrücklich bewertetAus einer visuellen Rangliste lässt sich nichts ableiten, wenn Audio nicht Teil des Tests war
05

Vergleichbarkeit: Prompts, Generierungen und Clip-Auswahl

Zwei Ergebnisse sind nur dann vergleichbar, wenn bekannt ist, welche Bedingungen sie gemeinsam haben. Die Eingabemodalität ist ein erster Unterschied: Eine Generierung aus Text ist nicht genau dieselbe Aufgabe wie die Animation eines Referenzbildes. Zu berücksichtigen sind auch die angeforderte Dauer und Größe, das Vorhandensein oder Fehlen von Audio sowie Einschränkungen, die für die jeweiligen Systeme galten. Die Dokumentation einer Oberfläche kann bestätigen, welche Parameter unterstützt werden, aber nicht, welche das Experiment tatsächlich verwendete.

Der Prompt ist Bestandteil des Protokolls und kein redaktionelles Detail. Eine Sammlung einfacher Anweisungen, eine Liste komplexer Szenen und ein Set, das Handlungen in einer präzisen Reihenfolge verlangt, können unterschiedliche Leistungsprofile ergeben. Veröffentlicht oder beschrieben ein Benchmark seine Eingaben nicht, ist schwerer zu beurteilen, welche Bereiche die Stichprobe abdeckt und wie sie sich wiederholen lässt.

Besonders wichtig sind die Zahl der Generierungen je Prompt und die Auswahlregel. Werden mehrere Ausgaben erstellt und anschließend eine davon veröffentlicht, hängt das Ergebnis auch vom Auswahlverfahren ab und nicht nur von einer einzelnen Generierung. Für faire Vergleiche sollte angegeben werden, ob die erste Ausgabe gezeigt wurde, eine nach einer vorab festgelegten Regel ausgewählte Ausgabe oder eine anderweitig gewonnene Stichprobe. Die vorliegenden Quellen belegen keine einheitliche Regel, die für alle Evaluationen von Sora 2 Pro gilt; das muss im Einzelfall geprüft werden.

Auch die menschliche Evaluation kann variieren: Wer stimmt ab, welche Anweisungen erhalten die Bewertenden und welche Elemente können sie sehen? Wird Audio einbezogen, muss klar sein, ob die Abstimmung den Ton berücksichtigt oder nur das Bild. Werden automatische Bewertende eingesetzt, sollte der Bericht beschreiben, was sie messen und wie ihr Einsatz validiert wurde. Ohne diese Angaben kann ein Wert als veröffentlichtes Ergebnis weiterhin informativ sein, sein Aussagebereich ist jedoch enger.

Vorgehen zur Prüfung einer Benchmark-Aussage

Gehe diese Schritte durch, bevor du eine Bewertung als Beleg für eine Fähigkeit zitierst.

  1. 01Bestimme die genaue Variante, den Zugangsweg und das Datum der Generierungen.
  2. 02Prüfe Modalität, Prompts, Größe, Dauer sowie, ob Audio generiert oder bewertet wurde.
  3. 03Ermittle, wie viele Ausgaben je Eingabe generiert wurden und wie die gezeigte Stichprobe ausgewählt wurde.
  4. 04Kläre, was der Wert misst: Präferenz, Qualitätsdimension, Anweisungsbefolgung oder eine andere Eigenschaft.
  5. 05Prüfe die Aggregationsmethode, die veröffentlichte Unsicherheit und die Zusammensetzung der Stichprobe.
  6. 06Trenne die beobachteten Daten von ihrer Interpretation und begrenze die Schlussfolgerung auf das jeweilige Protokoll.
06

Grenzen der Zuschreibung: Modell, Oberfläche und Konfiguration

Eine Evaluation beobachtet kein Modell im Abstrakten, sondern Ausgaben, die über ein bestimmtes System und unter konkreten Bedingungen erzeugt wurden. Das Ergebnis kann von der Variante, den Parametern, dem Zugangsmodus, den Generierungsrichtlinien und jeder nachfolgenden Auswahl oder Verarbeitung abhängen. Werden Dienste mit unterschiedlichen Oberflächen verglichen, lässt sich eine Differenz nicht automatisch dem Modell zuschreiben.

Beim Formulieren sollte man deshalb drei Ebenen unterscheiden: das beobachtete Ergebnis („Diese Stichproben erhielten diese Präferenzen“), eine damit vereinbare Interpretation („In diesem Test wurde unter diesen Bedingungen eine Ausgabe häufiger gewählt“) und die allgemeine Aussage („Das System ist besser“). Die dritte Ebene erfordert mehr Belege als die erste und zweite: unterschiedliche Aufgaben, vergleichbare Bedingungen und Ergebnisse, die die konkret zugeschriebene Eigenschaft stützen.

Die VBench-Repositorien und die Arbeiten zu Video-Bench liefern methodische Bezugspunkte, um mehrdimensionale Evaluationen und ihre Artefakte zu verstehen. Das VBench-Repository umfasst Code, Prompts, Dimensionen, Evaluationsanweisungen sowie Links zu Videos und Konfigurationen. Dass für dieses Projekt reproduzierbare Materialien existieren, bedeutet nicht, dass Prompts, Generierungen oder Konfiguration einer Arena-Evaluation verfügbar sind. Die Reproduzierbarkeit muss für jedes Ergebnis gesondert geprüft werden.

07

Reproduzierbarkeit nach der API-Abschaltung

OpenAI gibt an, dass die API und die Sora-Modelle am 24. September 2026 abgeschaltet werden. Die Hilfedokumentation unterscheidet diese Abschaltung vom Ende der Web- und App-Erfahrungen. Die Ankündigung sollte daher nicht so wiedergegeben werden, als würden alle Zugangsformen notwendigerweise zum selben Zeitpunkt enden. Laut Anbieterdokumentation bezieht sich das Datum auf die Abschaltung der API. Für jede spätere Reproduktion müssen die dann geltenden Bedingungen und der tatsächliche Zugang geprüft werden.

Die methodische Konsequenz ist klar: Ein archiviertes Ergebnis kann eine nützliche Beobachtung bleiben, auch wenn eine neue Generierung mit derselben Konfiguration nicht mehr angefordert werden kann. Eine Bewertung anhand gespeicherter Clips zu wiederholen, ist außerdem nicht dasselbe, wie das Generierungsexperiment zu wiederholen. Im ersten Fall kann das vorhandene Material erneut bewertet werden; im zweiten Fall braucht man Zugang zur Generierung, zur Konfiguration und zu den ursprünglichen Eingaben.

Ein historischer Bericht sollte nennen, was erhalten geblieben ist: Videos, Prompts, Parameter, Datum, Evaluationsanweisungen, aufgeschlüsselte Ergebnisse und Aggregationsverfahren. Ist nur eine Rangliste oder eine veröffentlichte Bewertung erhalten, kann sie als Eintrag dieser Seite zitiert, aber nicht zu einem vollständigen Test rekonstruiert werden. Die verfügbaren Quellen bestätigen nicht, dass all diese Artefakte für die Sora-2-Pro-Rangliste existieren. Ihre Verfügbarkeit ist als Unsicherheit zu behandeln, nicht als Tatsache.

08

Checkliste zur Einordnung von Ergebnissen über Sora 2 Pro

Bevor du ein Ranking in eine redaktionelle oder technische Schlussfolgerung verwandelst, prüfe genau, welche Aussage es stützt. Der Name des Benchmarks, die Bewertung und der Rang in einer Tabelle reichen nicht aus, wenn Aufgabe, Stichproben und Methode unbekannt sind. Auch eine unvollständige Dokumentation kann mit Vorsicht zitiert werden, sofern die Lücken benannt und dem Ergebnis keine Fähigkeit zugeschrieben wird, die es nicht misst.

Vermeide insbesondere den direkten Vergleich einer Präferenzrangliste mit einer dimensionsbezogenen Benchmark-Metrik. Vergleiche auch nicht ohne Prüfung methodischer Änderungen verschiedene Zeiträume derselben Arena. Stelle Ergebnisse unterschiedlicher Modelle zudem nicht so dar, als hätten sie identische Prompts, Parameter und Generierungsmöglichkeiten erhalten, wenn die Quelle das nicht dokumentiert.

Die stärkste Schlussfolgerung, die sich aus den Quellen ziehen lässt, ist methodischer Art: Eine Präferenz kann zeigen, welche Stichprobe innerhalb eines konkreten Protokolls besser gefiel; eine Batterie expliziter Aufgaben kann abgegrenzte Eigenschaften untersuchen; und Reproduzierbarkeit hängt von Artefakten und Zugängen ab, deren Verfügbarkeit überprüft werden muss. Keiner dieser Bausteine allein rechtfertigt eine allgemeingültige Aussage über die Qualität von Sora 2 Pro.

Redaktionelle Prüfliste

Wenn eine Antwort in der Quelle nicht zu finden ist, kennzeichne sie als unbekannt, statt sie abzuleiten.

PrüfungErgebnis der Prüfung
Sind Variante, Zugangsweg und Datum angegeben?Ja / Nein / Teilweise
Sind Modalität, Größe, Dauer und Audio spezifiziert?Ja / Nein / Teilweise
Sind Prompts, Generierungen je Eingabe und Auswahl der Stichproben veröffentlicht?Ja / Nein / Teilweise
Misst die Bewertung die behauptete Eigenschaft?Ja / Nein / Nicht feststellbar
Werden Unsicherheit und Aggregationsmethode angegeben?Ja / Nein / Teilweise
Gibt es genügend Artefakte für eine erneute Bewertung oder Generierung?Erneute Bewertung / Neue Generierung / Nicht geklärt

Offene Fragen

  • Die verfügbaren Quellen nennen hier nicht den Zahlenwert der Bewertung und des Intervalls für Sora 2 Pro bei Arena; der Artikel gibt sie daher nicht wieder.
  • Es liegen nicht genügend Angaben zu den Prompts, Generierungsbedingungen, Zahl der Ausgaben oder Auswahlregeln vor, die in Arenas Rangliste verwendet wurden.
  • Es ist nicht bestätigt, welche Videos, Konfigurationen oder Evaluationsdaten zu Sora 2 Pro archiviert bleiben und ob sie eine vollständige Wiederholung der Evaluation ermöglichen.
  • Die offizielle Dokumentation kündigt die Abschaltung der API für den 24. September 2026 an; tatsächlicher Zugang und geltende Bedingungen sollten zeitnah geprüft werden.
  • Die Arena-Seite nennt einen Stichtag. Aus den vorliegenden Quellen geht jedoch nicht hervor, welche konkreten methodischen Änderungen gegebenenfalls die einzelnen Zeiträume der Ergebnisse beeinflussen.
09

Weiter entdecken

09

Verwendete Quellen

03

Korrekturen und Transparenz

Wenn du falsche oder veraltete Angaben findest, sende uns die Seite und die zu prüfende Quelle.

Korrektur vorschlagen