Ilustración editorial para Scribe v2 en los benchmarks de voz: qué comparan sus puntuaciones y qué falta para reproducirlas
Imagen generada con gpt-image-2.5-sunburst para InferamaQuelle ↗
01

Eine Führungsbehauptung braucht ein nachvollziehbares Protokoll

ElevenLabs stellte Scribe v2 mit der Behauptung vor, das Modell erreiche den niedrigsten WER in Benchmarks der Branche. Das ist eine Aussage des Anbieters und keine unabhängige Schlussfolgerung, die sich ohne Kenntnis der verglichenen Tests, Modellversionen und Bewertungsregeln übernehmen lässt. Die Ankündigungsseite erlaubt es, die Behauptung korrekt zuzuordnen. Sie nennt jedoch weder die konkreten Benchmarks, auf denen sie beruht, noch ein ausreichend dokumentiertes Protokoll, mit dem sich die Berechnung wiederholen ließe.

Damit ist nicht belegt, dass die Behauptung falsch ist. Es bedeutet vielmehr, dass externe Leserinnen und Leser anhand der Angaben auf dieser Seite nicht rekonstruieren können, welche Audiodateien verwendet wurden, wie groß die Stichprobe war, wie die Referenztranskripte aufbereitet wurden oder welche anderen Systeme am Vergleich teilnahmen. Ohne solche Details sollte „niedrigster WER“ als Aussage verstanden werden, deren öffentlich dokumentierter Geltungsbereich in dieser Quelle nicht feststeht – und nicht als Beleg für eine allgemeine Überlegenheit.

Daneben gibt es eine unabhängige Evaluation, die von der Aussage zur Markteinführung getrennt betrachtet werden sollte: Artificial Analysis veröffentlicht AA-WER v2.0, einen Benchmark, der Ergebnisse für Scribe v2 ausweist. Das bietet einen konkreten Bezugspunkt für eine Prüfung, bestätigt aber nicht automatisch die Benchmarks, auf die sich ElevenLabs in der Ankündigung bezieht. Jedes Ergebnis gehört zu seinem eigenen Datensatz, Protokoll und Ausführungszeitpunkt.

02

Was WER misst – und was nicht

WER, die Wortfehlerrate (Word Error Rate), vergleicht eine automatische Transkription mit einem Referenztranskript. Gezählt werden Ersetzungen, Auslassungen und Einfügungen im Verhältnis zum Referenztext; die Summe wird als Anteil der Wörter in diesem Text ausgedrückt. Die Kennzahl ist nützlich, um Abweichungen zusammenzufassen. Für sich genommen misst sie jedoch weder den Nutzen einer Transkription noch die praktische Schwere einzelner Fehler.

Zwei Systeme können denselben Wert erreichen und sich auf unterschiedliche Weise irren. Einen Eigennamen in einer Besprechung falsch zu erkennen kann schwerer wiegen, als ein Füllwort auszulassen. Eine aggregierte Kennzahl gewichtet Fehler jedoch nicht nach ihrem jeweiligen Kontext. Sie sagt außerdem nicht unmittelbar etwas über Latenz, Stabilität laufender Ausgaben, Sprecherzuordnung, Lesbarkeit oder Kosten aus. Diese Aspekte erfordern zusätzliche Messgrößen und Tests.

Das Ergebnis hängt auch davon ab, was als Wort gilt und wie sowohl die Referenz als auch die Systemausgabe vor dem Vergleich normalisiert werden. Unterschiede bei Groß- und Kleinschreibung, Zeichensetzung, Zahlen, Kontraktionen oder Zögerungswörtern können die Zählung verändern, wenn keine gemeinsamen Regeln gelten. NIST behandelt die Normalisierung von Referenzen in seinem Evaluationsplan für OpenASR als Teil des Testverfahrens. Die verwendete Regel zu veröffentlichen ist deshalb Bestandteil des Protokolls und keine bloße redaktionelle Nebensache.

Auch die Einheit des Vergleichs ist wichtig. Die Referenz kann die Rede anders segmentieren als die Modellausgabe. Arbeitet ein System mit Abschnitten, werden Segmente zusammengefügt oder Teile des Audios ausgeschlossen, kann das Verfahren beeinflussen, welche Fehler in die Berechnung eingehen. Eine Zahl ohne Angaben zu Korpus, Referenz, Normalisierung und Segmentierung lässt daher nicht präzise erkennen, was tatsächlich gemessen wurde.

03

Der Korpus bestimmt, wie weit sich eine Schlussfolgerung übertragen lässt

Ein Wert fasst das Verhalten eines Systems auf einem bestimmten Datensatz zusammen – nicht auf sämtlichen Audiodaten, die eine Organisation verarbeiten könnte. Auswahl und Dauer der Aufnahmen, Sprachen, Akzente, akustische Bedingungen und Sprechweisen legen fest, welche Beispiele die Stichprobe abbildet. Ein Durchschnittswert kann Unterschiede zwischen Sprachen oder Bedingungen verdecken, wenn weder aufgeschlüsselte Ergebnisse noch die Stichprobengröße der einzelnen Gruppen veröffentlicht werden.

FLEURS bietet Kontext für eine bestimmte Art mehrsprachiger Evaluation: Die Originalarbeit beschreibt einen Datensatz für 102 Sprachen und erläutert seinen Zweck bei der Evaluation von Sprachrepräsentationen. Dass ein Benchmark mehrere Sprachen umfasst, bedeutet nicht, dass er sämtliche Anwendungen in der Praxis abdeckt oder dass ein sprachübergreifender Durchschnitt den Bedarf jedes Teams widerspiegelt. Für die Einordnung eines Ergebnisses muss bekannt sein, welche Sprachen getestet wurden, wie sie gewichtet wurden und wie viele Beispiele jeweils in die Bewertung eingingen.

AA-WER v2.0 nennt mehrere Datensätze in seiner Evaluation und unterscheidet dabei das proprietäre AA-AgentTalk von VoxPopuli und Earnings22. Diese Unterscheidung ist wichtig: Ein Benchmark kann Datensätze mit unterschiedlichen Bedingungen und Zugangsrechten kombinieren. Wenn einzelne Datensätze nur eingeschränkt zugänglich sind, können Dritte die gesamte Evaluation womöglich nicht identisch wiederholen. Sie können zwar das veröffentlichte Protokoll prüfen oder Teile mit verfügbaren Daten nachstellen, doch das ist nicht dasselbe wie eine vollständige Reproduktion.

Auch die Lizenz der Audiodaten beeinflusst die Reproduzierbarkeit. Ein Datensatz kann bekannt und gut beschrieben sein, ohne dass er sich frei weitergeben oder zur Wiederholung eines Tests verwenden lässt. Können die Dateien nicht geteilt werden, sollte die Dokumentation erläutern, wie Zugang erlangt wurde, welche Teilmenge verwendet wurde und welche alternativen Artefakte eine Prüfung des Vergleichs ermöglichen.

Fragen, mit denen sich die Aussagekraft eines Ergebnisses eingrenzen lässt

AspektWas geprüft werden sollteWarum es für die Einordnung wichtig ist
KorpusName, Version, Lizenz und EinschlusskriterienLegt fest, welche Daten und Anwendungsfälle der Test repräsentiert
StichprobeZahl der Aufnahmen, Dauer und AusschlüsseHilft, Abdeckung und mögliche Verzerrungen durch die Auswahl zu beurteilen
Sprachen und BedingungenErgebnisse je Gruppe und GruppengrößeVerhindert, dass ein Durchschnitt wichtige Unterschiede verdeckt
GewichtungWie Ergebnisse aus den einzelnen Datensätzen kombiniert werdenEin Durchschnitt kann sich je nach Gewichtung der Quellen ändern
04

Konfiguration, Keyterm Prompting und Produktvarianten

Die Modellbezeichnung allein reicht nicht aus, um einen reproduzierbaren Lauf zu identifizieren. Für den Vergleich eines Ergebnisses braucht man mindestens die genaue Modellkennung, das Zugriffs- oder Ausführungsdatum und die relevanten Parameter. Dienste können aktualisiert werden; eine Evaluation zu einem bestimmten Zeitpunkt muss daher nicht das Verhalten einer späteren Version wiedergeben. Die verfügbare Dokumentation zu den Funktionen hilft, die Produkte auseinanderzuhalten, legt aber nicht von selbst die historische Konfiguration eines Tests zur Markteinführung offen.

Außerdem muss geklärt werden, ob Keyterm Prompting eingesetzt wurde. Die Dokumentation von ElevenLabs beschreibt für die Batch-API den Parameter „keyterms“. Die Angabe bekannter Begriffe kann die Erkennung eines bestimmten Vokabulars unterstützen. Eine Evaluation mit solchen Hinweisen ist daher nicht ohne Weiteres mit einem Test ohne sie gleichzusetzen. Für die Einordnung des Ergebnisses sollten die bereitgestellten Begriffe, die Auswahlkriterien und die Frage dokumentiert werden, ob alle verglichenen Systeme dieselbe Art kontextueller Unterstützung erhielten.

Scribe v2 und Scribe v2 Realtime sollten nicht ohne nähere Angaben als ein und derselbe Benchmark-Eintrag behandelt werden. ElevenLabs unterscheidet die beiden in seiner Transkriptionsdokumentation. Ein Test mit aufgezeichnetem Audio im Batch-Modus und eine Evaluation von Live-Transkription betreffen unterschiedliche Bedingungen. Bei Letzterer können neben der endgültigen Genauigkeit auch das schrittweise Eintreffen des Audios und die Latenz eine Rolle spielen. Werden Ergebnisse beider Modi vermischt, verliert eine gemeinsame Rangliste an Aussagekraft.

Auch die Methodik von Artificial Analysis unterscheidet zwischen Batch- und Streaming-Evaluation. Das ist ein praktischer Grund dafür, für jeden Wert den verwendeten Modus anzugeben. Daraus lässt sich jedoch nicht ableiten, welcher Modus bei den einzelnen Aussagen auf der Ankündigungsseite von ElevenLabs zum Einsatz kam. Diese Information müsste zusammen mit dem konkreten Ergebnis veröffentlicht werden.

Konfigurationsangaben, die zusammen mit einem Ergebnis veröffentlicht werden sollten

AngabePrüffrageRisiko bei fehlender Information
Modell und VersionWelche genaue Modellkennung und welches Ausführungsdatum wurden festgehalten?Es lässt sich nicht feststellen, ob eine andere Person dieselbe Version getestet hat
ModusWurde aufgezeichnetes Audio verarbeitet oder Live-Transkription bewertet?Funktional unterschiedliche Bedingungen werden miteinander verglichen
KeytermsWurden Begriffe vorgegeben, und wenn ja, welche?Ein kontextueller Vorteil kann mit Leistung ohne Unterstützung verwechselt werden
SegmentierungWie wurde das Audio geteilt, zusammengefügt oder ausgeschlossen?Die bewertete Einheit ist möglicherweise nicht zwischen Systemen vergleichbar
05

Wann zwei Bewertungen vergleichbar sind

Der belastbarste Vergleich verwendet dieselben Audiodateien, dieselben Referenzen und dieselben Bewertungsregeln. Außerdem sollten die Bedingungen hinsichtlich Sprache, Segmentierung und bereitgestelltem Kontext gleichwertig sein. Erhalten Anbieter unterschiedliche Anweisungen oder Wortlisten, oder verarbeitet ein System einzelne Ausschnitte, während ein anderes vollständige Aufnahmen bekommt, kann das Ergebnis sowohl diese Unterschiede als auch die Erkennungsfähigkeit widerspiegeln.

In der Praxis ist es nicht immer möglich, alle Dienste unter vollkommen identischen Bedingungen auszuführen. In diesem Fall sollten die Abweichungen dokumentiert und die Schlussfolgerungen entsprechend eingegrenzt werden. Ein Benchmark kann eine Evaluation orientieren, auch wenn er keinen streng kausalen Vergleich zwischen Modellen zulässt. Problematisch wird es, wenn ein Wert ohne die nötigen Bedingungen veröffentlicht wird, um die Leistung des Systems von den Auswirkungen des Testprotokolls zu unterscheiden.

Artificial Analysis veröffentlicht eine Methodik für seinen Speech-to-Text-Benchmark sowie eine Vergleichstabelle für nicht-streamende Systeme. Diese Quellen ermöglichen es, das Ergebnis von Scribe v2 innerhalb einer konkreten Evaluation einzuordnen. Sie machen die dort beobachtete Platzierung jedoch nicht automatisch zu einer Aussage über sämtliche Benchmarks, Sprachen, Audioarten oder Echtzeitvarianten. Ein Ranglistenplatz gilt für die Regeln und Teilnehmenden der jeweiligen Tabelle.

Kurzes Verfahren zur Prüfung eines Vergleichs

  1. 01Die ursprüngliche Aussage auffinden und festhalten, auf welches Produkt, welche Kennzahl und welchen Geltungsbereich sie sich bezieht.
  2. 02Benchmark, Version, enthaltene Datensätze, Lizenzen und Stichprobengröße ermitteln.
  3. 03Referenzen, Normalisierung, Segmentierung und Bewertungsformel prüfen.
  4. 04Modellkennung, Ausführungsdatum, Batch- oder Realtime-Modus und Verwendung von Keyterms dokumentieren.
  5. 05Prüfen, ob alle Systeme dieselben Audiodateien und Bedingungen erhielten; andernfalls die Ergebnisse getrennt ausweisen.
  6. 06Die Schlussfolgerung auf tatsächlich getestete Datensätze, Sprachen und Modi beschränken und angeben, was sich nicht reproduzieren lässt.
06

Was sich reproduzieren lässt – und was unklar bleibt

Anhand der hier identifizierten öffentlichen Quellen lässt sich die Aussage zur Markteinführung als Erklärung von ElevenLabs beschreiben. Ebenso lässt sich überprüfen, dass AA-WER v2.0 existiert und ein Ergebnis für Scribe v2 enthält. Außerdem können der Ansatz von FLEURS, die von NIST behandelte Normalisierung, die Methodik von Artificial Analysis und die Dokumentation von ElevenLabs zu Keyterms und Transkriptionsmodellen herangezogen werden. Das sind nützliche Bausteine, aber sie ergeben kein einheitliches Protokoll, mit dem sich sämtliche Leistungsbehauptungen reproduzieren ließen.

Die zentrale offene Frage lautet, welche konkreten Benchmarks die Ankündigungsseite meinte, als sie Scribe v2 den niedrigsten WER zuschrieb. Die angegebene Quelle benennt diese Benchmarks nicht und legt das zugehörige Protokoll nicht offen. Ebenso wenig lässt sich daraus die genau getestete Modellversion, der Einsatz von Prompting, die verwendete Normalisierung oder der Umgang mit Segmenten ermitteln. Es wäre nicht sachgerecht, diese Lücken mit der Annahme zu füllen, die Konfiguration entspreche einer späteren Evaluation.

Auch eine unabhängige Vergleichstabelle beantwortet nicht automatisch alle diese Fragen. Um einen Benchmark vollständig zu wiederholen, braucht man die Artefakte und Testbedingungen. Der eingeschränkte Zugang zu proprietären Datensätzen kann eine Reproduktion durch Dritte begrenzen. Wenn die verantwortliche Stelle aggregierte Ergebnisse ausweist, sollte geprüft werden, ob sie zusätzlich Ergebnisse je Datensatz oder Bedingung veröffentlicht und die Gewichtung erläutert. Ein Durchschnitt ersetzt diese Angaben nicht.

07

Mindest-Checkliste für die Veröffentlichung eines ASR-Benchmarks

Ein Benchmark, der für Dritte nützlich sein soll, muss sowohl die Zahl als auch den Weg zu ihrer Berechnung verständlich machen. Eine abschließende Rangliste allein reicht nicht: Leserinnen und Leser müssen beurteilen können, ob der Korpus ihren Anwendungsfall abbildet, ob die Regeln konsistent sind und ob sich der Test wiederholen lässt. Die folgende Liste garantiert nicht, dass zwei Dienste unter allen Bedingungen identisch sind. Sie macht jedoch Unterschiede sichtbar, die den Vergleich einschränken.

Auch Unsicherheit sollte kommuniziert werden. Ergebnisse hängen von der Stichprobe ab und können sich zwischen Teilmengen unterscheiden. Die Anzahl der Beispiele und aufgeschlüsselte Ergebnisse helfen, diese Schwankungen einzuschätzen. Wird eine Spanne oder ein Intervall angegeben, sollte erläutert werden, wie es berechnet wurde. Fehlen solche Informationen, sollte ein kleiner Unterschied zwischen zwei Werten nicht automatisch zu einer eindeutigen Aussage darüber führen, welches System besser ist.

Angaben, die der Bericht enthalten sollte

  1. 01Name und Version des Benchmarks, verwendete Datensätze, Lizenzen, Sprachen und Auswahlkriterien.
  2. 02Dateiliste oder Beispielkennungen, Gesamtdauer, Ausschlüsse und deren Begründung – unter Beachtung der geltenden Lizenzen.
  3. 03Referenztranskripte oder eine reproduzierbare Beschreibung ihrer Erstellung sowie die Normalisierungsregeln.
  4. 04Modellkennung und Ausführungsdatum, Nutzungsmodus, relevante Parameter und alle vorgegebenen Keyterms.
  5. 05Regeln für Segmentierung, Zusammenführung, Bewertung und Berechnung des WER.
  6. 06Ergebnisse je Datensatz, Sprache und Bedingung zusätzlich zum Gesamtwert, einschließlich Stichprobengrößen und Gewichtungen.
  7. 07Artefakte oder Anweisungen zur Wiederholung der Evaluation sowie eine Erläuterung der Einschränkungen beim Zugang zu proprietären Daten.
08

Fazit: Bewertungen als Hinweis nutzen, nicht als Garantie

Veröffentlichte Bewertungen können dabei helfen, Kandidaten für einen eigenen Test auszuwählen. Sie garantieren jedoch keine Leistung in einer bestimmten Organisation oder bei einer konkreten Art von Audio. Die Behauptung von ElevenLabs zum niedrigsten WER sollte dem Anbieter zugeschrieben und ihr Geltungsbereich nicht ausgeweitet werden, solange die gemeinten Benchmarks und Protokolle nicht identifiziert sind. AA-WER v2.0 bietet eine konkret benannte Evaluation von Scribe v2. Ihre Schlussfolgerungen gelten jedoch für diesen Benchmark und seine Bedingungen.

Vor einer Migration sollte ein Team repräsentative Beispiele aus den eigenen Sprachen, Aufnahmen, Eigennamen und akustischen Bedingungen testen, einheitliche Referenzregeln anwenden und die für den eigenen Arbeitsablauf wichtigen Funktionen getrennt bewerten. Wird Live-Transkription benötigt, sollte das Team die passende Variante und die zugehörigen Kennzahlen für diesen Modus prüfen, statt Ergebnisse aus einem Batch-Test darauf zu übertragen.

Die vorsichtige Schlussfolgerung lautet weder, dass Scribe v2 allgemein überlegen ist, noch, dass die veröffentlichten Zahlen wertlos sind. Ein WER ist nur dann aussagekräftig, wenn er zusammen mit Korpus, Version, Konfiguration und Berechnungsregeln dokumentiert wird. Fehlen diese Angaben, kann der Wert ein Anhaltspunkt sein – aber weder ein reproduzierbarer Vergleich noch eine Garantie für künftige Ergebnisse.

Offene Fragen

  • Die Ankündigungsseite von ElevenLabs nennt nicht die konkreten Benchmarks, auf denen die Behauptung zum niedrigsten WER beruht.
  • Mit den angegebenen Quellen lassen sich die genaue Version, der Ausführungszeitpunkt, die Konfiguration, Normalisierung und Segmentierung der Tests zur Markteinführung nicht rekonstruieren.
  • Der eingeschränkte Zugang zu proprietären Datensätzen wie AA-AgentTalk kann die vollständige Reproduktion des Benchmarks durch Dritte begrenzen.
  • Es liegen nicht genügend Angaben vor, um festzustellen, ob bei der Behauptung zur Markteinführung Keyterm Prompting verwendet wurde und welche Begriffe gegebenenfalls vorgegeben wurden.
09

Weiter entdecken

09

Verwendete Quellen

03

Korrekturen und Transparenz

Wenn du falsche oder veraltete Angaben findest, sende uns die Seite und die zu prüfende Quelle.

Korrektur vorschlagen