Ilustración editorial para Scribe v2 en los benchmarks de voz: qué comparan sus puntuaciones y qué falta para reproducirlas
Imagen generada con gpt-image-2.5-sunburst para InferamaFuente ↗
01

Una afirmación de liderazgo necesita un protocolo detrás

ElevenLabs presentó Scribe v2 afirmando que obtenía el menor WER en benchmarks del sector. Es una afirmación del proveedor, no una conclusión independiente que pueda aceptarse sin conocer qué pruebas se compararon, con qué versiones y bajo qué reglas. La página de lanzamiento permite atribuir correctamente la afirmación, pero no identifica los benchmarks concretos que la sostienen ni proporciona un protocolo suficiente para repetir el cálculo.

Esto no demuestra que la afirmación sea falsa. Significa que, con la información documentada en esa página, un lector externo no puede reconstruir qué audios se usaron, cuál era el tamaño de la muestra, cómo se prepararon las transcripciones de referencia o qué otros sistemas participaron. Sin esos detalles, «el menor WER» debe leerse como una declaración cuyo alcance no queda establecido públicamente en esa fuente, no como prueba de superioridad universal.

Hay, además, una evaluación independiente que conviene mantener separada de la afirmación de lanzamiento: Artificial Analysis publica AA-WER v2.0, un benchmark que informa resultados de Scribe v2. Su existencia aporta una referencia concreta para examinar, pero no verifica automáticamente los benchmarks aludidos por ElevenLabs. Cada resultado pertenece a su propio conjunto de datos, protocolo y fecha de ejecución.

02

Qué mide el WER y qué deja fuera

El WER, o tasa de error de palabras, compara una transcripción automática con una transcripción de referencia. Cuenta sustituciones, eliminaciones e inserciones respecto del texto de referencia, y expresa el total como proporción de las palabras de ese texto. Es útil para resumir discrepancias, pero no mide por sí solo la utilidad de una transcripción ni la gravedad práctica de cada error.

Dos sistemas pueden obtener la misma puntuación y equivocarse de formas distintas. Confundir un nombre propio puede ser más costoso en una reunión que omitir una palabra de relleno; sin embargo, una métrica agregada no asigna importancia según el contexto. Tampoco informa directamente sobre latencia, estabilidad de la salida en directo, diarización, legibilidad o coste. Esas dimensiones requieren medidas y pruebas adicionales.

El resultado también depende de qué se considera una palabra y de cómo se normalizan tanto la referencia como la salida del sistema antes de compararlas. Las diferencias de mayúsculas, puntuación, números, contracciones o palabras vacilantes pueden modificar el recuento si las reglas no son comunes. NIST documenta la normalización de referencias como parte de su plan de evaluación OpenASR; por eso, publicar la regla aplicada es parte del protocolo, no un detalle editorial.

La unidad de comparación importa. Una referencia puede dividir el discurso de una forma y la transcripción del modelo de otra. Si el sistema trabaja por fragmentos, si se concatenan segmentos o si se excluyen partes del audio, el procedimiento puede alterar qué errores entran en el cálculo. Por tanto, una cifra sin definición de corpus, referencia, normalización y segmentación no permite saber con precisión qué se está midiendo.

03

El corpus determina el alcance de la conclusión

Una puntuación resume el comportamiento sobre un conjunto determinado, no sobre todo el audio que una organización podría procesar. La selección de grabaciones, sus duraciones, idiomas, acentos, condiciones acústicas y tipos de habla delimitan qué población de ejemplos queda representada. Un resultado promedio puede ocultar diferencias entre idiomas o condiciones si no se publican los resultados desglosados y el número de muestras de cada grupo.

FLEURS ofrece contexto sobre una clase de evaluación multilingüe: el artículo original describe un conjunto de datos para 102 idiomas y explica su propósito de evaluación de representaciones de voz. Que un benchmark incluya varios idiomas no significa que mida de manera exhaustiva todos los usos reales, ni que un promedio entre idiomas represente las necesidades de cada equipo. Para interpretar un resultado hay que conocer qué idiomas se evaluaron, cómo se ponderaron y cuántas muestras contribuyeron a cada puntuación.

AA-WER v2.0 identifica varios conjuntos en su evaluación y distingue AA-AgentTalk, que es propietario, de VoxPopuli y Earnings22. Esa distinción es relevante: un benchmark puede combinar conjuntos con condiciones y disponibilidad diferentes. La presencia de conjuntos cuyo acceso es limitado reduce la posibilidad de que terceros reproduzcan toda la evaluación de manera idéntica, aunque puedan analizar el protocolo publicado o repetir partes con datos disponibles.

La licencia de los audios también condiciona la reproducibilidad. Un conjunto puede ser conocido y estar descrito, pero no necesariamente redistribuirse o emplearse libremente para repetir una prueba. Si los archivos no pueden compartirse, la documentación debería explicar cómo se obtuvo acceso, qué subconjunto se empleó y qué artefactos alternativos se ofrecen para que la comparación pueda auditarse.

Preguntas para delimitar el alcance de un resultado

ElementoQué conviene verificarPor qué afecta la lectura
CorpusNombre, versión, licencia y criterios de inclusiónDefine qué datos y usos representa la prueba
MuestraNúmero de grabaciones, duración y exclusionesPermite valorar cobertura y posibles sesgos de selección
Idiomas y condicionesResultados por estrato y tamaño de cada grupoEvita que un promedio oculte diferencias importantes
PonderaciónCómo se combinan los resultados de cada conjuntoUn promedio puede cambiar según el peso asignado a cada fuente
04

Configuración, prompting y variantes del producto

La etiqueta de un modelo no basta para identificar una ejecución reproducible. Para comparar una puntuación hacen falta, como mínimo, el identificador exacto del modelo, la fecha de acceso o ejecución y los parámetros relevantes. Los servicios pueden actualizarse, y una evaluación hecha en una fecha no necesariamente representa el comportamiento de una versión posterior. La documentación disponible sobre capacidades ayuda a distinguir productos, pero no revela por sí sola la configuración histórica de una prueba de lanzamiento.

También hay que aclarar si se utilizó keyterm prompting. La documentación de ElevenLabs describe el parámetro keyterms para la API batch. Proporcionar términos conocidos puede ayudar a orientar el reconocimiento de vocabulario específico; por eso, una evaluación con esa información no es directamente equivalente a otra sin ella. Para interpretar el resultado deben publicarse los términos facilitados, el criterio para seleccionarlos y si se aplicó el mismo tipo de ventaja contextual a todos los sistemas comparados.

Scribe v2 y Scribe v2 Realtime no deberían tratarse como una sola entrada de benchmark sin especificar el producto evaluado. La documentación de ElevenLabs los distingue en su oferta de transcripción. Una prueba sobre audio grabado procesado en modo batch y una prueba de transcripción en directo responden a condiciones distintas: en esta última pueden importar la llegada progresiva del audio y la latencia, además de la precisión final. Si se mezclan resultados de ambos modos, una única clasificación pierde significado.

La metodología de Artificial Analysis también distingue la evaluación batch de la evaluación streaming. Esa separación es una razón práctica para exigir que cada cifra indique el modo utilizado. No permite inferir, por sí sola, qué modo se usó en cada afirmación de la página de lanzamiento de ElevenLabs; esa información tendría que acompañar a la puntuación concreta.

Información de configuración que debe acompañar a la puntuación

DatoPregunta de auditoríaRiesgo si falta
Modelo y versión¿Qué identificador exacto y fecha de ejecución se registraron?No se puede saber si otra persona evaluó la misma versión
Modo¿Se procesó audio grabado o se evaluó transcripción en directo?Se comparan condiciones funcionales diferentes
Keyterms¿Se proporcionaron términos y cuáles fueron?Una ventaja contextual puede confundirse con el rendimiento sin ayuda
Segmentación¿Cómo se dividió, concatenó o excluyó el audio?La unidad puntuada puede no ser equivalente entre sistemas
05

Cuándo son comparables dos puntuaciones

La comparación más sólida utiliza los mismos archivos de audio, las mismas referencias y las mismas reglas de puntuación. También mantiene condiciones equivalentes de idioma, segmentación y acceso a contexto. Si los proveedores reciben instrucciones o vocabularios diferentes, o si un sistema procesa fragmentos mientras otro recibe grabaciones completas, el resultado puede reflejar tanto esas diferencias como las capacidades de reconocimiento.

En la práctica, no siempre es posible ejecutar todos los servicios con condiciones perfectamente idénticas. En ese caso, lo correcto es documentar las diferencias y limitar la conclusión. Un benchmark puede servir para orientar una evaluación, aunque no permita una comparación causal estricta entre modelos. El problema aparece cuando una cifra se presenta sin las condiciones necesarias para distinguir rendimiento del sistema y efecto del protocolo.

Artificial Analysis publica una metodología para su benchmark de voz a texto y una tabla comparativa no streaming. Esas fuentes permiten situar la puntuación de Scribe v2 dentro de una evaluación concreta. No convierten automáticamente el puesto observado allí en una afirmación sobre todos los benchmarks, idiomas, géneros de audio o variantes en tiempo real. Una posición en una tabla responde a las reglas y participantes de esa tabla.

Proceso breve para auditar una comparación

  1. 01Localizar la afirmación original y anotar a qué producto, métrica y alcance se refiere.
  2. 02Identificar el benchmark, su versión, los conjuntos incluidos, las licencias y el tamaño de la muestra.
  3. 03Revisar las referencias, la normalización, la segmentación y la fórmula de puntuación.
  4. 04Registrar el identificador del modelo, la fecha de ejecución, el modo batch o realtime y el uso de keyterms.
  5. 05Comprobar si todos los sistemas recibieron los mismos audios y condiciones; separar resultados cuando no sea así.
  6. 06Limitar la conclusión a los conjuntos, idiomas y modos efectivamente evaluados, y declarar lo que no puede reproducirse.
06

Qué puede reproducirse y qué sigue sin estar claro

Con las fuentes públicas identificadas se puede describir la afirmación de lanzamiento como una declaración de ElevenLabs y comprobar que existe una evaluación de AA-WER v2.0 que incluye un resultado para Scribe v2. También se puede consultar el planteamiento de FLEURS, la normalización contemplada por NIST, la metodología de Artificial Analysis y la documentación de ElevenLabs sobre keyterms y modelos de transcripción. Son piezas útiles, pero no forman un protocolo único que reproduzca todas las afirmaciones de rendimiento.

La incertidumbre principal es qué benchmarks concretos tenía en mente la página de lanzamiento cuando atribuyó a Scribe v2 el menor WER. La fuente aportada no identifica esos benchmarks ni expone el protocolo correspondiente. Tampoco permite establecer qué versión exacta del modelo se ejecutó, si se usó prompting, qué normalización se aplicó o cómo se trataron los segmentos. No es riguroso completar esos vacíos suponiendo que la configuración coincide con una evaluación posterior.

La existencia de una tabla comparativa independiente tampoco resuelve todas esas preguntas. Para repetir íntegramente un benchmark hacen falta los artefactos y condiciones de la prueba, y la disponibilidad de conjuntos propietarios puede limitar la réplica por terceros. Si el responsable ofrece resultados agregados, conviene comprobar que publique también resultados por conjunto o condición y que explique su ponderación; el promedio no sustituye esa información.

07

Lista mínima para publicar un benchmark de ASR

Un benchmark útil para terceros debe permitir entender tanto el número como el camino que llevó a él. No basta con publicar una clasificación final: los lectores necesitan determinar si el corpus representa su caso, si las reglas son coherentes y si una repetición es viable. La siguiente lista no garantiza que dos servicios sean idénticos en todas sus condiciones, pero hace visibles las diferencias que limitan la comparación.

La incertidumbre también debe comunicarse. Los resultados dependen de la muestra y pueden variar entre subconjuntos. Publicar el número de ejemplos y los resultados desglosados ayuda a valorar esa variación; si se informa un margen o intervalo, se debe explicar cómo se calculó. Sin esa información, una diferencia pequeña entre dos puntuaciones no debería convertirse automáticamente en una conclusión firme sobre cuál sistema es mejor.

Elementos que debería incluir el informe

  1. 01Nombre y versión del benchmark, conjuntos de datos, licencias, idiomas y criterios de selección.
  2. 02Lista de archivos o identificadores de muestra, duración total, exclusiones y motivos de exclusión, respetando las licencias aplicables.
  3. 03Transcripciones de referencia o una descripción reproducible de cómo se obtuvieron, junto con las reglas de normalización.
  4. 04Identificador del modelo y fecha de ejecución, modo de uso, parámetros relevantes y cualquier keyterm proporcionado.
  5. 05Reglas de segmentación, concatenación, puntuación y cálculo del WER.
  6. 06Resultados por conjunto, idioma y condición, además del agregado, con tamaños de muestra y ponderaciones.
  7. 07Artefactos o instrucciones para repetir la evaluación y una explicación de las limitaciones de acceso a datos propietarios.
08

Conclusión: usar la puntuación como señal, no como garantía

Las puntuaciones publicadas pueden ayudar a seleccionar candidatos para una prueba propia, pero no garantizan el rendimiento en una organización o tipo de audio concreto. La afirmación de ElevenLabs sobre el menor WER debe conservar su atribución y su alcance no debe ampliarse sin identificar los benchmarks y protocolos a los que se refiere. AA-WER v2.0 aporta una evaluación identificable de Scribe v2, pero sus conclusiones pertenecen a ese benchmark y a sus condiciones.

Para decidir una migración, un equipo debería probar muestras representativas de sus idiomas, grabaciones, nombres propios y condiciones acústicas, aplicar reglas de referencia coherentes y evaluar por separado las funciones que importan en su flujo de trabajo. Si necesita transcripción en directo, debe evaluar la variante y las métricas correspondientes a ese modo, no extrapolar desde una prueba batch.

La conclusión prudente no es que Scribe v2 sea un ganador general ni que las cifras carezcan de valor. Es que un WER solo informa con rigor cuando va acompañado del corpus, la versión, la configuración y las reglas de cálculo. Si esos datos faltan, la puntuación puede servir como indicio, pero no como comparación reproducible ni como garantía de resultados futuros.

Qué sigue abierto

  • La página de lanzamiento de ElevenLabs no especifica qué benchmarks concretos sustentan su afirmación de menor WER.
  • Con las fuentes aportadas no se puede reconstruir la versión exacta, fecha de ejecución, configuración, normalización o segmentación de las pruebas de lanzamiento.
  • La disponibilidad de conjuntos propietarios, como AA-AgentTalk, puede limitar la reproducción íntegra del benchmark por terceros.
  • No se aportan datos suficientes para determinar si la afirmación de lanzamiento utilizó keyterm prompting ni qué términos se habrían proporcionado.
09

Continúa explorando

09

Fuentes consultadas

03

Correcciones y transparencia

Si detectas un dato incorrecto o desactualizado, puedes enviarnos una corrección indicando la página y la fuente que debemos revisar.

Proponer una corrección