Ilustración editorial para Scribe v2 en los benchmarks de voz: qué comparan sus puntuaciones y qué falta para reproducirlas
Imagen generada con gpt-image-2.5-sunburst para InferamaFonte ↗
01

Uma afirmação de liderança precisa de um protocolo por trás

A ElevenLabs apresentou o Scribe v2 afirmando que ele obtém o menor WER nos benchmarks do setor. Trata-se de uma afirmação do fornecedor, não de uma conclusão independente que possa ser aceita sem saber quais testes foram comparados, com quais versões e sob quais regras. A página de lançamento permite atribuir corretamente a afirmação, mas não identifica os benchmarks específicos que a sustentam nem fornece um protocolo suficiente para repetir o cálculo.

Isso não demonstra que a afirmação seja falsa. Significa que, com as informações documentadas nessa página, um leitor externo não consegue reconstruir quais áudios foram usados, qual era o tamanho da amostra, como as transcrições de referência foram preparadas ou quais outros sistemas participaram. Sem esses detalhes, «o menor WER» deve ser entendido como uma declaração cujo alcance não está estabelecido publicamente nessa fonte, e não como prova de superioridade universal.

Há também uma avaliação independente que deve ser mantida separada da afirmação de lançamento: a Artificial Analysis publica o AA-WER v2.0, um benchmark que apresenta resultados do Scribe v2. Sua existência oferece uma referência concreta para análise, mas não verifica automaticamente os benchmarks mencionados pela ElevenLabs. Cada resultado pertence ao seu próprio conjunto de dados, protocolo e data de execução.

02

O que o WER mede — e o que deixa de fora

O WER, ou taxa de erro de palavras, compara uma transcrição automática com uma transcrição de referência. Ele conta substituições, exclusões e inserções em relação ao texto de referência e expressa o total como uma proporção das palavras desse texto. É útil para resumir discrepâncias, mas, por si só, não mede a utilidade de uma transcrição nem a gravidade prática de cada erro.

Dois sistemas podem obter a mesma pontuação e cometer erros diferentes. Confundir um nome próprio pode ser mais prejudicial em uma reunião do que omitir uma palavra de preenchimento; no entanto, uma métrica agregada não atribui importância conforme o contexto. Ela também não informa diretamente sobre latência, estabilidade da saída ao vivo, diarização, legibilidade ou custo. Essas dimensões exigem métricas e testes adicionais.

O resultado também depende do que é considerado uma palavra e de como a referência e a saída do sistema são normalizadas antes da comparação. Diferenças de maiúsculas e minúsculas, pontuação, números, contrações ou palavras de hesitação podem alterar a contagem se as regras não forem comuns. O NIST documenta a normalização das referências como parte do plano de avaliação OpenASR; por isso, publicar a regra aplicada faz parte do protocolo, não é um detalhe editorial.

A unidade de comparação também importa. Uma referência pode dividir a fala de uma maneira e a transcrição do modelo, de outra. Se o sistema trabalha com fragmentos, se os segmentos são concatenados ou se partes do áudio são excluídas, o procedimento pode alterar quais erros entram no cálculo. Portanto, um número sem definição do corpus, da referência, da normalização e da segmentação não permite saber com precisão o que está sendo medido.

03

O corpus delimita o alcance da conclusão

Uma pontuação resume o comportamento em um conjunto específico, não em todo o áudio que uma organização poderia processar. A seleção das gravações, suas durações, idiomas, sotaques, condições acústicas e tipos de fala delimitam a população de exemplos representada. Uma média pode ocultar diferenças entre idiomas ou condições se os resultados desagregados e o número de amostras de cada grupo não forem publicados.

O FLEURS oferece contexto sobre uma classe de avaliação multilíngue: o artigo original descreve um conjunto de dados para 102 idiomas e explica seu propósito na avaliação de representações de fala. O fato de um benchmark incluir vários idiomas não significa que ele meça de forma abrangente todos os usos reais, nem que uma média entre idiomas represente as necessidades de cada equipe. Para interpretar um resultado, é preciso saber quais idiomas foram avaliados, como foram ponderados e quantas amostras contribuíram para cada pontuação.

O AA-WER v2.0 identifica vários conjuntos em sua avaliação e distingue o AA-AgentTalk, que é proprietário, do VoxPopuli e do Earnings22. Essa distinção é relevante: um benchmark pode combinar conjuntos com condições e níveis de disponibilidade diferentes. A presença de conjuntos com acesso limitado reduz a possibilidade de terceiros reproduzirem toda a avaliação de forma idêntica, embora ainda seja possível analisar o protocolo publicado ou repetir partes com dados disponíveis.

A licença dos áudios também condiciona a reprodutibilidade. Um conjunto pode ser conhecido e estar descrito, mas isso não significa necessariamente que possa ser redistribuído ou usado livremente para repetir um teste. Se os arquivos não puderem ser compartilhados, a documentação deve explicar como o acesso foi obtido, qual subconjunto foi usado e quais artefatos alternativos são oferecidos para que a comparação possa ser auditada.

Perguntas para delimitar o alcance de um resultado

ElementoO que convém verificarPor que isso afeta a interpretação
CorpusNome, versão, licença e critérios de inclusãoDefine quais dados e usos o teste representa
AmostraNúmero de gravações, duração e exclusõesPermite avaliar a cobertura e possíveis vieses de seleção
Idiomas e condiçõesResultados por estrato e tamanho de cada grupoEvita que uma média oculte diferenças importantes
PonderaçãoComo os resultados de cada conjunto são combinadosUma média pode mudar conforme o peso atribuído a cada fonte
04

Configuração, prompting e variantes do produto

O nome de um modelo não basta para identificar uma execução reproduzível. Para comparar uma pontuação, são necessários, no mínimo, o identificador exato do modelo e a data de acesso ou execução, além dos parâmetros relevantes. Os serviços podem ser atualizados, e uma avaliação feita em determinada data não representa necessariamente o comportamento de uma versão posterior. A documentação disponível sobre funcionalidades ajuda a distinguir produtos, mas não revela, por si só, a configuração histórica de um teste de lançamento.

Também é preciso esclarecer se foi usado o prompting de termos-chave, ou keyterm prompting. A documentação da ElevenLabs descreve o parâmetro keyterms para a API batch. Fornecer termos conhecidos pode ajudar a orientar o reconhecimento de vocabulário específico; por isso, uma avaliação com essa informação não equivale diretamente a outra sem ela. Para interpretar o resultado, devem ser publicados os termos fornecidos, o critério de seleção e se o mesmo tipo de vantagem contextual foi aplicado a todos os sistemas comparados.

O Scribe v2 e o Scribe v2 Realtime não devem ser tratados como uma única entrada de benchmark sem especificar qual produto foi avaliado. A documentação da ElevenLabs os distingue em sua oferta de transcrição. Um teste com áudio gravado processado em modo batch e um teste de transcrição ao vivo refletem condições diferentes: neste último, a chegada progressiva do áudio e a latência podem importar, além da precisão final. Se resultados dos dois modos forem misturados, uma única classificação perde o sentido.

A metodologia da Artificial Analysis também distingue a avaliação batch da avaliação streaming. Essa separação é uma razão prática para exigir que cada número indique o modo utilizado. Ela não permite inferir, por si só, qual modo foi usado em cada afirmação da página de lançamento da ElevenLabs; essa informação precisaria acompanhar a pontuação específica.

Informações de configuração que devem acompanhar a pontuação

DadoPergunta de auditoriaRisco se estiver ausente
Modelo e versãoQual identificador exato e data de execução foram registrados?Não é possível saber se outra pessoa avaliou a mesma versão
ModoFoi processado áudio gravado ou avaliada a transcrição ao vivo?São comparadas condições funcionais diferentes
KeytermsForam fornecidos termos? Quais?Uma vantagem contextual pode ser confundida com o desempenho sem assistência
SegmentaçãoComo o áudio foi dividido, concatenado ou excluído?A unidade pontuada pode não ser equivalente entre os sistemas
05

Quando duas pontuações são comparáveis

A comparação mais sólida usa os mesmos arquivos de áudio, as mesmas referências e as mesmas regras de pontuação. Também mantém condições equivalentes de idioma, segmentação e acesso a contexto. Se os fornecedores recebem instruções ou vocabulários diferentes, ou se um sistema processa fragmentos enquanto outro recebe gravações completas, o resultado pode refletir tanto essas diferenças quanto as capacidades de reconhecimento.

Na prática, nem sempre é possível executar todos os serviços em condições perfeitamente idênticas. Nesse caso, o correto é documentar as diferenças e limitar a conclusão. Um benchmark pode ajudar a orientar uma avaliação mesmo que não permita uma comparação causal rigorosa entre modelos. O problema surge quando um número é apresentado sem as condições necessárias para distinguir o desempenho do sistema do efeito do protocolo.

A Artificial Analysis publica uma metodologia para seu benchmark de voz para texto e uma tabela comparativa não streaming. Essas fontes permitem situar a pontuação do Scribe v2 em uma avaliação específica. Não transformam automaticamente a posição observada ali em uma afirmação sobre todos os benchmarks, idiomas, gêneros de áudio ou variantes em tempo real. Uma posição em uma tabela responde às regras e aos participantes daquela tabela.

Um processo breve para auditar uma comparação

  1. 01Localize a afirmação original e anote a qual produto, métrica e alcance ela se refere.
  2. 02Identifique o benchmark, sua versão, os conjuntos incluídos, as licenças e o tamanho da amostra.
  3. 03Revise as referências, a normalização, a segmentação e a fórmula de pontuação.
  4. 04Registre o identificador do modelo, a data de execução, o modo batch ou realtime e o uso de keyterms.
  5. 05Verifique se todos os sistemas receberam os mesmos áudios e as mesmas condições; se não, separe os resultados.
  6. 06Limite a conclusão aos conjuntos, idiomas e modos efetivamente avaliados e declare o que não pode ser reproduzido.
06

O que pode ser reproduzido e o que ainda não está claro

Com as fontes públicas identificadas, é possível descrever a afirmação de lançamento como uma declaração da ElevenLabs e verificar que existe uma avaliação AA-WER v2.0 que inclui um resultado para o Scribe v2. Também é possível consultar a proposta do FLEURS, a normalização prevista pelo NIST, a metodologia da Artificial Analysis e a documentação da ElevenLabs sobre keyterms e modelos de transcrição. São elementos úteis, mas não formam um protocolo único capaz de reproduzir todas as afirmações de desempenho.

A principal incerteza é quais benchmarks específicos a página de lançamento tinha em mente ao atribuir ao Scribe v2 o menor WER. A fonte fornecida não identifica esses benchmarks nem expõe o protocolo correspondente. Tampouco permite estabelecer qual versão exata do modelo foi executada, se houve prompting, que normalização foi aplicada ou como os segmentos foram tratados. Não é rigoroso preencher essas lacunas presumindo que a configuração coincide com a de uma avaliação posterior.

A existência de uma tabela comparativa independente também não resolve todas essas questões. Para repetir um benchmark integralmente, são necessários os artefatos e as condições do teste, e a disponibilidade de conjuntos proprietários pode limitar a reprodução por terceiros. Se o responsável apresentar resultados agregados, convém verificar se também publica resultados por conjunto ou condição e explica a ponderação; a média não substitui essas informações.

07

Lista mínima para publicar um benchmark de ASR

Um benchmark útil para terceiros deve permitir entender tanto o número quanto o caminho que levou a ele. Não basta publicar uma classificação final: os leitores precisam determinar se o corpus representa seu caso, se as regras são coerentes e se é viável repetir o teste. A lista a seguir não garante que dois serviços tenham condições idênticas em todos os aspectos, mas torna visíveis as diferenças que limitam a comparação.

A incerteza também deve ser comunicada. Os resultados dependem da amostra e podem variar entre subconjuntos. Publicar o número de exemplos e os resultados desagregados ajuda a avaliar essa variação; se uma margem ou um intervalo for informado, é preciso explicar como foi calculado. Sem essas informações, uma pequena diferença entre duas pontuações não deve se transformar automaticamente em uma conclusão firme sobre qual sistema é melhor.

Elementos que o relatório deve incluir

  1. 01Nome e versão do benchmark, conjuntos de dados, licenças, idiomas e critérios de seleção.
  2. 02Lista de arquivos ou identificadores das amostras, duração total, exclusões e motivos para excluí-las, respeitando as licenças aplicáveis.
  3. 03Transcrições de referência ou uma descrição reproduzível de como foram obtidas, junto com as regras de normalização.
  4. 04Identificador do modelo e data de execução, modo de uso, parâmetros relevantes e quaisquer keyterms fornecidos.
  5. 05Regras de segmentação, concatenação, pontuação e cálculo do WER.
  6. 06Resultados por conjunto, idioma e condição, além do resultado agregado, com tamanhos de amostra e ponderações.
  7. 07Artefatos ou instruções para repetir a avaliação e uma explicação das limitações de acesso a dados proprietários.
08

Conclusão: use a pontuação como sinal, não como garantia

As pontuações publicadas podem ajudar a selecionar candidatos para um teste próprio, mas não garantem o desempenho em uma organização ou tipo específico de áudio. A afirmação da ElevenLabs sobre o menor WER deve continuar atribuída ao fornecedor, e seu alcance não deve ser ampliado sem identificar os benchmarks e protocolos a que se refere. O AA-WER v2.0 oferece uma avaliação identificável do Scribe v2, mas suas conclusões pertencem àquele benchmark e às suas condições.

Para decidir sobre uma migração, uma equipe deve testar amostras representativas de seus idiomas, gravações, nomes próprios e condições acústicas, aplicar regras de referência coerentes e avaliar separadamente as funções importantes em seu fluxo de trabalho. Se precisar de transcrição ao vivo, deve avaliar a variante e as métricas correspondentes a esse modo, em vez de extrapolar os resultados de um teste batch.

A conclusão prudente não é que o Scribe v2 seja um vencedor geral nem que os números não tenham valor. É que o WER só informa com rigor quando vem acompanhado do corpus, da versão, da configuração e das regras de cálculo. Se esses dados estiverem ausentes, a pontuação pode servir como indício, mas não como comparação reproduzível nem como garantia de resultados futuros.

Questões em aberto

  • A página de lançamento da ElevenLabs não especifica quais benchmarks sustentam sua afirmação de menor WER.
  • Com as fontes fornecidas, não é possível reconstruir a versão exata, a data de execução, a configuração, a normalização ou a segmentação dos testes de lançamento.
  • A disponibilidade de conjuntos proprietários, como o AA-AgentTalk, pode limitar a reprodução integral do benchmark por terceiros.
  • Não há dados suficientes para determinar se a afirmação de lançamento utilizou keyterm prompting nem quais termos teriam sido fornecidos.
09

Continue a explorar

09

Fontes consultadas

03

Correções e transparência

Se encontrar informação incorreta ou desatualizada, envie-nos a página e a fonte que devemos rever.

Propor uma correção