Ilustración editorial para Claude Sonnet 5 y Cohere Embed 4 en RAG multimodal: cómo separar un fallo de recuperación de un fallo de respuesta
Imagen generada con gpt-image-2.5-sunburst para InferamaFonte ↗
01

Não se trata de uma comparação direta entre dois modelos

Claude Sonnet 5 e Cohere Embed 4 não resolvem a mesma tarefa dentro de uma arquitetura de geração aumentada por recuperação, ou RAG. O primeiro pode ocupar a camada de geração: recebe uma instrução e evidência recuperada e produz uma resposta. O segundo pode ocupar a camada de representação e recuperação: transforma entradas em vetores para localizar conteúdo relacionado antes que o gerador responda. Apresentá-los como se um fosse uma alternativa ao outro oculta a causa dos resultados e leva a alterações de arquitetura atribuídas de forma incorreta.

A pergunta operacional não é qual dos dois é “melhor”, mas qual combinação de recuperador e gerador oferece evidência localizada e respostas fundamentadas para um corpus, consultas e restrições concretos. Uma resposta fluente não prova que o índice encontrou a fonte correta. Da mesma forma, o aparecimento da passagem adequada entre os resultados não prova que o modelo generativo a tenha interpretado, citado e delimitado corretamente.

A documentação da Anthropic identifica o modelo de API como `claude-sonnet-5`. Por sua vez, a documentação da Cohere descreve `embed-v4.0` e exige a declaração de um tipo de entrada, incluindo valores para documentos de busca, consultas de busca e imagens. Esses fatos permitem fixar as variáveis do experimento, mas não permitem inferir, por si sós, uma vantagem em determinado corpus empresarial.

A avaliação deve tratar o sistema como uma cadeia de decisões observáveis: conversão do documento, segmentação, indexação, recuperação, composição de contexto, geração, validação e apresentação. Se apenas a resposta final for medida, uma equipe não poderá saber se um erro decorre de uma página ausente, de um fragmento pequeno demais, de uma consulta vetorizada de forma inadequada, de contexto truncado ou de uma afirmação gerada sem respaldo.

02

O que cada camada pode aportar e o que suas fichas técnicas não demonstram

A Cohere apresenta Embed Multimodal v4 como uma família de embeddings multimodais unificados. Sua documentação indica recuperação entre texto e imagem e entre texto e modalidades mistas, além de um contexto anunciado de até 128k e dimensões Matryoshka de 256, 512, 1024 e 1536. Em um RAG de PDFs com texto, tabelas e imagens, essas propriedades justificam testar representações coerentes de diferentes tipos de evidência. Elas não provam que uma dimensão específica, nem mesmo um embedding multimodal, melhore toda coleção documental.

A dimensão escolhida é uma variável experimental, não um detalhe de implementação. Ela afeta o armazenamento, a latência de busca e, possivelmente, o comportamento de vizinhança do índice. O mesmo ocorre com a forma de representar uma página: como texto extraído, como imagem da página, como região de tabela, como combinação desses objetos ou como várias unidades vinculadas por metadados. Um teste reproduzível deve preservar essa decisão em todos os braços que não avaliem explicitamente a indexação.

Claude Sonnet 5 deve ser avaliado como consumidor de evidência, e não como substituto silencioso da recuperação. Uma resposta correta quando a evidência não apareceu no contexto pode resultar de conhecimento prévio do modelo, de uma coincidência afortunada ou de uma falha no registro do pipeline. Em uma aplicação que exige respostas baseadas apenas no corpus, esse caso não comprova a recuperação: deve ser rotulado como resposta não atribuível ao conjunto documental ou excluído da métrica de resposta fundamentada.

Modelos generativos também podem falhar mesmo quando recebem as passagens corretas. Podem omitir uma condição de uma tabela, fundir duas fontes incompatíveis, interpretar um número fora de seu escopo ou incluir uma citação que aponta para uma fonte relacionada, mas que não sustenta a afirmação. Por isso, as citações são objetos avaliáveis, e não adornos de interface.

Camadas, observáveis e erros que não devem ser confundidos

CamadaSaída que deve ser preservadaFalha observávelDecisão habitual
Conversão e fragmentaçãoPágina, região, texto extraído e metadadosA evidência desaparece ou perde estruturaRevisar parser, OCR e segmentação
Embedding e índiceVetor, modalidade, dimensão e versão do índiceA evidência existe, mas não aparece nos resultadosRevisar representação, filtro, embedding ou recuperação
GeraçãoContexto exato, instrução e respostaA evidência foi recuperada, mas é ignorada ou distorcidaRevisar modelo, prompt e limite de saída
ValidaçãoAfirmação, citação e veredito de respaldoA citação não sustenta o que foi ditoAdicionar verificação e revisão humana
03

Construir um corpus que permita diagnosticar, e não apenas pontuar

O corpus de avaliação deve ser congelado antes de comparar configurações. Inclua PDFs nativos e digitalizados, páginas predominantemente textuais, tabelas com cabeçalhos e notas de rodapé, imagens com informações relevantes e documentos que combinem esses elementos. O objetivo não é reproduzir todas as variantes da documentação empresarial, mas declarar com precisão quais foram incluídas e evitar que uma melhoria aparente dependa de documentos adicionados ou corrigidos no meio do teste.

Cada consulta precisa de uma resposta de referência e, sobretudo, de uma definição de evidência suficiente. Essa evidência pode ser uma página, uma região de tabela, várias passagens distribuídas ou uma combinação de texto e imagem. Registre identificadores estáveis de documento, versão, página, região e fragmento. Quando a evidência estiver distribuída, o julgamento de recuperação deve exigir o conjunto necessário, e não apenas um de seus componentes.

É recomendável estratificar as consultas pelo padrão probatório. As de evidência única revelam se o recuperador encontra um fato localizado. As multifonte revelam se ele entrega as partes necessárias sem perder sua relação. As contraditórias testam se o sistema preserva procedência e contradição em vez de selecionar uma fonte de forma arbitrária. As consultas sem evidência verificam se o assistente se abstém em vez de completar a resposta com conhecimento externo ou uma inferência não justificada.

Reserve uma partição final que não seja usada para ajustar tamanho de fragmento, sobreposição, dimensões, número de resultados, instruções ou regras de validação. Se uma decisão for tomada após observar a partição de teste, essa partição deixa de ser uma medição independente. O tamanho da amostra, a distribuição por estrato e o protocolo de anotação devem ser publicados junto aos resultados.

04

Fixar as condições antes de executar a matriz fatorial

A comparação exige um pipeline de base explícito. Mantenha fixos o parser ou OCR, a política de resolução das páginas, a fragmentação, a sobreposição, os metadados, a base vetorial, os filtros, o método de busca, o número de resultados recuperados, o reranking — se existir —, a composição de contexto, o prompt, a política de citações, o máximo de saída e as tentativas adicionais. Se algum deles mudar entre os braços, o efeito não poderá ser atribuído de forma limpa a Cohere Embed 4 nem a Claude Sonnet 5.

Documente também o canal de acesso, a data e a hora da consulta, a região quando aplicável, a versão do SDK ou da API, o identificador efetivo do modelo e os parâmetros enviados. Para Cohere Embed 4, registre pelo menos `embed-v4.0`, dimensão, modalidade de cada objeto e `input_type`. A documentação do endpoint distingue os usos `search_document`, `search_query` e `image`; utilizar tipos diferentes sem anotá-los alteraria o teste. Para Claude Sonnet 5, preserve a solicitação efetiva, a resposta sem pós-processamento e o contexto que a acompanhou.

Defina um baseline que seja útil e reproduzível. Pode ser um embedding adotado anteriormente pela equipe e um gerador existente, mas deve permanecer imutável durante o experimento. Não apresente o baseline como referência universal: ele é apenas o ponto de comparação para esse sistema. Se o reranking for incorporado, ele deve permanecer igual nos quatro braços ou ser avaliado como um fator adicional, pois poderia mascarar ou ampliar diferenças de recuperação.

A unidade de análise deve ser a consulta, mas os resultados também precisam ser agrupados por tipo de documento e padrão de evidência. Uma média geral pode ocultar que uma mudança ajuda a localizar páginas visuais e piora consultas textuais curtas, ou que melhora o recall, mas aumenta a quantidade de contexto irrelevante entregue ao gerador.

Procedimento de congelamento

  1. 01Versione o corpus, as anotações e a lista de consultas; atribua identificadores imutáveis.
  2. 02Execute conversão, OCR e segmentação uma vez por configuração de representação e armazene seus artefatos.
  3. 03Declare parâmetros de índice, busca, contexto, prompt e validação antes de avaliar.
  4. 04Registre cada recuperação e cada contexto exato associado a uma resposta.
  5. 05Bloqueie ajustes na partição final e analise essa partição apenas uma vez.
05

A matriz fatorial: quatro configurações, uma única pergunta de atribuição

Execute quatro braços sobre as mesmas consultas. O primeiro utiliza o recuperador e o gerador de referência. O segundo substitui apenas a camada de embeddings por Cohere Embed 4, mantendo o gerador de base. O terceiro preserva a recuperação de base e utiliza apenas Claude Sonnet 5 para gerar. O quarto combina Cohere Embed 4 e Claude Sonnet 5. Se o sistema já usar um deles como referência, redefina os braços para que cada fator continue tendo uma condição de controle claramente identificada.

Essa matriz permite estimar mudanças condicionais, não estabelecer uma hierarquia absoluta entre fornecedores. A diferença entre o primeiro e o segundo braços é interpretada como uma mudança associada à recuperação sob o gerador de base. A diferença entre o primeiro e o terceiro braços reflete a mudança de geração com evidência recuperada pelo baseline. O quarto mostra o comportamento da combinação, incluindo uma possível interação: o gerador pode aproveitar melhor uma evidência diferente, ou a mudança de recuperação pode não se traduzir em respostas melhores.

Execute várias repetições caso a geração não seja determinística e preserve sementes ou parâmetros de amostragem quando estiverem disponíveis. Para tarefas de exatidão e abstenção, uma configuração de geração conservadora reduz a variância e facilita a auditoria. A comparação de custo deve incluir indexação amortizada, embedding de consultas, recuperação, geração, validação e tentativas adicionais; informar apenas o custo de geração deslocaria o gasto de uma camada para outra sem refletir a operação real.

Leitura da matriz fatorial

RecuperaçãoGeraçãoUso analítico
BaselineBaselinePonto de referência do sistema atual
Cohere Embed 4BaselineEfeito de mudar a representação e a recuperação
BaselineClaude Sonnet 5Efeito de mudar a geração sobre a mesma evidência
Cohere Embed 4Claude Sonnet 5Resultado da combinação e interação entre camadas
06

Medir evidência e resposta como resultados distintos

Para recuperação, meça o recall de evidência: a proporção de consultas para as quais a evidência suficiente aparece entre os resultados entregues ao gerador. Complemente-o com precisão de recuperação ou proporção de resultados relevantes, porque aumentar indiscriminadamente o número de fragmentos pode elevar o recall e piorar o contexto. Em perguntas com evidência distribuída, meça a recuperação completa do conjunto anotado, e não apenas a presença de uma fonte parcial.

Para a resposta, avalie fidelidade factual em relação aos documentos, cobertura dos pontos exigidos pela consulta, exatidão da abstenção quando não houver evidência e validade de formato quando a aplicação exigir uma estrutura, como JSON. Cobertura não equivale a fidelidade: uma resposta pode mencionar todos os temas e conter um número incorreto. Fidelidade também não equivale a utilidade: uma resposta estritamente respaldada pode omitir uma condição necessária.

Adicione uma métrica de citação respaldada no nível de cada afirmação verificável. Um revisor, idealmente cego à configuração, deve decidir se a citação ou referência de procedência sustenta exatamente a afirmação associada. Pode ser usado um grader automatizado com uma rubrica auditada, mas ele deve ser comparado à revisão humana de uma amostra, e suas divergências devem ser preservadas. RAGBench propõe uma abordagem de avaliação explicável pertinente para decompor resultados, em vez de reduzi-los a uma pontuação final.

Informe latência p50 e p95 por resposta, e não apenas médias. Separe o tempo de indexação do tempo de consulta, embora incorpore o primeiro como custo amortizado em uma métrica econômica. A medida mais útil para decisões de produto costuma ser custo e latência por resposta fundamentada correta, desde que a definição de “correta” seja publicada e o denominador inclua abstenções adequadas.

07

Diagnosticar os padrões de erro

Quando a evidência anotada não aparece entre os resultados, o incidente pertence inicialmente à recuperação ou a uma etapa anterior de conversão e indexação. Verifique se o texto ou a imagem estava disponível após o parser, se a unidade indexada preservou o contexto da tabela, se os metadados filtraram o documento e se a consulta utilizou a modalidade e o tipo de entrada declarados. Mudar o gerador não corrige a ausência de evidência no contexto.

Quando a evidência suficiente aparece e a resposta está errada, o incidente corresponde ao uso de evidência, salvo se a composição de contexto tiver truncado a passagem relevante antes de enviá-la. Compare o texto entregue com a afirmação final: isso revela omissões, mistura de fontes, inferências excessivas e contradições ignoradas. Aqui pode ser razoável investigar a instrução, a estrutura do contexto, o limite de saída ou o modelo generativo.

A citação decorativa é um padrão separado: a resposta incorpora uma referência real, mas ela não sustenta a proposição concreta. Isso é especialmente frequente quando o documento contém termos relacionados ou quando uma tabela é citada no nível de página enquanto o número vem de outra linha. Rotulá-la como simples resposta incorreta impede saber se o problema está na geração de citações, na granularidade de procedência ou na validação posterior.

A abstenção injustificada requer o diagnóstico oposto. Se havia evidência suficiente recuperada e o sistema respondeu que não podia responder, a instrução de uso do contexto, a ordem dos resultados ou a legibilidade do conteúdo extraído podem ter falhado. Se não havia evidência, a abstenção é correta, ainda que seja menos satisfatória para o usuário. Um sistema confiável deve distinguir os dois casos e explicar seus limites sem inventar uma resposta.

Árvore de diagnóstico por consulta

  1. 01A evidência suficiente existe no corpus congelado? Se não, avalie a abstenção, e não a recuperação.
  2. 02A evidência chegou aos resultados recuperados? Se não, investigue conversão, segmentação, embedding, índice e filtros.
  3. 03A evidência chegou ao contexto efetivo do gerador? Se não, investigue top-k, reranking e truncamento.
  4. 04A resposta corresponde à evidência e cada citação a respalda? Se não, investigue geração, composição de contexto e validação.
  5. 05A resposta foi correta sem evidência no contexto? Rotule-a como não atribuível a RAG fundamentado.
08

Tomar decisões sem extrapolar além do experimento

Mude a camada de recuperação quando a principal deficiência for a ausência de evidência relevante, em especial nos subconjuntos em que texto, imagens ou páginas mistas precisam ser encontrados entre si. Antes de concluir que o embedding é a causa, descarte erros de OCR, fragmentação e metadados. Uma tabela separada de seus cabeçalhos, por exemplo, pode falhar com qualquer embedding porque a unidade indexada perdeu a semântica necessária.

Mude ou ajuste a camada generativa quando a evidência chegar de forma suficiente e estável, mas a resposta a utilizar incorretamente. Mesmo nesse caso, não suponha que o nome do modelo explique toda a mudança: teste instruções de citação, formatos de contexto e regras de abstenção na partição de desenvolvimento e confirme na partição final. Claude Sonnet 5 deve ser comparado por meio de solicitações equivalentes e registros completos, e não por exemplos selecionados.

Considere reranking se o recall inicial for razoável, mas os primeiros resultados contiverem ruído excessivo ou relegarem evidência decisiva. Considere revisão humana para respostas de alto impacto, contradições documentais, tabelas complexas ou casos em que a validação automática não alcance concordância suficiente com os revisores. Nenhuma dessas medidas elimina a necessidade de medir cada camada: ela acrescenta outra variável que também deve ser auditada.

Publique o cartão do experimento junto com os resultados: definição e versão do corpus, esquema de anotação, distribuição de consultas, configurações efetivas, artefatos de recuperação, critérios do grader, concordância entre avaliadores, intervalos ou incerteza estatística, latência, custo e erros representativos. Não publique apenas uma taxa agregada nem exemplos de demonstração. O quadro de avaliação da qualidade de recuperação e os trabalhos sobre RAG multimodal reforçam a necessidade de observar o acesso à evidência e a resposta separadamente.

Os resultados não se generalizam automaticamente para todos os repositórios empresariais. A prevalência de PDFs digitalizados, idiomas, qualidade do OCR, densidade de tabelas, permissões, atualização documental e tolerância a custos podem mudar a decisão. A conclusão defensável é local: sob condições documentadas, uma configuração recuperou melhor determinada evidência ou produziu respostas mais fiéis. Essa precisão é mais útil do que atribuir capacidades gerais a modelos que desempenham funções distintas.

Questões em aberto

  • A documentação dos fornecedores descreve capacidades e identificadores, mas não garante resultados relativos em um corpus empresarial específico.
  • O comportamento pode variar com OCR, parser, idioma, estratégia de fragmentação, filtros, dimensões, top-k, reranking e composição de contexto.
  • A avaliação de fidelidade e de respaldo de citações envolve julgamento humano; a rubrica, a concordância entre revisores e as divergências devem ser publicadas.
  • Não são apresentados resultados experimentais para as quatro configurações; o artigo define um protocolo de avaliação, não uma classificação de desempenho.
  • Disponibilidade, preços, canais de acesso e parâmetros efetivos devem ser verificados e registrados no momento de cada execução.
09

Continue a explorar

09

Fontes consultadas

03

Correções e transparência

Se encontrar informação incorreta ou desatualizada, envie-nos a página e a fonte que devemos rever.

Propor uma correção