Ilustración editorial para Claude Sonnet 5 y Cohere Embed 4 en RAG multimodal: cómo separar un fallo de recuperación de un fallo de respuesta
Imagen generada con gpt-image-2.5-sunburst para InferamaFuente ↗
01

No es una comparación directa entre dos modelos

Claude Sonnet 5 y Cohere Embed 4 no resuelven la misma tarea dentro de una arquitectura de generación aumentada por recuperación, o RAG. El primero puede ocupar la capa de generación: recibe una instrucción y evidencia recuperada, y produce una respuesta. El segundo puede ocupar la capa de representación y recuperación: transforma entradas en vectores para localizar contenido relacionado antes de que el generador responda. Presentarlos como si uno fuera una alternativa del otro oculta la causa de los resultados y lleva a cambios de arquitectura mal atribuidos.

La pregunta operativa no es cuál de los dos es “mejor”, sino qué combinación de recuperador y generador ofrece evidencia localizada y respuestas fundamentadas para un corpus, unas consultas y unas restricciones concretas. Una respuesta fluida no prueba que el índice haya encontrado la fuente correcta. Del mismo modo, que aparezca el pasaje adecuado entre los resultados no prueba que el modelo generativo lo haya interpretado, citado y limitado correctamente.

La documentación de Anthropic identifica el modelo de API como `claude-sonnet-5`. Por su parte, la documentación de Cohere describe `embed-v4.0` y exige declarar un tipo de entrada, incluidos los valores para documentos de búsqueda, consultas de búsqueda e imágenes. Estos hechos permiten fijar las variables del experimento, pero no permiten inferir por sí solos una ventaja en un corpus empresarial determinado.

La evaluación debe tratar el sistema como una cadena de decisiones observables: conversión del documento, segmentación, indexación, recuperación, composición del contexto, generación, validación y presentación. Si se mide únicamente la respuesta final, un equipo no puede saber si una equivocación procede de una página ausente, de un fragmento demasiado pequeño, de una consulta mal vectorizada, de contexto truncado o de una afirmación generada sin respaldo.

02

Qué puede aportar cada capa y qué no demuestran sus fichas técnicas

Cohere presenta Embed Multimodal v4 como una familia de embeddings multimodales unificados. Su documentación indica recuperación entre texto e imagen y entre texto y modalidades mixtas, además de un contexto anunciado de hasta 128k y dimensiones Matryoshka de 256, 512, 1024 y 1536. En un RAG de PDFs con texto, tablas e imágenes, esas propiedades justifican probar representaciones coherentes de distintos tipos de evidencia. No prueban que una dimensión concreta, ni siquiera un embedding multimodal, mejore toda colección documental.

La dimensión elegida es una variable experimental, no un detalle de implementación. Afecta al almacenamiento, a la latencia de búsqueda y posiblemente al comportamiento de vecindad del índice. También lo hace el modo en que se representa una página: como texto extraído, como imagen de página, como región de tabla, como combinación de esos objetos o como varias unidades vinculadas por metadatos. Una prueba reproducible debe conservar esa decisión en todas las ramas que no evalúan explícitamente la indexación.

Claude Sonnet 5 debe evaluarse como consumidor de evidencia, no como sustituto silencioso de la recuperación. Una respuesta correcta cuando la evidencia no apareció en el contexto puede provenir de conocimiento previo del modelo, de una coincidencia afortunada o de un defecto en el registro del pipeline. En una aplicación que exige respuestas basadas sólo en el corpus, ese caso no acredita la recuperación: debe etiquetarse como respuesta no atribuible al conjunto documental o excluirse de la métrica de respuesta fundamentada.

Los modelos generativos también pueden fallar aunque reciban los pasajes correctos. Pueden omitir una condición de una tabla, fusionar dos fuentes incompatibles, interpretar una cifra fuera de su ámbito o incluir una cita que apunta a una fuente relacionada pero no sustenta la afirmación. Por ello, las citas son objetos evaluables, no adornos de interfaz.

Capas, observables y errores que no deben confundirse

CapaSalida que debe conservarseFallo observableDecisión habitual
Conversión y fragmentadoPágina, región, texto extraído y metadatosLa evidencia desaparece o pierde estructuraRevisar parser, OCR y segmentación
Embedding e índiceVector, modalidad, dimensión y versión de índiceLa evidencia existe pero no aparece en los resultadosRevisar representación, filtro, embedding o recuperación
GeneraciónContexto exacto, instrucción y respuestaLa evidencia se recuperó pero se ignora o se distorsionaRevisar modelo, prompt y límite de salida
ValidaciónAfirmación, cita y veredicto de respaldoLa cita no sustenta lo dichoAñadir comprobación y revisión humana
03

Construir un corpus que permita diagnosticar, no sólo puntuar

El corpus de evaluación debe congelarse antes de comparar configuraciones. Incluya PDFs nativos y escaneados, páginas predominantemente textuales, tablas con encabezados y notas al pie, imágenes con información relevante y documentos que combinen esos elementos. El objetivo no es reproducir todas las variantes de documentación empresarial, sino declarar con precisión cuáles se han incluido y evitar que una mejora aparente dependa de documentos añadidos o corregidos a mitad de la prueba.

Cada consulta necesita una respuesta de referencia y, sobre todo, una definición de evidencia suficiente. Esa evidencia puede ser una página, una región de tabla, varios pasajes distribuidos o una combinación de texto e imagen. Registre identificadores estables de documento, versión, página, región y fragmento. Cuando la evidencia esté distribuida, el juicio de recuperación debe exigir el conjunto necesario, no sólo uno de sus componentes.

Conviene estratificar las consultas por patrón probatorio. Las de evidencia única revelan si el recuperador encuentra un hecho localizado. Las multifuente revelan si entrega las piezas necesarias sin perder su relación. Las contradictorias prueban si el sistema preserva procedencia y contradicción en vez de seleccionar una fuente de forma arbitraria. Las consultas sin evidencia verifican que el asistente se abstiene en lugar de completar la respuesta con conocimiento externo o con una inferencia no justificada.

Reserve una partición final que no se utilice para ajustar tamaño de fragmento, solapamiento, dimensiones, número de resultados, instrucciones o reglas de validación. Si se toma una decisión después de observar la partición de prueba, esa partición deja de ser una medición independiente. El tamaño de la muestra, la distribución por estrato y el protocolo de anotación deben publicarse junto con los resultados.

04

Fijar condiciones antes de ejecutar la matriz factorial

La comparación exige un pipeline base explícito. Mantenga fijos el parser u OCR, la política de resolución de páginas, el fragmentado, el solapamiento, los metadatos, la base vectorial, los filtros, el método de búsqueda, el número de resultados recuperados, el reranking —si existe—, la composición de contexto, el prompt, la política de citas, el máximo de salida y los reintentos. Si alguno cambia entre ramas, el efecto no puede atribuirse limpiamente a Cohere Embed 4 ni a Claude Sonnet 5.

Documente además el canal de acceso, fecha y hora de consulta, región cuando corresponda, versión de SDK o API, identificador efectivo de modelo y parámetros enviados. Para Cohere Embed 4, registre al menos `embed-v4.0`, dimensión, modalidad de cada objeto e `input_type`. La documentación del endpoint distingue los usos `search_document`, `search_query` e `image`; emplear tipos distintos sin anotarlo cambiaría la prueba. Para Claude Sonnet 5, conserve la solicitud efectiva, la respuesta sin postprocesar y el contexto que la acompañó.

Defina un baseline que sea útil y reproducible. Puede ser un embedding previamente adoptado por el equipo y un generador existente, pero debe permanecer inmutable durante el experimento. No presente el baseline como una referencia universal: es sólo el punto de comparación para ese sistema. Si se incorpora reranking, debe mantenerse igual en las cuatro ramas o evaluarse como un factor adicional, porque podría enmascarar o amplificar diferencias de recuperación.

La unidad de análisis debe ser la consulta, pero los resultados también deben agruparse por tipo de documento y patrón de evidencia. Un promedio general puede ocultar que un cambio ayuda a localizar páginas visuales y empeora preguntas textuales breves, o que mejora el recall pero incrementa la cantidad de contexto irrelevante entregado al generador.

Procedimiento de congelación

  1. 01Versione corpus, anotaciones y lista de consultas; asigne identificadores inmutables.
  2. 02Ejecute conversión, OCR y segmentación una vez por configuración de representación y guarde sus artefactos.
  3. 03Declare parámetros de índice, búsqueda, contexto, prompt y validación antes de evaluar.
  4. 04Registre cada recuperación y cada contexto exacto asociado a una respuesta.
  5. 05Bloquee ajustes sobre la partición final y analice esa partición una única vez.
05

La matriz factorial: cuatro configuraciones, una sola pregunta de atribución

Ejecute cuatro ramas sobre las mismas consultas. La primera utiliza el recuperador y generador de referencia. La segunda sustituye sólo la capa de embeddings por Cohere Embed 4, manteniendo el generador base. La tercera conserva la recuperación base y utiliza sólo Claude Sonnet 5 para generar. La cuarta combina Cohere Embed 4 y Claude Sonnet 5. Si el sistema ya usa uno de ellos como referencia, redefina las ramas para que cada factor siga teniendo una condición de control claramente identificada.

Esta matriz permite estimar cambios condicionales, no establecer una jerarquía absoluta entre proveedores. La diferencia entre la primera y segunda ramas se interpreta como cambio asociado a la recuperación bajo el generador base. La diferencia entre la primera y tercera ramas refleja el cambio de generación con evidencia recuperada por el baseline. La cuarta muestra el comportamiento de la combinación, incluida una posible interacción: el generador puede aprovechar mejor una evidencia distinta, o el cambio de recuperación puede no trasladarse a respuestas mejores.

Ejecute varias repeticiones si la generación no es determinista y conserve semillas o parámetros de muestreo cuando estén disponibles. Para tareas de exactitud y abstención, una configuración de generación conservadora reduce la varianza y facilita la auditoría. La comparación de coste debe incluir indexación amortizada, embedding de consultas, recuperación, generación, validación y reintentos; informar sólo el coste de generación trasladaría gasto de una capa a otra sin reflejar la operación real.

Lectura de la matriz factorial

RecuperaciónGeneraciónUso analítico
BaselineBaselinePunto de referencia del sistema actual
Cohere Embed 4BaselineEfecto de cambiar representación y recuperación
BaselineClaude Sonnet 5Efecto de cambiar la generación sobre la misma evidencia
Cohere Embed 4Claude Sonnet 5Resultado de la combinación e interacción entre capas
06

Medir evidencia y respuesta como resultados distintos

Para recuperación, mida recall de evidencia: la proporción de consultas para las que la evidencia suficiente aparece entre los resultados entregados al generador. Compleméntelo con precisión de recuperación o proporción de resultados relevantes, porque aumentar indiscriminadamente el número de fragmentos puede elevar el recall y empeorar el contexto. En preguntas con evidencia distribuida, mida recuperación completa del conjunto anotado y no sólo presencia de una fuente parcial.

Para la respuesta, evalúe fidelidad factual frente a los documentos, cobertura de los puntos que la consulta exige, exactitud de la abstención cuando no hay evidencia y validez de formato cuando la aplicación pide una estructura, como JSON. La cobertura no equivale a fidelidad: una respuesta puede mencionar todos los temas y contener una cifra equivocada. La fidelidad tampoco equivale a utilidad: una respuesta estrictamente respaldada puede omitir una condición necesaria.

Añada una métrica de cita respaldada a nivel de afirmación verificable. Un revisor, idealmente ciego a la configuración, debe decidir si la cita o referencia de procedencia sostiene exactamente la afirmación asociada. Puede utilizarse un grader automatizado con una rúbrica auditada, pero debe contrastarse con revisión humana de una muestra y conservar sus desacuerdos. RAGBench propone un enfoque de evaluación explicable que resulta pertinente para descomponer resultados en lugar de reducirlos a una puntuación final.

Informe latencia p50 y p95 por respuesta, no sólo promedios. Separe el tiempo de indexación del tiempo de consulta, aunque incorpore el primero como coste amortizado en una métrica económica. La medida más útil para decisiones de producto suele ser coste y latencia por respuesta fundamentada correcta, siempre que se publique la definición de “correcta” y el denominador incluya abstenciones adecuadas.

07

Diagnosticar los patrones de error

Cuando la evidencia anotada no aparece entre los resultados, el incidente pertenece inicialmente a recuperación o a una etapa anterior de conversión e indexación. Revise si el texto o la imagen estaba disponible tras el parser, si la unidad indexada conservó el contexto de tabla, si los metadatos filtraron el documento y si la consulta usó la modalidad y el tipo de entrada declarados. Cambiar el generador no corrige la ausencia de evidencia en el contexto.

Cuando la evidencia suficiente sí aparece y la respuesta es errónea, el incidente corresponde al uso de evidencia, salvo que la composición de contexto haya truncado el pasaje relevante antes de enviarlo. Compare el texto entregado con la afirmación final: eso revela omisiones, mezclas de fuentes, inferencias excesivas y contradicciones ignoradas. Aquí puede ser razonable investigar la instrucción, la estructura del contexto, el límite de salida o el modelo generativo.

La cita decorativa es un patrón separado: la respuesta incorpora una referencia real, pero ésta no sustenta la proposición concreta. Es especialmente frecuente cuando el documento contiene términos relacionados o cuando una tabla se cita a nivel de página mientras la cifra procede de otra fila. Etiquetarlo como simple respuesta incorrecta impide saber si el problema está en la generación de citas, en la granularidad de procedencia o en la validación posterior.

La abstención injustificada requiere un diagnóstico opuesto. Si había evidencia suficiente recuperada y el sistema respondió que no podía contestar, puede haber fallado la instrucción de uso de contexto, el orden de resultados o la legibilidad del contenido extraído. Si no había evidencia, la abstención es correcta aunque resulte menos satisfactoria para el usuario. Un sistema fiable debe distinguir ambos casos y explicar sus límites sin inventar una respuesta.

Árbol de diagnóstico por consulta

  1. 01¿La evidencia suficiente existe en el corpus congelado? Si no, evalúe abstención y no recuperación.
  2. 02¿La evidencia llegó a los resultados recuperados? Si no, investigue conversión, segmentación, embedding, índice y filtros.
  3. 03¿La evidencia llegó al contexto efectivo del generador? Si no, investigue top-k, reranking y truncado.
  4. 04¿La respuesta coincide con la evidencia y cada cita la respalda? Si no, investigue generación, composición de contexto y validación.
  5. 05¿La respuesta fue correcta sin evidencia en contexto? Etiquétela como no atribuible a RAG fundamentado.
08

Tomar decisiones sin extrapolar más allá del experimento

Cambie la capa de recuperación cuando el principal déficit sea la ausencia de evidencia relevante, en particular en subconjuntos donde texto, imágenes o páginas mixtas deban encontrarse entre sí. Antes de concluir que el embedding es la causa, descarte errores de OCR, fragmentado y metadatos. Una tabla separada de sus encabezados, por ejemplo, puede fallar con cualquier embedding porque la unidad indexada perdió la semántica necesaria.

Cambie o ajuste la capa generativa cuando la evidencia llegue de forma suficiente y estable, pero la respuesta la use mal. Incluso en ese caso, no asuma que el nombre del modelo explica todo el cambio: pruebe instrucciones de cita, formatos de contexto y reglas de abstención con la partición de desarrollo, y confirme en la partición final. Claude Sonnet 5 debe compararse mediante solicitudes equivalentes y registros completos, no mediante ejemplos seleccionados.

Considere reranking si el recall inicial es razonable pero los primeros resultados contienen demasiado ruido o relegan evidencia decisiva. Considere revisión humana para respuestas de alto impacto, contradicciones documentales, tablas complejas o casos donde la validación automática no alcance un acuerdo suficiente con los revisores. Ninguna de estas medidas elimina la necesidad de medir cada capa: añade otra variable que también debe auditarse.

Publique la tarjeta del experimento junto a los resultados: definición y versión del corpus, esquema de anotación, distribución de consultas, configuraciones efectivas, artefactos de recuperación, criterios de grader, acuerdo entre evaluadores, intervalos o incertidumbre estadística, latencia, coste y errores representativos. No publique sólo una tasa agregada ni ejemplos de demostración. El marco de evaluación de calidad de recuperación y los trabajos sobre RAG multimodal refuerzan la necesidad de observar acceso a evidencia y respuesta por separado.

Los resultados no se generalizan automáticamente a todos los repositorios empresariales. La prevalencia de PDFs escaneados, idiomas, calidad del OCR, densidad de tablas, permisos, actualización documental y tolerancia al coste pueden cambiar la decisión. La conclusión defendible es local: bajo condiciones documentadas, una configuración recuperó mejor cierta evidencia o produjo respuestas más fieles. Esa precisión es más útil que atribuir capacidades generales a modelos que desempeñan funciones distintas.

Qué sigue abierto

  • La documentación de proveedores describe capacidades e identificadores, pero no garantiza resultados relativos en un corpus empresarial específico.
  • El comportamiento puede variar con OCR, parser, idioma, estrategia de fragmentado, filtros, dimensiones, top-k, reranking y composición del contexto.
  • La evaluación de fidelidad y de respaldo de citas contiene juicio humano; debe publicarse la rúbrica, el acuerdo entre revisores y los desacuerdos.
  • No se aportan resultados experimentales para las cuatro configuraciones; el artículo define un protocolo de evaluación, no una clasificación de rendimiento.
  • La disponibilidad, precios, canales de acceso y parámetros efectivos deben verificarse y registrarse en el momento de cada ejecución.
09

Continúa explorando

09

Fuentes consultadas

03

Correcciones y transparencia

Si detectas un dato incorrecto o desactualizado, puedes enviarnos una corrección indicando la página y la fuente que debemos revisar.

Proponer una corrección