Recuperar un pasaje no demuestra una respuesta
En un sistema de generación aumentada por recuperación, o RAG, el resultado no depende únicamente de que el buscador encuentre documentos relacionados con una consulta. También depende de que la respuesta final use esos documentos correctamente. Un pasaje puede tratar el mismo tema sin responder la pregunta; varios pasajes pertinentes pueden dejar sin resolver una parte importante; y una referencia puede ser real aunque no respalde la afirmación junto a la que aparece.
Por eso, la pregunta de diseño no debería ser solo «¿ha encontrado el sistema documentos?», sino «¿qué afirmaciones permite hacer la evidencia recuperada?». El cambio parece pequeño, pero modifica cómo se construyen las respuestas, cómo se prueba el sistema y cómo se investigan los fallos. El objetivo no es forzar una contestación para cada consulta: es que el sistema responda cuando los pasajes basten y elija una salida controlada cuando no basten.
Esta guía se centra en esa decisión final. No aborda el mantenimiento o versionado del corpus, la migración de embeddings ni la evaluación de agentes de investigación web. Tampoco propone que una puntuación automática certifique que una respuesta es verdadera. Propone un método operativo para inspeccionar la relación entre consulta, evidencia y afirmaciones, y para encontrar situaciones en las que esa relación se rompe.
Define un contrato de evidencia antes de evaluar
Un contrato de evidencia describe qué debe cumplir una respuesta para considerarse aceptable en un producto concreto. No es una promesa de exactitud absoluta ni una instrucción genérica como «usa las fuentes». Debe dejar claro qué fuentes puede usar el sistema, qué se entiende por respaldo suficiente, qué referencias debe devolver y qué hacer cuando la evidencia no alcanza.
Empieza por clasificar las preguntas que esperas recibir. Una pregunta sobre una fecha, un procedimiento interno, una comparación o una recomendación puede requerir respaldos distintos. En una pregunta factual sencilla, quizá baste un pasaje directo y aplicable. Para una comparación, podrían hacer falta datos sobre ambos elementos. Para una pregunta compuesta, cada parte debe quedar respaldada o señalarse como no resuelta. Es una decisión de producto: las fuentes aportadas no determinan un umbral universal de suficiencia.
Especifica también la admisibilidad. Por ejemplo, en un asistente interno podrías limitar la respuesta a documentos autorizados del espacio de trabajo; en un producto con documentación pública, podrías permitir un conjunto de publicaciones seleccionadas. No mezcles sin explicación una fuente admisible con una que el producto no debería usar. Si dos fuentes admisibles discrepan, define si el sistema debe exponer el conflicto, aplicar una regla de precedencia aprobada o abstenerse. No permitas que invente una resolución.
Por último, define qué información necesita una persona para revisar una referencia: una identidad estable del documento y una ubicación localizable, como una sección o un fragmento. La forma técnica concreta dependerá del sistema. Lo importante es que una referencia no sea solo una etiqueta decorativa, y que una persona pueda comprobar el contenido citado sin tener que adivinar dónde se encuentra.
Decisiones que debe fijar el contrato
| Decisión | Pregunta de diseño | Criterio práctico |
|---|---|---|
| Fuentes admisibles | ¿Qué documentos puede usar el sistema para contestar? | Define el conjunto permitido y cómo tratar material fuera de él. |
| Respaldo suficiente | ¿Qué evidencia permite contestar este tipo de pregunta? | Exige apoyo directo para cada parte factual relevante. |
| Contradicciones | ¿Qué ocurre si fuentes admisibles discrepan? | Expón el conflicto o aplica una regla explícita; no lo ocultes. |
| Referencias | ¿Puede una persona localizar y revisar el pasaje? | Devuelve identificadores y ubicaciones útiles para la inspección. |
| Falta de evidencia | ¿Qué respuesta controlada se permite? | Elige entre respuesta parcial, aclaración o abstención. |
Separa las afirmaciones de sus referencias
Una respuesta puede combinar varias afirmaciones: un hecho, una condición, una fecha y una conclusión. Si todas comparten una lista de referencias al final, resulta difícil saber cuál de ellas respalda cada fuente. Conviene diseñar la salida de manera que una persona pueda inspeccionar por separado las afirmaciones comprobables y los pasajes que el sistema asocia con ellas.
No hace falta imponer un formato visual único. Puede presentarse como texto con referencias junto a cada afirmación, como una lista estructurada de afirmaciones y fuentes, o como una respuesta breve acompañada de fragmentos inspeccionables. Sea cual sea el formato, debe conservar la relación entre la afirmación y su respaldo. Evita agrupar bajo una sola cita frases que contienen hechos distintos si el pasaje solo respalda una parte.
La distinción entre una referencia correcta y una respuesta fiel a la evidencia es importante. Un documento puede ser pertinente y auténtico, pero la respuesta puede atribuirle algo que no dice o apoyarse en conocimiento ajeno al pasaje. Un trabajo de investigación sobre atribuciones en RAG trata precisamente la diferencia entre corrección de la cita y fidelidad en el uso de la evidencia, incluido el problema de añadir citas después de redactar. Como consecuencia práctica, la revisión debe comprobar la afirmación frente al texto y no limitarse a verificar que el documento exista.
En respuestas largas, considera dividir el texto en unidades que puedan revisarse. Para cada unidad factual, registra si hay respaldo directo, respaldo parcial, contradicción o ausencia de evidencia suficiente. Es una recomendación de diseño, no una garantía de que el modelo clasifique siempre bien. El valor de esa separación es que hace los fallos visibles y permite corregirlos con ejemplos concretos.
Prueba recuperación, respaldo y decisión por separado
Una evaluación útil no reduce todo el proceso a una nota global. Si la respuesta falla, hay que poder distinguir si el pasaje necesario no se recuperó, si se recuperó pero la respuesta lo interpretó mal, si la referencia no se puede inspeccionar o si el sistema debió abstenerse. La documentación de evaluadores de RAG de Microsoft describe dimensiones diferenciadas para examinar la recuperación y aspectos de la respuesta como su fundamentación, relevancia y completitud. Un marco de evaluación de RAG publicado como RAGAS también separa dimensiones como relevancia del contexto, fidelidad de la respuesta y relevancia de la respuesta.
Para un conjunto inicial no necesitas empezar con una batería enorme. Reúne preguntas que representen el uso real y prepara, para cada una, una respuesta esperada en términos de evidencia: qué parte debería resolverse, qué pasaje sería suficiente y qué salida corresponde si ese pasaje no aparece. Una persona debe revisar el material de referencia y los criterios; si no, el conjunto puede medir con precisión una interpretación equivocada.
Anota resultados por etapa. Para cada pregunta, registra qué documentos y pasajes se recuperaron, qué afirmaciones emitió el sistema, qué referencias adjuntó y qué decisión tomó. Distingue, al menos, recuperación insuficiente, pasaje irrelevante, evidencia parcial, afirmación no respaldada, cita no localizable, contradicción no comunicada y abstención inadecuada. Estas categorías son una propuesta de diagnóstico: adapta los nombres a tu producto, pero conserva la posibilidad de localizar el punto de fallo.
No interpretes una puntuación agregada como certificado de verdad. Un resultado favorable en relevancia no demuestra que todas las afirmaciones estén respaldadas; una respuesta bien fundamentada puede ser incompleta; y una referencia verificable no prueba que la conclusión sea correcta. Las medidas automáticas ayudan a detectar patrones y priorizar revisiones, pero los casos límite y los errores de alto impacto necesitan inspección humana según el riesgo del producto.
Protocolo de prueba inicial
- 01Selecciona preguntas representativas y escribe qué evidencia concreta permitiría responder cada una.
- 02Revisa manualmente los pasajes esperados y señala si la respuesta completa, parcial o ninguna está respaldada.
- 03Ejecuta el sistema y conserva consulta, pasajes recuperados, respuesta, referencias y decisión de respuesta.
- 04Compara cada afirmación factual con el pasaje asociado; clasifica respaldo directo, parcial, ausente o contradictorio.
- 05Registra el tipo de fallo y cambia una cosa cada vez: recuperación, instrucciones o lógica de decisión.
- 06Repite el conjunto tras el cambio y revisa también los ejemplos que antes funcionaban.
Incluye casos difíciles, no solo preguntas respondibles
Un conjunto de prueba formado únicamente por preguntas cuya respuesta aparece literalmente en un documento no comprueba si el sistema sabe detenerse. Incluye deliberadamente consultas sin respuesta en el corpus, consultas ambiguas, preguntas que solo pueden contestarse en parte y pasajes que comparten vocabulario con la consulta pero no aportan la información solicitada. Estos casos revelan si el modelo confunde similitud temática con prueba.
Para la ausencia de respuesta, comprueba si el sistema reconoce el límite del material disponible sin afirmar que el hecho no existe en el mundo. «No encuentro respaldo suficiente en los documentos disponibles» es distinto de «eso no existe». Para la ambigüedad, decide si una pregunta aclaratoria resuelve una diferencia importante, como un periodo, una región o una definición. Para la respuesta parcial, conserva lo que sí está respaldado y delimita explícitamente lo que no.
La evidencia contradictoria merece una prueba específica. Recupera dos documentos admisibles que afirmen cosas incompatibles y observa si la respuesta presenta una versión como indiscutible, combina ambas de forma incoherente o señala la discrepancia. Si existe una regla aprobada para determinar vigencia o prioridad, verifica que el sistema la aplique solo cuando la evidencia permita hacerlo. Si no existe, la salida prudente es describir el conflicto o abstenerse de resolverlo.
También prueba distractores: documentos que mencionan las mismas entidades o conceptos, pero no contestan la pregunta. No basta con comprobar que el sistema haya recuperado algo relacionado; revisa si las afirmaciones se siguen realmente de ese contenido. El propósito de estos casos no es castigar al sistema por no adivinar, sino comprobar que diferencia entre una pista temática y un respaldo suficiente.
Matriz breve de casos adversos
| Caso | Qué comprobar | Salida esperada |
|---|---|---|
| Sin respuesta en el corpus | Si el sistema evita completar con conocimiento no respaldado. | Indicar que los documentos disponibles no bastan. |
| Pregunta ambigua | Si identifica la interpretación que falta y su importancia. | Pedir una aclaración cuando cambie la respuesta. |
| Respuesta parcialmente respaldada | Si separa los datos disponibles de la parte no resuelta. | Responder solo la parte respaldada y delimitar el resto. |
| Fuentes contradictorias | Si reconoce la discrepancia y no la oculta. | Exponer el conflicto o aplicar una regla explícita y verificable. |
| Pasaje temáticamente parecido | Si distingue similitud léxica de evidencia directa. | No afirmar lo que el pasaje no establece. |
Comprueba cada cita contra la afirmación concreta
La revisión de citas puede organizarse como una secuencia breve. Primero, verifica que la referencia apunte a una fuente admisible y que el documento exista en el entorno donde se usará. Segundo, comprueba que la ubicación permita encontrar el fragmento. Tercero, compara el texto del pasaje con la afirmación exacta: ¿la respalda directamente, solo aporta contexto, la contradice o no trata ese punto? Por último, revisa si la respuesta añadió condiciones, causalidad o alcance que la fuente no contiene.
Esta revisión tiene que ser local. Que un documento sea fiable en general no significa que respalde cualquier afirmación atribuida a él. Del mismo modo, una respuesta puede sonar razonable y tener una referencia pertinente sin que el pasaje citado implique su conclusión. Cuando la fuente solo respalde una parte, modifica la redacción para reflejar ese límite o elimina la afirmación restante.
Prueba también referencias defectuosas: identificadores inexistentes, ubicaciones demasiado generales, fragmentos duplicados y citas asociadas a la afirmación equivocada. Si la interfaz muestra referencias al final de un párrafo, una persona debería poder determinar con claridad qué frases cubren. Un vínculo técnicamente funcional no sustituye esa relación semántica.
Al registrar un fallo, conserva la consulta, el pasaje y la respuesta exacta. «La cita está mal» no es suficiente para mejorar el sistema: indica si la fuente no existe, el pasaje no aparece, el contenido no respalda la afirmación o la respuesta exagera lo que se puede concluir. Esta precisión ayuda a decidir si hay que ajustar la recuperación, la composición de la respuesta o las reglas de atribución.
Elige entre responder, responder parcialmente, aclarar o abstenerse
La salida no tiene por qué ser binaria. Una política práctica distingue cuatro posibilidades: responder cuando los pasajes respaldan lo solicitado; responder parcialmente cuando una parte está resuelta y otra no; pedir aclaración cuando varias interpretaciones razonables llevarían a respuestas diferentes; y abstenerse cuando no hay evidencia suficiente o el conflicto no se puede resolver con las reglas disponibles.
Define estas opciones con ejemplos y criterios observables. Evita instrucciones vagas como «responde con cautela»: no indican qué debe hacer el sistema ante una fecha ausente, una contradicción o una pregunta ambigua. Una abstención útil debe explicar el límite de forma acotada y, si es posible, decir qué información permitiría continuar. No debe inventar una explicación para justificar por qué no respondió.
Evalúa también los errores en ambas direcciones. Una respuesta sin respaldo es un fallo, pero una abstención innecesaria puede impedir que el usuario obtenga información que sí estaba disponible. Por eso, el conjunto de prueba debe incluir tanto casos donde la abstención es apropiada como casos donde la evidencia basta para responder. La documentación de evaluación de Microsoft incluye la abstención entre las dimensiones que pueden evaluarse en sistemas generativos; aquí se aplica el principio a la decisión de respuesta, sin extender el alcance a agentes de investigación web.
Las respuestas parciales requieren especial cuidado: no presentes una parte confirmada de manera que parezca resolver la consulta completa. Si la persona preguntó por una duración y una excepción, responde la duración con su respaldo y declara que el pasaje no identifica quién autoriza la excepción. Si la parte pendiente cambia sustancialmente el sentido, pregunta antes de dar una conclusión que podría inducir a error.
Regla de decisión para la respuesta
| Estado de la evidencia | Acción | Qué debe ver la persona |
|---|---|---|
| Directa y suficiente para toda la pregunta | Responder | Afirmaciones separables y referencias localizables. |
| Directa para una parte, insuficiente para otra | Responder parcialmente | Qué parte se resuelve y qué parte queda abierta. |
| La interpretación no está clara y afecta al resultado | Pedir aclaración | La ambigüedad concreta que debe resolver. |
| Ausente, irrelevante o contradictoria sin regla de resolución | Abstenerse o exponer el conflicto | El límite de la evidencia disponible, sin presentarlo como certeza universal. |
Analiza los fallos antes de cambiar el sistema
Cuando una prueba falla, evita corregirla de inmediato con una instrucción más larga. Primero determina en qué etapa se produjo el problema. Si el documento necesario no apareció, el fallo puede estar en la recuperación. Si el pasaje aparece, pero no sostiene la respuesta, puede fallar la interpretación, la composición o la regla que autoriza responder. Si la referencia no lleva al fragmento, el problema es de trazabilidad. Si la evidencia es insuficiente y el sistema responde como si bastara, falla la decisión de abstención.
Mantén un registro de ejemplos fallidos con su categoría, impacto y cambio aplicado. Cambia un componente cada vez cuando sea posible y vuelve a ejecutar tanto el caso que fallaba como ejemplos que ya pasaban. Una modificación que mejora respuestas ausentes puede aumentar abstenciones innecesarias; otra que refuerza la fluidez puede ocultar límites. La revisión de regresión sirve para detectar esos intercambios.
Separa los indicadores por etapa. Puedes informar cuántas consultas recuperan pasajes relevantes según la revisión, cuántas afirmaciones tienen apoyo suficiente, cuántas referencias son inspeccionables y cómo se comporta la política ante evidencia insuficiente. No combines todo en una cifra que esconda diferencias. Ninguna de estas medidas, por sí sola, demuestra que el sistema sea correcto; ayudan a saber qué revisar y a comparar cambios bajo el mismo conjunto de pruebas.
Revisa los errores según su efecto en el uso previsto. Una afirmación sin respaldo sobre un procedimiento interno puede tener consecuencias distintas a un error en una pregunta de bajo impacto. El nivel de revisión humana, el tamaño del conjunto de pruebas y los criterios de aceptación deben ajustarse al riesgo y al contexto del producto. Esa calibración es una decisión del equipo responsable, no un umbral universal derivado de una métrica.
Diagnóstico de un resultado fallido
- 01¿Apareció el pasaje necesario entre los resultados recuperados? Si no, investiga la recuperación.
- 02¿El pasaje trata la pregunta concreta o solo comparte el tema? Si solo es temático, clasifícalo como evidencia insuficiente.
- 03¿Cada afirmación factual se sigue del pasaje asociado? Si no, corrige la atribución o la respuesta.
- 04¿La referencia permite que una persona localice el fragmento? Si no, corrige la trazabilidad.
- 05¿La evidencia era insuficiente y aun así el sistema respondió? Revisa la regla de respuesta parcial, aclaración o abstención.
- 06Vuelve a probar el caso y los ejemplos de regresión; conserva el resultado y la explicación del cambio.
Lista de aceptación antes del despliegue
Antes de poner en uso un sistema RAG, revisa que el equipo pueda responder con claridad a las preguntas de aceptación. No basta con que algunas demostraciones produzcan respuestas plausibles. Hay que comprobar el comportamiento con consultas respondibles y no respondibles, distinguir calidad de recuperación y respaldo de afirmaciones, y asegurarse de que la decisión de respuesta coincide con la evidencia disponible.
La revisión debe incluir los casos que suelen quedar fuera de una demostración: conflicto entre fuentes, pregunta incompleta, recuperación de un documento parecido pero insuficiente y consulta cuya respuesta solo está parcialmente documentada. Comprueba, además, que el formato permite inspeccionar la fuente y relacionarla con la afirmación correspondiente. Si no puede hacerse esa revisión, el equipo no tiene una base suficiente para sostener que las citas vuelven auditable la salida.
Las citas son una ayuda de inspección, no una garantía de verdad ni de corrección. Una cita puede apuntar al documento adecuado y no respaldar la frase; un pasaje puede sostener una afirmación sin resolver todo lo que se preguntó; y una evaluación automática puede simplificar matices. El criterio operativo es más limitado y verificable: exigir respaldo para cada afirmación factual importante, describir los límites cuando el respaldo no alcanza y medir por separado dónde falla el proceso.
El sistema está mejor preparado cuando el equipo puede mostrar ejemplos revisados de sus cuatro decisiones —responder, responder parcialmente, pedir aclaración y abstenerse—, identificar qué evidencia respalda cada afirmación y explicar cómo se trataron las contradicciones. Si todavía no puede hacerlo, el siguiente paso no es añadir más citas al texto: es mejorar el contrato, el conjunto de pruebas o la trazabilidad de la evidencia.
Qué sigue abierto
- No existe en las fuentes aportadas un umbral universal de evidencia suficiente; debe definirse según el tipo de pregunta y el riesgo del producto.
- Las fuentes disponibles respaldan la separación de dimensiones de evaluación y la importancia de fundamentar las respuestas, pero no prescriben un formato único para las referencias.
- La estrategia adecuada para resolver contradicciones depende de reglas de autoridad o vigencia que cada equipo debe definir y verificar.
- Las métricas automáticas pueden ayudar a comparar sistemas, pero no sustituyen la revisión humana de casos límite o de alto impacto.
Continúa explorando
Fuentes consultadas
Correcciones y transparencia
Si detectas un dato incorrecto o desactualizado, puedes enviarnos una corrección indicando la página y la fuente que debemos revisar.
Proponer una corrección