Récupérer un passage ne suffit pas à démontrer une réponse
Dans un système de génération augmentée par récupération, ou RAG, le résultat ne dépend pas uniquement de la capacité du moteur de recherche à trouver des documents en rapport avec une question. Il dépend aussi de la manière dont la réponse finale utilise ces documents. Un passage peut traiter du même sujet sans répondre à la question ; plusieurs passages pertinents peuvent laisser de côté une partie importante ; et une référence peut être authentique sans étayer l’affirmation à laquelle elle est associée.
La question de conception ne devrait donc pas être seulement : « Le système a-t-il trouvé des documents ? », mais plutôt : « Quelles affirmations les preuves récupérées permettent-elles de formuler ? » La différence peut sembler minime, mais elle change la façon de construire les réponses, de tester le système et d’analyser ses défaillances. L’objectif n’est pas de forcer une réponse à chaque question : c’est de répondre lorsque les passages suffisent et de choisir une réponse contrôlée dans le cas contraire.
Ce guide porte sur cette décision finale. Il ne traite ni de la maintenance ou du versionnement du corpus, ni de la migration des embeddings, ni de l’évaluation des agents de recherche Web. Il ne propose pas non plus de considérer un score automatique comme une certification de la vérité d’une réponse. Il présente une méthode opérationnelle pour examiner le lien entre la question, les preuves et les affirmations, et repérer les situations où ce lien se rompt.
Définir un contrat de preuve avant l’évaluation
Un contrat de preuve décrit les conditions qu’une réponse doit respecter pour être considérée comme acceptable dans un produit donné. Ce n’est ni une promesse d’exactitude absolue ni une consigne générique telle que « utilise les sources ». Il doit préciser quelles sources le système est autorisé à utiliser, ce qui constitue un appui suffisant, quelles références il doit fournir et que faire lorsque les preuves ne suffisent pas.
Commencez par classer les questions que vous pensez recevoir. Une question portant sur une date, une procédure interne, une comparaison ou une recommandation peut nécessiter des éléments justificatifs différents. Pour une question factuelle simple, un passage direct et applicable peut suffire. Une comparaison peut exiger des informations sur les deux éléments. Pour une question composée, chaque partie doit être étayée ou signalée comme non résolue. Il s’agit d’un choix produit : les sources fournies ne déterminent pas de seuil universel de suffisance.
Précisez également les critères d’admissibilité des sources. Dans un assistant interne, par exemple, vous pourriez limiter les réponses aux documents autorisés de l’espace de travail ; dans un produit reposant sur de la documentation publique, vous pourriez autoriser un ensemble de publications sélectionnées. Ne mélangez pas sans explication une source admissible avec une source que le produit ne devrait pas utiliser. Si deux sources admissibles se contredisent, définissez si le système doit exposer le désaccord, appliquer une règle de priorité approuvée ou s’abstenir. Ne le laissez pas inventer une solution.
Enfin, déterminez de quelles informations une personne a besoin pour vérifier une référence : une identité stable du document et un emplacement que l’on peut retrouver, comme une section ou un extrait. La forme technique exacte dépendra du système. L’essentiel est qu’une référence ne soit pas une simple étiquette décorative et qu’une personne puisse vérifier le contenu cité sans devoir deviner où il se trouve.
Les décisions à fixer dans le contrat
| Décision | Question de conception | Critère pratique |
|---|---|---|
| Sources admissibles | Quels documents le système peut-il utiliser pour répondre ? | Définissez l’ensemble autorisé et la manière de traiter les contenus qui en sont exclus. |
| Preuves suffisantes | Quels éléments permettent de répondre à ce type de question ? | Exigez un appui direct pour chaque partie factuelle pertinente. |
| Contradictions | Que se passe-t-il si des sources admissibles se contredisent ? | Exposez le désaccord ou appliquez une règle explicite ; ne le dissimulez pas. |
| Références | Une personne peut-elle retrouver et examiner le passage ? | Fournissez des identifiants et des emplacements utiles à la vérification. |
| Absence de preuves | Quelle réponse contrôlée est autorisée ? | Choisissez entre réponse partielle, demande de précision et abstention. |
Séparer les affirmations de leurs références
Une réponse peut réunir plusieurs affirmations : un fait, une condition, une date et une conclusion. Si elles partagent toutes une liste de références placée à la fin, il devient difficile de savoir quelle source étaye chacune d’elles. Il est préférable de concevoir la sortie de façon à ce qu’une personne puisse examiner séparément les affirmations vérifiables et les passages que le système leur associe.
Il n’est pas nécessaire d’imposer un format visuel unique. La réponse peut être présentée sous forme de texte avec des références placées près de chaque affirmation, de liste structurée d’affirmations et de sources, ou de réponse courte accompagnée d’extraits consultables. Quel que soit le format, le lien entre l’affirmation et son appui doit rester clair. Évitez de regrouper sous une seule citation des phrases contenant des faits distincts si le passage n’en étaye qu’une partie.
Il est important de distinguer une référence exacte d’une réponse fidèle aux preuves. Un document peut être pertinent et authentique alors que la réponse lui attribue quelque chose qu’il ne dit pas, ou s’appuie sur des connaissances étrangères au passage. Un travail de recherche sur l’attribution dans les systèmes RAG traite précisément de la différence entre l’exactitude d’une citation et la fidélité de l’utilisation des preuves, notamment du problème des citations ajoutées après la rédaction. En pratique, la vérification doit donc confronter l’affirmation au texte, et non se limiter à confirmer l’existence du document.
Pour les réponses longues, envisagez de diviser le texte en unités vérifiables. Pour chaque unité factuelle, indiquez s’il existe un appui direct, un appui partiel, une contradiction ou une absence de preuves suffisantes. C’est une recommandation de conception, et non la garantie que le modèle fera toujours cette classification correctement. L’intérêt de cette séparation est de rendre les erreurs visibles et de permettre de les corriger à partir d’exemples concrets.
Tester séparément la récupération, l’appui et la décision
Une évaluation utile ne ramène pas l’ensemble du processus à une note globale. En cas d’échec, il faut pouvoir déterminer si le passage nécessaire n’a pas été récupéré, s’il l’a été mais que la réponse l’a mal interprété, si la référence est impossible à vérifier ou si le système aurait dû s’abstenir. La documentation de Microsoft sur les évaluateurs RAG décrit des dimensions distinctes pour examiner la récupération ainsi que des aspects de la réponse tels que son ancrage dans les preuves, sa pertinence et son exhaustivité. Un cadre d’évaluation du RAG publié sous le nom de RAGAS distingue lui aussi des dimensions comme la pertinence du contexte, la fidélité de la réponse et la pertinence de celle-ci.
Pour constituer un premier jeu de tests, nul besoin de commencer par une batterie immense. Rassemblez des questions représentatives de l’utilisation réelle et préparez, pour chacune, une réponse attendue en termes de preuves : quelle partie devrait pouvoir être résolue, quel passage serait suffisant et quelle sortie convient si ce passage est absent. Une personne doit vérifier les documents de référence et les critères ; sinon, le jeu de tests risque de mesurer avec précision une interprétation erronée.
Consignez les résultats à chaque étape. Pour chaque question, notez les documents et passages récupérés, les affirmations formulées par le système, les références jointes et la décision prise. Distinguez au minimum : récupération insuffisante, passage non pertinent, preuves partielles, affirmation non étayée, référence introuvable, contradiction non signalée et abstention inappropriée. Ces catégories constituent une proposition de diagnostic : adaptez leur nom à votre produit, mais préservez la possibilité de localiser le point de défaillance.
N’interprétez pas un score agrégé comme une certification de vérité. Un bon résultat en matière de pertinence ne prouve pas que toutes les affirmations sont étayées ; une réponse bien fondée peut être incomplète ; et une référence vérifiable ne prouve pas que la conclusion est correcte. Les mesures automatiques aident à repérer des tendances et à prioriser les vérifications, mais les cas limites et les erreurs à fort impact nécessitent une inspection humaine en fonction des risques du produit.
Protocole de test initial
- 01Choisissez des questions représentatives et précisez quelles preuves concrètes permettraient de répondre à chacune.
- 02Examinez manuellement les passages attendus et indiquez si la réponse complète, partielle ou aucune réponse est étayée.
- 03Exécutez le système et conservez la question, les passages récupérés, la réponse, les références et la décision de réponse.
- 04Comparez chaque affirmation factuelle au passage associé ; classez l’appui comme direct, partiel, absent ou contradictoire.
- 05Consignez le type d’échec et ne modifiez qu’un élément à la fois : récupération, instructions ou logique de décision.
- 06Relancez le jeu de tests après la modification et réexaminez également les exemples qui fonctionnaient auparavant.
Inclure des cas difficiles, pas seulement des questions auxquelles on peut répondre
Un jeu de tests composé uniquement de questions dont la réponse figure littéralement dans un document ne permet pas de vérifier si le système sait s’arrêter. Incluez délibérément des questions sans réponse dans le corpus, des questions ambiguës, des questions auxquelles on ne peut répondre que partiellement et des passages qui partagent le vocabulaire de la question sans fournir l’information demandée. Ces cas révèlent si le modèle confond ressemblance thématique et preuve.
En cas d’absence de réponse, vérifiez si le système reconnaît les limites des documents disponibles sans affirmer que le fait n’existe pas dans le monde. « Je ne trouve pas d’appui suffisant dans les documents disponibles » ne signifie pas la même chose que « cela n’existe pas ». Pour une question ambiguë, déterminez si une demande de précision permet de résoudre une différence importante, par exemple de période, de région ou de définition. Pour une réponse partielle, conservez ce qui est étayé et délimitez explicitement ce qui ne l’est pas.
Les preuves contradictoires méritent un test spécifique. Récupérez deux documents admissibles qui énoncent des choses incompatibles et observez si la réponse présente une version comme indiscutable, combine les deux de façon incohérente ou signale le désaccord. S’il existe une règle approuvée pour déterminer l’actualité ou la priorité des sources, vérifiez que le système ne l’applique que lorsque les preuves le permettent. En l’absence de règle, la réponse prudente consiste à décrire le désaccord ou à s’abstenir de le résoudre.
Testez également les éléments distracteurs : des documents qui mentionnent les mêmes entités ou concepts, mais ne répondent pas à la question. Il ne suffit pas de vérifier que le système a récupéré du contenu apparenté ; examinez si les affirmations découlent réellement de ce contenu. Ces cas ne visent pas à pénaliser le système parce qu’il ne devine pas, mais à vérifier qu’il distingue une piste thématique d’un appui suffisant.
Courte matrice de cas défavorables
| Cas | Point à vérifier | Sortie attendue |
|---|---|---|
| Aucune réponse dans le corpus | Le système évite-t-il de compléter avec des connaissances non étayées ? | Indiquer que les documents disponibles ne suffisent pas. |
| Question ambiguë | Le système repère-t-il l’interprétation manquante et son importance ? | Demander une précision lorsque celle-ci change la réponse. |
| Réponse partiellement étayée | Le système sépare-t-il les informations disponibles de la partie non résolue ? | Répondre uniquement à la partie étayée et délimiter le reste. |
| Sources contradictoires | Le système reconnaît-il le désaccord au lieu de le dissimuler ? | Exposer le conflit ou appliquer une règle explicite et vérifiable. |
| Passage thématiquement proche | Le système distingue-t-il la proximité lexicale d’une preuve directe ? | Ne pas affirmer ce que le passage n’établit pas. |
Vérifier chaque citation par rapport à l’affirmation précise
La vérification des citations peut suivre une courte séquence. D’abord, assurez-vous que la référence renvoie à une source admissible et que le document existe dans l’environnement où le système sera utilisé. Ensuite, vérifiez que l’emplacement permet de retrouver le passage. Puis comparez le texte du passage à l’affirmation exacte : l’étaye-t-il directement, fournit-il seulement du contexte, la contredit-il ou ne traite-t-il pas ce point ? Enfin, vérifiez si la réponse a ajouté des conditions, un lien de causalité ou une portée que la source ne contient pas.
Cette vérification doit être locale. Le fait qu’un document soit fiable en général ne signifie pas qu’il étaye n’importe quelle affirmation qui lui est attribuée. De même, une réponse peut sembler raisonnable et être accompagnée d’une référence pertinente sans que le passage cité implique sa conclusion. Lorsque la source n’étaye qu’une partie de l’affirmation, reformulez la réponse pour respecter cette limite ou supprimez le reste.
Testez également les références défectueuses : identifiants inexistants, emplacements trop généraux, extraits dupliqués et citations associées à la mauvaise affirmation. Si l’interface affiche les références à la fin d’un paragraphe, une personne doit pouvoir déterminer clairement quelles phrases elles couvrent. Un lien techniquement fonctionnel ne remplace pas cette relation sémantique.
Lorsque vous consignez un échec, conservez la question, le passage et la réponse exacts. « La citation est incorrecte » ne suffit pas pour améliorer le système : précisez si la source n’existe pas, si le passage est introuvable, si son contenu n’étaye pas l’affirmation ou si la réponse exagère ce qu’il est possible d’en conclure. Cette précision permet de décider s’il faut modifier la récupération, la formulation de la réponse ou les règles d’attribution.
Choisir entre répondre, répondre partiellement, demander une précision ou s’abstenir
La réponse n’a pas à être binaire. Une politique pratique distingue quatre possibilités : répondre lorsque les passages étayent ce qui est demandé ; répondre partiellement lorsqu’une partie est résolue et l’autre non ; demander une précision lorsque plusieurs interprétations raisonnables conduiraient à des réponses différentes ; et s’abstenir lorsqu’il n’existe pas de preuves suffisantes ou que le désaccord ne peut être résolu à l’aide des règles disponibles.
Définissez ces options à l’aide d’exemples et de critères observables. Évitez les consignes vagues telles que « réponds avec prudence » : elles n’indiquent pas quoi faire lorsqu’une date est absente, que des sources se contredisent ou que la question est ambiguë. Une abstention utile doit expliquer précisément la limite et, si possible, indiquer quelles informations permettraient de poursuivre. Elle ne doit pas inventer une explication pour justifier l’absence de réponse.
Évaluez aussi les erreurs dans les deux sens. Une réponse non étayée est un échec, mais une abstention inutile peut empêcher l’utilisateur d’obtenir une information pourtant disponible. Le jeu de tests doit donc inclure des cas où l’abstention est appropriée et d’autres où les preuves suffisent pour répondre. La documentation de Microsoft sur l’évaluation des systèmes génératifs inclut l’abstention parmi les dimensions évaluables ; le principe s’applique ici à la décision de réponse, sans étendre le périmètre à l’évaluation des agents de recherche Web.
Les réponses partielles exigent une attention particulière : ne présentez pas une partie confirmée de façon à laisser croire qu’elle répond à l’ensemble de la question. Si la personne demande une durée et une dérogation, donnez la durée avec son appui et précisez que le passage n’indique pas qui autorise la dérogation. Si la partie en suspens change substantiellement le sens, demandez une précision avant de tirer une conclusion susceptible d’induire en erreur.
Règle de décision pour la réponse
| État des preuves | Action | Ce que la personne doit voir |
|---|---|---|
| Directes et suffisantes pour toute la question | Répondre | Des affirmations distinctes et des références faciles à retrouver. |
| Directes pour une partie, insuffisantes pour une autre | Répondre partiellement | La partie résolue et celle qui reste en suspens. |
| L’interprétation n’est pas claire et influe sur le résultat | Demander une précision | L’ambiguïté précise à résoudre. |
| Absentes, non pertinentes ou contradictoires sans règle de résolution | S’abstenir ou exposer le désaccord | La limite des preuves disponibles, sans la présenter comme une certitude universelle. |
Analyser les échecs avant de modifier le système
Lorsqu’un test échoue, évitez de commencer par ajouter une consigne plus longue. Déterminez d’abord à quelle étape le problème s’est produit. Si le document nécessaire n’est pas apparu, la défaillance peut venir de la récupération. Si le passage est présent mais ne justifie pas la réponse, le problème peut concerner l’interprétation, la formulation ou la règle autorisant la réponse. Si la référence ne mène pas au passage, il s’agit d’un problème de traçabilité. Si les preuves sont insuffisantes et que le système répond comme si elles suffisaient, c’est la décision d’abstention qui est en cause.
Tenez un registre des exemples d’échec avec leur catégorie, leur impact et la modification appliquée. Dans la mesure du possible, ne changez qu’un composant à la fois, puis relancez le test qui échouait ainsi que des exemples qui réussissaient déjà. Une modification qui améliore le traitement des réponses absentes peut provoquer trop d’abstentions ; une autre, destinée à renforcer la fluidité, peut masquer les limites. Les tests de régression permettent de repérer ces compromis.
Séparez les indicateurs par étape. Vous pouvez indiquer combien de questions récupèrent des passages pertinents selon l’examen, combien d’affirmations disposent d’un appui suffisant, combien de références sont consultables et comment la politique se comporte lorsque les preuves manquent. Ne regroupez pas tous ces résultats en un seul chiffre qui masquerait leurs différences. Aucun de ces indicateurs ne démontre, à lui seul, que le système est correct ; ils aident à déterminer quoi examiner et à comparer les modifications sur le même jeu de tests.
Examinez les erreurs en fonction de leurs conséquences dans l’usage prévu. Une affirmation non étayée sur une procédure interne peut avoir d’autres conséquences qu’une erreur portant sur une question à faible impact. Le niveau de contrôle humain, la taille du jeu de tests et les critères d’acceptation doivent être adaptés aux risques et au contexte du produit. Cette calibration relève de l’équipe responsable ; il ne s’agit pas d’un seuil universel déduit d’une mesure.
Diagnostiquer un résultat en échec
- 01Le passage nécessaire figure-t-il parmi les résultats récupérés ? Si ce n’est pas le cas, examinez la récupération.
- 02Le passage traite-t-il précisément de la question ou partage-t-il seulement le même thème ? S’il est seulement thématique, classez-le comme preuve insuffisante.
- 03Chaque affirmation factuelle découle-t-elle du passage associé ? Sinon, corrigez l’attribution ou la réponse.
- 04La référence permet-elle à une personne de retrouver le passage ? Sinon, corrigez la traçabilité.
- 05Les preuves étaient-elles insuffisantes alors que le système a répondu ? Revoyez la règle de réponse partielle, de demande de précision ou d’abstention.
- 06Relancez le test et les tests de régression ; conservez le résultat ainsi que l’explication de la modification.
Liste d’acceptation avant le déploiement
Avant de mettre un système RAG en service, vérifiez que l’équipe peut répondre clairement aux questions d’acceptation. Il ne suffit pas que quelques démonstrations produisent des réponses plausibles. Il faut tester le comportement face à des questions auxquelles il est possible ou impossible de répondre, distinguer la qualité de la récupération de l’appui des affirmations et s’assurer que la décision de réponse correspond aux preuves disponibles.
La vérification doit inclure les cas souvent absents des démonstrations : désaccord entre les sources, question incomplète, récupération d’un document proche mais insuffisant et question dont la réponse n’est que partiellement documentée. Vérifiez également que le format permet de consulter la source et de la relier à l’affirmation concernée. Si cette vérification est impossible, l’équipe ne dispose pas d’une base suffisante pour affirmer que les citations rendent la sortie vérifiable.
Les citations facilitent l’examen, mais ne garantissent ni la vérité ni l’exactitude. Une citation peut renvoyer au bon document sans étayer la phrase ; un passage peut soutenir une affirmation sans résoudre l’ensemble de la question ; et une évaluation automatique peut simplifier certaines nuances. Le critère opérationnel est plus limité et vérifiable : exiger un appui pour chaque affirmation factuelle importante, décrire les limites lorsque cet appui est insuffisant et mesurer séparément les points de défaillance du processus.
Le système est mieux préparé lorsque l’équipe peut montrer des exemples examinés correspondant à ses quatre décisions — répondre, répondre partiellement, demander une précision et s’abstenir —, identifier les preuves qui étayent chaque affirmation et expliquer comment les contradictions ont été traitées. Si elle ne le peut pas encore, la prochaine étape n’est pas d’ajouter davantage de citations au texte : il faut améliorer le contrat, le jeu de tests ou la traçabilité des preuves.
Questions ouvertes
- Les sources fournies ne définissent pas de seuil universel de preuves suffisantes ; celui-ci doit être déterminé en fonction du type de question et des risques du produit.
- Les sources disponibles étayent la séparation des dimensions d’évaluation et l’importance de fonder les réponses, mais elles ne prescrivent pas de format unique pour les références.
- La bonne stratégie face aux contradictions dépend de règles d’autorité ou d’actualité que chaque équipe doit définir et vérifier.
- Les mesures automatiques peuvent aider à comparer les systèmes, mais elles ne remplacent pas l’examen humain des cas limites ou à fort impact.
Poursuivre l’exploration
Sources consultées
Corrections et transparence
Si vous repérez une information incorrecte ou obsolète, envoyez-nous la page et la source à vérifier.
Proposer une correction