Chaîne de pensée en IA : ce qu’elle est et ce qu’elle ne prouve pas
01

Définition en une phrase

Secuencia intermedia de razonamiento, visible o interna, que descompone un problema antes de producir una respuesta.

02

Définition : une séquence d’étapes intermédiaires formulées en texte

La chaîne de pensée (chain of thought, CoT) est une séquence d’étapes intermédiaires formulées en langage naturel qu’un modèle génère ou reçoit comme exemple pour traiter une tâche avant de produire une réponse finale. Dans son usage habituel, ces étapes présentent une partie du travail nécessaire pour parvenir à une conclusion : par exemple, isoler des données, établir une relation entre elles et effectuer une opération.

Le terme désigne le texte observable ainsi que la technique de prompting qui lui est associée ; il ne garantit pas que ce texte constitue une transcription complète ou fidèle des calculs internes du modèle. Une chaîne peut servir de support pour résoudre une tâche ou d’explication lisible pour une personne. Mais son apparence structurée ne prouve pas que chaque étape soit correcte, qu’elle ait causé la réponse finale ou qu’elle révèle ce qui s’est passé à l’intérieur du modèle.

On utilise surtout cette approche lorsqu’une tâche comporte plusieurs étapes et que l’on souhaite orienter le modèle pour qu’il les expose, ou lorsqu’on lui fournit des exemples de présentation d’une solution. Cette distinction importe aux équipes qui évaluent les modèles : une réponse présentée étape par étape peut être examinée, mais elle ne remplace ni la vérification de la réponse ni un test de fidélité.

03

Comment l’obtenir : exemples, consignes et supervision

Il existe plusieurs façons apparentées, mais non équivalentes, d’obtenir des étapes intermédiaires. Dans le prompting few-shot, le prompt contient un ou plusieurs exemples associant une entrée, un raisonnement formulé en texte et une réponse. Le travail de Wei et de ses collaborateurs étudie cette configuration et appelle chaîne de pensée les étapes intermédiaires de raisonnement incluses dans les exemples.

Dans une configuration zero-shot, on peut demander directement au modèle de traiter le problème étape par étape, sans lui présenter d’exemples complets de chaînes. Cette consigne n’est pas identique au prompting few-shot : les informations fournies dans le prompt diffèrent, même si les deux approches visent à susciter la production d’étapes intermédiaires.

Il est également possible d’entraîner un modèle à partir de données contenant des étapes, plutôt que de se limiter à les lui demander au moment de l’inférence. La supervision du processus fournit des signaux sur les étapes intermédiaires, tandis que la supervision du résultat porte sur la réponse finale. Il s’agit de choix d’entraînement et d’évaluation distincts de l’ajout d’exemples ou de consignes dans un prompt. Il ne faut pas les présenter comme si une simple phrase dans un prompt équivalait à un entraînement sur des traces de raisonnement.

Dans chacun de ces cas, le résultat peut être une séquence écrite qui semble décrire le travail effectué. La méthode utilisée pour la produire ne supprime pas la nécessité de la vérifier : les exemples peuvent orienter le format et la supervision peut évaluer des étapes, mais aucun de ces éléments ne transforme automatiquement le texte généré en lecture directe de l’état interne du modèle.

Trois voies à distinguer

  1. 01Exemples dans le prompt : présenter un ou plusieurs problèmes résolus avec leurs étapes, puis demander au modèle de suivre un format comparable.
  2. 02Consigne dans le prompt : demander des étapes intermédiaires sans nécessairement fournir d’exemples résolus.
  3. 03Supervision pendant l’entraînement : utiliser des données ou des signaux qui évaluent les étapes intermédiaires, au lieu de limiter la supervision au résultat final.
04

Trois exemples concrets et ce qu’ils permettent de vérifier

Les exemples ci-dessous sont illustratifs. Ils montrent comment une chaîne peut servir de compte rendu lisible et distinguent cet usage des éléments nécessaires pour affirmer que le résultat est correct ou que l’explication reflète fidèlement le processus interne.

Dans chaque domaine, l’utilité dépend de la tâche : en arithmétique, on peut vérifier une opération ; lorsqu’on combine des documents, on peut retrouver les passages qui étayent chaque affirmation ; en débogage, on peut tester le comportement du programme. Aucune de ces vérifications ne prouve, à elle seule, que la chaîne est une transcription fidèle des calculs internes du modèle.

05

À quoi elle sert et ce qu’il ne faut pas en déduire

Une chaîne peut servir de support : elle décompose une tâche en parties que l’on peut traiter les unes après les autres. Elle peut aussi rendre explicites des hypothèses qui resteraient autrement cachées dans une réponse brève. Pour la personne qui examine le résultat, cette structure facilite le repérage d’une opération, d’une prémisse ou d’une affirmation à vérifier.

La chaîne ne doit toutefois pas être confondue avec une démonstration. Elle peut contenir une étape erronée et aboutir malgré tout à la bonne réponse par hasard, ou présenter une conclusion plausible fondée sur une prémisse incorrecte. Elle peut également omettre des informations pertinentes. L’apparence détaillée n’équivaut pas à la qualité des éléments de preuve.

Les travaux sur les explications non fidèles dans le prompting par chaîne de pensée montrent que, dans les tâches étudiées, les chaînes peuvent ne pas refléter certains facteurs ayant influencé la réponse et peuvent rationaliser celle-ci a posteriori. Cela justifie une précaution concrète : ne pas traiter automatiquement le texte comme une fenêtre transparente sur le processus qui a produit la réponse. Les résultats expérimentaux ne permettent pas non plus d’affirmer que toutes les chaînes sont infidèles ; ils délimitent un risque qu’il faut évaluer plutôt qu’ignorer.

Pour étudier la fidélité, une approche possible consiste à intervenir sur la chaîne ou à la perturber, puis à observer si la réponse change, comme l’explorent les travaux de Lanham et de ses collaborateurs. Ces tests apportent des éléments sur la relation entre le texte et la réponse dans les conditions examinées. Ils ne permettent pas d’observer directement tous les calculs internes du modèle, et leurs conclusions dépendent des tâches et des méthodes employées.

Ce que la chaîne suggère et les vérifications nécessaires

ObservationCe qu’elle peut étayerCe qu’elle ne démontre pas à elle seule
La réponse présente des étapes ordonnées.Le modèle a produit un texte intermédiaire lisible.Que chaque étape soit correcte ou que la chaîne soit une transcription interne.
Le calcul correspond à une opération indépendante.Le résultat arithmétique de ce cas est correct.Que la chaîne ait causé la réponse ou représente fidèlement le processus interne.
Les affirmations concordent avec les passages des documents.La réponse est étayée par ces passages, si leur portée est respectée.Que le modèle ait interprété les documents en interne de la manière décrite.
Le code corrigé réussit les tests définis.Le comportement testé satisfait ces tests.Que l’explication du débogage soit complète ou fidèle.
06

Confusions fréquentes et concepts voisins

La chaîne de pensée n’est pas synonyme de raisonnement des modèles. Le raisonnement est le concept plus général qui désigne des tâches nécessitant de relier des informations, d’inférer ou de résoudre des problèmes ; dans ce contexte, CoT désigne des étapes intermédiaires formulées en texte et les techniques qui les sollicitent ou les utilisent. Une chaîne est une sortie observable, pas une mesure complète d’une capacité générale.

La chaîne de pensée n’est pas non plus synonyme de prompting en général. Le prompting englobe les consignes et les exemples fournis au modèle. CoT est une stratégie de prompting lorsque l’on cherche à obtenir des étapes intermédiaires. En outre, inclure une séquence d’étapes dans un seul prompt n’équivaut pas à enchaîner plusieurs appels distincts à un modèle : dans un flux enchaîné, la sortie d’une étape peut devenir l’entrée de la suivante.

Dans les tâches de génération augmentée par récupération (RAG), la chaîne peut expliciter la manière dont une question se rapporte aux passages récupérés. La présence de ces étapes ne valide pas à elle seule la récupération ni la réponse : il faut vérifier si les sources fournissent réellement les éléments de preuve et si la réponse en respecte la portée.

Enfin, une séquence de texte n’est pas une trace exécutable. PAL et Program of Thoughts étudient des approches qui expriment une partie du travail sous forme de programme afin qu’un interpréteur exécute le calcul. Un programme peut permettre de vérifier une opération ou un résultat donné par son exécution, mais cette vérification ne prouve pas la fidélité du raisonnement textuel. De leur côté, les vérificateurs d’étapes évaluent les étapes ou reçoivent une supervision à leur sujet : il ne faut pas les confondre simplement avec l’exécution de code.

Distinctions rapides

ConceptApprocheQuestion pratique
Raisonnement des modèlesConcept général de capacité ou de tâche d’inférence.Quelle tâche de raisonnement évalue-t-on ?
Chaîne de penséeÉtapes intermédiaires formulées en texte.Quelles étapes le modèle présente-t-il et lesquelles ont été vérifiées ?
PromptingConsignes et exemples fournis au modèle.Quelles informations le modèle a-t-il reçues avant de répondre ?
RAGGénération étayée par des informations récupérées.Les passages récupérés étayent-ils chaque affirmation ?
Programme exécutableInstructions qu’un interpréteur peut exécuter.Quel comportement ou calcul les tests vérifient-ils ?
07

Comment l’évaluer rigoureusement

L’évaluation doit distinguer au moins trois questions : le résultat est-il correct ? Les étapes présentées sont-elles valides ? Existe-t-il des éléments indiquant que ces étapes reflètent fidèlement le processus qui a produit la réponse ? Un même test répond rarement à lui seul à ces trois questions.

Pour le résultat, il convient d’utiliser une méthode indépendante adaptée au domaine : refaire un calcul, confronter des affirmations à des documents ou exécuter des tests sur le code. Pour les étapes, on peut examiner explicitement les prémisses, les inférences, les calculs et les éléments de preuve cités. Dans les tâches qui admettent plusieurs solutions valides, les critères doivent accepter les autres réponses correctes sans récompenser de simples explications plausibles.

Pour étudier la fidélité, des interventions ou des perturbations peuvent indiquer si la modification d’une chaîne affecte la réponse et dans quelles conditions. Elles doivent être conçues avec des contrôles et une question précise ; observer un changement ne suffit pas à conclure que l’on a reconstitué l’ensemble du processus interne. L’interprétation doit se limiter à ce que le test mesure.

Une pratique opérationnelle consiste à consigner séparément la réponse finale, la chaîne visible, les vérifications externes effectuées et les incertitudes. Si un outil vérifie un calcul, il faut préciser qu’il a vérifié ce calcul ; il ne faut pas transformer cela en affirmation selon laquelle tout le raisonnement était fidèle. Si les documents n’étayent pas une affirmation, il faut signaler cette lacune, même si le texte étape par étape paraît convaincant.

Liste de contrôle pour l’évaluation

  1. 01Définir ce qui est évalué : le résultat, la validité des étapes, la fidélité de l’explication ou une combinaison explicitement définie de ces éléments.
  2. 02Choisir un vérificateur indépendant adapté : calcul, comparaison avec des documents, tests de code ou autre critère propre à la tâche.
  3. 03Vérifier chaque affirmation ou étape importante et consigner les erreurs, les omissions et les ambiguïtés.
  4. 04Si la fidélité est étudiée, utiliser des interventions ou des perturbations avec des contrôles et limiter les conclusions aux tâches et au dispositif évalués.
  5. 05Présenter séparément le résultat, les vérifications effectuées et ce qu’il reste impossible de conclure.
08

Lectures techniques et limites des éléments disponibles

Le travail de Wei et de ses collaborateurs est une référence primaire pour la définition et le prompting few-shot à l’aide d’exemples de chaînes. L’étude consacrée aux raisonnements zero-shot examine une consigne demandant des étapes, sans que cela revienne à fournir des exemples résolus. Ces travaux aident à distinguer les configurations de prompting ; ils ne prouvent pas, à eux seuls, la fidélité de chaque chaîne produite.

PAL et Program of Thoughts explorent des manières de séparer la production d’étapes ou de programmes de l’exécution des calculs. Ces travaux sont utiles pour comprendre ce qu’un interpréteur peut vérifier, en particulier dans les tâches computationnelles ; vérifier un résultat exécuté ne prouve pas une transparence interne. L’étude sur la vérification étape par étape examine la supervision des processus par rapport à celle des résultats, une distinction pertinente pour l’évaluation et l’entraînement.

Les études sur les explications non fidèles et sur la mesure de la fidélité examinent des risques et des méthodes expérimentales précises. Leurs résultats permettent de justifier la prudence et de concevoir des évaluations, mais pas d’attribuer une propriété universelle à toutes les tâches, à tous les modèles ou à toutes les chaînes. Les éléments disponibles ne permettent pas d’observer directement l’ensemble du processus interne d’un modèle ; les affirmations relatives à la fidélité doivent donc être formulées avec une portée limitée.

09

Conseils pratiques

Lorsque vous lisez ou demandez une chaîne de pensée, considérez-la comme une explication textuelle qui peut aider à examiner une réponse, et non comme une preuve automatique de son exactitude ou de son origine interne. Demandez des étapes lorsqu’elles apportent quelque chose à la tâche, vérifiez séparément ce qui peut l’être et conservez les sources ou les tests qui étayent les conclusions.

Si la correction est l’enjeu, utilisez un vérificateur indépendant adapté. Si c’est la fidélité qui importe, concevez une évaluation qui intervient sur la chaîne et précisez ce qu’elle mesure et ce qu’elle ne mesure pas. Si vous avez seulement observé une explication cohérente, qualifiez-la de cohérente ou d’utile pour l’examen : ne la dites pas fidèle sans éléments de preuve spécifiques.

Cette fiche se distingue de celle consacrée au raisonnement des modèles, qui traite le concept général ; ici, l’accent porte sur le texte intermédiaire et ses limites. Pour approfondir, consultez également les entrées consacrées au prompting, à l’évaluation, au RAG, à la chaîne de pensée et au raisonnement.

10

Exemples rapides

11

Concepts associés

12

Sources consultées