
Definizione in una frase
Secuencia intermedia de razonamiento, visible o interna, que descompone un problema antes de producir una respuesta.
Definizione: una sequenza di passaggi intermedi espressi in testo
La catena di pensiero (chain of thought, CoT) è una sequenza di passaggi intermedi espressi in linguaggio che un modello genera o riceve come esempio per affrontare un compito prima di produrre una risposta finale. Nell’uso abituale, questi passaggi presentano una parte del lavoro necessario per arrivare a una conclusione: per esempio, separare i dati, stabilire una relazione tra loro ed eseguire un’operazione.
Il termine descrive il testo osservabile e la tecnica di prompting associata; non garantisce che quel testo sia una trascrizione completa o fedele dei calcoli interni del modello. Una catena può essere utile come impalcatura per svolgere un compito o come spiegazione leggibile per una persona. Ma il fatto che sembri ordinata non dimostra che ogni passaggio sia corretto, che abbia causato la risposta finale o che riveli ciò che è avvenuto all’interno del modello.
Si usa soprattutto quando un compito richiede più passaggi e si vuole orientare il modello a esplicitarli, oppure quando gli vengono forniti esempi di come presentare una soluzione. La distinzione è importante per i team che valutano i modelli: una risposta passo dopo passo può essere un oggetto da esaminare, ma non sostituisce la verifica della risposta né una prova di fedeltà.
Come si ottiene: esempi, istruzioni e supervisione
Esistono diversi modi, correlati ma non equivalenti, per ottenere passaggi intermedi. Nel prompting few-shot, nel prompt si includono uno o più esempi composti da input, ragionamento espresso in testo e risposta. Il lavoro di Wei e collaboratori studia questa configurazione e definisce catena di pensiero i passaggi intermedi di ragionamento inclusi negli esempi.
In una configurazione zero-shot si può chiedere direttamente al modello di affrontare il problema passo dopo passo, senza mostrargli esempi di catene complete. Questa istruzione non equivale al prompting few-shot: cambia il tipo di informazione fornita nel prompt, anche se entrambi gli approcci mirano a far generare passaggi intermedi al modello.
È anche possibile addestrare un modello con dati che contengono passaggi, anziché limitarsi a richiederli al momento dell’inferenza. La supervisione del processo fornisce segnali sui passaggi intermedi, mentre la supervisione del risultato si concentra sulla risposta finale. Si tratta di scelte di addestramento e valutazione diverse dall’aggiunta di esempi o istruzioni a un prompt. Non vanno descritte come se una singola frase nel prompt equivalesse ad addestrare il modello con tracce di ragionamento.
In tutti questi casi, il risultato può essere una sequenza scritta che sembra descrivere il lavoro svolto. Il metodo usato per produrla non elimina la necessità di verificarla: gli esempi possono orientare il formato e la supervisione può valutare i passaggi, ma nessuno di questi elementi trasforma automaticamente il testo generato in una lettura diretta dello stato interno del modello.
Tre modalità da distinguere
- 01Esempi nel prompt: mostrare uno o più problemi risolti con i relativi passaggi e chiedere al modello di seguire un formato simile.
- 02Istruzione nel prompt: richiedere passaggi intermedi senza necessariamente fornire esempi già svolti.
- 03Supervisione durante l’addestramento: usare dati o segnali che valutano i passaggi intermedi, invece di limitare il segnale al risultato finale.
Tre esempi applicati e che cosa permettono di verificare
Gli esempi seguenti sono illustrativi. Mostrano come una catena possa essere usata come resoconto leggibile e distinguono questo uso dalle prove necessarie per affermare che il risultato è corretto o che la spiegazione rifletta fedelmente il processo interno.
In ogni ambito, l’utilità dipende dal compito: in aritmetica si può controllare un’operazione; nell’unire informazioni provenienti da documenti si può risalire ai frammenti che sostengono ogni affermazione; nel debugging si può verificare il comportamento del programma. Nessuno di questi controlli dimostra, da solo, che la catena sia una trascrizione fedele dei calcoli interni del modello.
A che cosa serve e che cosa non si dovrebbe dedurre
Una catena può fare da impalcatura: suddivide un compito in parti che possono essere affrontate una alla volta. Può anche rendere esplicite ipotesi che altrimenti resterebbero nascoste in una risposta breve. Per chi esamina il risultato, questa struttura facilita l’individuazione di un’operazione, una premessa o un’affermazione che merita di essere verificata.
La catena, tuttavia, non va confusa con una dimostrazione. Può contenere un passaggio errato e arrivare comunque per caso alla risposta corretta, oppure presentare una conclusione plausibile fondata su una premessa sbagliata. Può anche omettere informazioni rilevanti. L’apparenza di dettaglio non equivale alla qualità delle prove.
La ricerca sulle spiegazioni non fedeli nel prompting con catena di pensiero mostra che, nei compiti esaminati, le catene possono non riflettere i fattori che hanno influenzato la risposta e possono razionalizzarla a posteriori. Questo giustifica una cautela precisa: non conviene trattare automaticamente il testo come una finestra trasparente sul processo che ha prodotto la risposta. I risultati sperimentali non permettono neppure di affermare che ogni catena sia infedele: circoscrivono un rischio da valutare, non da ignorare.
Per studiare la fedeltà, un possibile approccio consiste nell’intervenire sulla catena o perturbarla e osservare se la risposta cambia, come esamina il lavoro di Lanham e collaboratori. Questi test forniscono prove sul rapporto tra testo e risposta nelle condizioni analizzate. Non consentono di osservare direttamente tutti i calcoli interni del modello e le loro conclusioni dipendono dai compiti e dai metodi impiegati.
Che cosa afferma la catena e quali verifiche servono
| Osservazione | Che cosa può indicare | Che cosa non dimostra da sola |
|---|---|---|
| La risposta include passaggi ordinati. | Il modello ha prodotto un testo intermedio leggibile. | Che ogni passaggio sia corretto o che la catena sia una trascrizione interna. |
| Il calcolo coincide con un’operazione indipendente. | Che il risultato aritmetico di quel caso è corretto. | Che la catena abbia causato la risposta o rappresenti fedelmente il processo interno. |
| Le affermazioni coincidono con i frammenti dei documenti. | Che la risposta è sostenuta da quei frammenti, se ne rispetta l’ambito. | Che il modello abbia interpretato internamente i documenti nel modo descritto. |
| Il codice corretto supera test definiti. | Che il comportamento verificato soddisfa quei test. | Che la spiegazione del debugging sia completa o fedele. |
Confusioni frequenti e concetti correlati
Catena di pensiero non è sinonimo di ragionamento nei modelli. Il ragionamento è il concetto più generale per parlare di compiti che richiedono di mettere in relazione informazioni, inferire o risolvere problemi; CoT si riferisce, in questo contesto, a passaggi intermedi espressi in testo e alle tecniche che li richiedono o li utilizzano. Una catena è un output osservabile, non una misura completa di una capacità generale.
Non è neppure la stessa cosa del prompting in generale. Il prompting comprende istruzioni ed esempi forniti al modello. CoT è una strategia di prompting quando si cerca di ottenere passaggi intermedi. Inoltre, includere una sequenza di passaggi in un unico prompt non equivale a concatenare diverse chiamate separate a un modello: in un flusso concatenato, l’output di una fase può diventare l’input della successiva.
Nei compiti con generazione aumentata dal recupero (RAG), la catena può esplicitare il modo in cui una domanda si collega ai frammenti recuperati. La presenza di questi passaggi non convalida da sola né il recupero né la risposta: occorre controllare se le fonti forniscono davvero le prove e se la risposta ne rispetta l’ambito.
Infine, una sequenza di testo non equivale a una traccia eseguibile. PAL e Program of Thoughts studiano approcci in cui una parte del lavoro viene espressa come programma, affinché un interprete esegua il calcolo. Un programma può consentire di verificare un’operazione o un risultato specifico tramite esecuzione, ma tale verifica non dimostra la fedeltà del ragionamento testuale. I verificatori dei passaggi, invece, valutano i singoli passaggi o ricevono supervisione su di essi: non vanno confusi automaticamente con l’esecuzione di codice.
Distinzioni rapide
| Concetto | Focus | Domanda pratica |
|---|---|---|
| Ragionamento nei modelli | Concetto generale di capacità o compito inferenziale. | Quale compito di ragionamento si sta valutando? |
| Catena di pensiero | Passaggi intermedi espressi in testo. | Quali passaggi mostra il modello e quali sono stati verificati? |
| Prompting | Istruzioni ed esempi forniti al modello. | Quali informazioni ha ricevuto il modello prima di rispondere? |
| RAG | Generazione basata su informazioni recuperate. | I frammenti recuperati sostengono ogni affermazione? |
| Programma eseguibile | Istruzioni che un interprete può eseguire. | Quale comportamento o calcolo verificano i test? |
Come valutarla con rigore
La valutazione dovrebbe separare almeno tre domande: il risultato è corretto? I passaggi mostrati sono validi? Esistono prove che quei passaggi riflettano fedelmente il processo che ha prodotto la risposta? Raramente un singolo test risponde da solo a tutte e tre.
Per il risultato, conviene usare un metodo indipendente adatto al dominio: ricalcolare un’operazione, confrontare le affermazioni con i documenti oppure eseguire test sul codice. Per i passaggi, si possono esaminare esplicitamente premesse, inferenze, calcoli e riferimenti alle prove. Nei compiti con più soluzioni valide, i criteri dovrebbero ammettere alternative corrette senza premiare spiegazioni soltanto plausibili.
Per studiare la fedeltà, gli interventi o le perturbazioni possono fornire informazioni sul fatto che modificare una catena influisca sulla risposta e sulle condizioni in cui ciò avviene. Vanno progettati con controlli e una domanda ben definita; osservare un cambiamento non basta per concludere che si sia ricostruito l’intero processo interno. L’interpretazione deve limitarsi a ciò che il test misura.
Una pratica operativa consiste nel registrare separatamente la risposta finale, la catena visibile, le verifiche esterne effettuate e le incertezze. Se uno strumento verifica un calcolo, bisogna dire che ha verificato quel calcolo, senza trasformare il risultato in un’affermazione di fedeltà dell’intero ragionamento. Se i documenti non sostengono un’affermazione, la lacuna va segnalata anche quando il testo passo dopo passo sembra convincente.
Lista di controllo per la valutazione
- 01Definire che cosa si sta valutando: il risultato, la validità dei passaggi, la fedeltà della spiegazione o una combinazione esplicita di questi elementi.
- 02Scegliere un verificatore indipendente adatto: calcolo, confronto con i documenti, test del codice o un altro criterio specifico del compito.
- 03Controllare ogni affermazione o passaggio rilevante e registrare errori, omissioni e ambiguità.
- 04Se si studia la fedeltà, usare interventi o perturbazioni con controlli e limitare le conclusioni al disegno sperimentale e ai compiti valutati.
- 05Riferire separatamente il risultato, le verifiche effettuate e ciò che non si può ancora concludere.
Letture tecniche e limiti delle prove
Il lavoro di Wei e collaboratori è un riferimento primario per la definizione e il prompting few-shot con esempi di catene. Il lavoro sui ragionatori zero-shot studia un’istruzione per richiedere passaggi senza che ciò equivalga a fornire esempi risolti. Entrambi aiutano a distinguere le configurazioni di prompting, ma non dimostrano di per sé la fedeltà di ogni catena generata.
PAL e Program of Thoughts esplorano modi per separare la produzione di passaggi o programmi dall’esecuzione dei calcoli. Sono pertinenti per capire che cosa possa verificare un interprete, soprattutto nei compiti computazionali; verificare un risultato eseguito non è una prova di trasparenza interna. Il lavoro sulla verifica passo dopo passo studia la supervisione del processo rispetto a quella dei risultati, una distinzione importante per la valutazione e l’addestramento.
Gli studi sulle spiegazioni non fedeli e sulla misurazione della fedeltà esaminano rischi specifici e metodi sperimentali concreti. I loro risultati permettono di motivare la cautela e progettare valutazioni, ma non di attribuire una proprietà universale a tutti i compiti, modelli o catene. Le prove disponibili non consentono di osservare direttamente l’intero processo interno di un modello; perciò, le affermazioni sulla fedeltà devono essere formulate entro limiti precisi.
Criteri pratici
Quando leggi o richiedi una catena di pensiero, trattala come una spiegazione testuale che può aiutare a esaminare una risposta, non come prova automatica della sua correttezza o della sua origine interna. Chiedi i passaggi quando apportano valore al compito, verifica separatamente ciò che è verificabile e conserva le fonti o i test che sostengono le conclusioni.
Se ciò che conta è la correttezza, usa un verificatore indipendente adeguato. Se ciò che conta è la fedeltà, progetta una valutazione che intervenga sulla catena e dichiara che cosa misura e che cosa no. Se hai osservato soltanto una spiegazione coerente, descrivila come coerente o utile per l’esame: non definirla fedele senza prove specifiche.
Questa scheda si distingue da quella sul ragionamento nei modelli, che affronta il concetto generale; qui l’attenzione è rivolta al testo intermedio e ai suoi limiti. Per approfondire, consulta anche le voci su prompting, valutazione, RAG, catena di pensiero e ragionamento.