Cadeia de pensamento em IA: o que é e o que não demonstra
01

Definição numa frase

Secuencia intermedia de razonamiento, visible o interna, que descompone un problema antes de producir una respuesta.

02

Definição: uma sequência de etapas intermediárias expressas em texto

A cadeia de pensamento (chain of thought, CoT) é uma sequência de etapas intermediárias expressas em linguagem que um modelo gera ou recebe como exemplo para abordar uma tarefa antes de produzir uma resposta final. No uso habitual, essas etapas apresentam parte do trabalho necessário para chegar a uma conclusão: por exemplo, separar dados, estabelecer uma relação entre eles e realizar uma operação.

O termo descreve o texto observável e a técnica de prompting associada; não garante que esse texto seja uma transcrição completa ou fiel dos cálculos internos do modelo. Uma cadeia pode ser útil como apoio para resolver uma tarefa ou como explicação legível para uma pessoa. Mas o fato de parecer organizada não demonstra que cada etapa esteja correta, que tenha causado a resposta final ou que revele o que aconteceu dentro do modelo.

Ela é usada sobretudo quando uma tarefa exige várias etapas e se deseja orientar o modelo a apresentá-las, ou quando são fornecidos exemplos de como apresentar uma solução. Essa distinção é importante para equipes que avaliam modelos: uma resposta passo a passo pode ser um objeto de inspeção, mas não substitui a verificação da resposta nem um teste de fidelidade.

03

Como é obtida: exemplos, instruções e supervisão

Há várias maneiras relacionadas, mas não equivalentes, de obter etapas intermediárias. No prompting few-shot, incluem-se no prompt um ou mais exemplos com a entrada, o raciocínio expresso em texto e a resposta. O trabalho de Wei e colaboradores estuda essa configuração e denomina cadeia de pensamento as etapas intermediárias de raciocínio incluídas nos exemplos.

Em uma configuração zero-shot, é possível pedir diretamente que o modelo aborde o problema passo a passo, sem mostrar exemplos de cadeias completas. Essa instrução não é a mesma coisa que o prompting few-shot: muda a informação fornecida no prompt, embora ambas as abordagens busquem levar o modelo a gerar etapas intermediárias.

Também é possível treinar o modelo com dados que contêm etapas, em vez de apenas solicitá-las no momento da inferência. A supervisão do processo fornece sinais sobre etapas intermediárias, enquanto a supervisão do resultado se concentra na resposta final. São decisões de treinamento e avaliação diferentes de adicionar exemplos ou instruções a um prompt. Não se deve descrevê-las como se uma única frase no prompt equivalesse a treinar o modelo com registros de raciocínio.

Em todos esses casos, o resultado pode ser uma sequência escrita que parece descrever o trabalho realizado. O método usado para produzi-la não elimina a necessidade de verificá-la: os exemplos podem orientar o formato, e a supervisão pode avaliar etapas, mas nenhum desses fatos transforma automaticamente o texto gerado em uma leitura direta do estado interno do modelo.

Três caminhos que convém distinguir

  1. 01Exemplos no prompt: mostrar um ou mais problemas resolvidos com etapas e pedir que o modelo siga um formato semelhante.
  2. 02Instrução no prompt: solicitar etapas intermediárias sem necessariamente fornecer exemplos resolvidos.
  3. 03Supervisão durante o treinamento: usar dados ou sinais que avaliam etapas intermediárias, em vez de limitar o sinal ao resultado final.
04

Três exemplos práticos e o que é possível verificar

Os exemplos a seguir são ilustrativos. Eles mostram como uma cadeia pode ser usada como registro legível e distinguem esse uso das evidências necessárias para afirmar que o resultado está correto ou que a explicação reflete fielmente o processo interno.

Em cada área, a utilidade depende da tarefa: em aritmética, é possível revisar uma operação; ao combinar documentos, é possível rastrear quais trechos sustentam cada afirmação; e, na depuração, é possível verificar o comportamento do programa. Nenhuma dessas verificações, por si só, demonstra que a cadeia seja uma transcrição fiel do cálculo interno do modelo.

05

Para que serve e o que não se deve inferir

Uma cadeia pode servir de apoio: divide uma tarefa em partes que podem ser tratadas uma de cada vez. Também pode explicitar pressupostos que, de outra forma, ficariam ocultos em uma resposta breve. Para quem revisa o resultado, essa estrutura facilita localizar uma operação, uma premissa ou uma afirmação que merece ser verificada.

No entanto, a cadeia não deve ser confundida com uma demonstração. Ela pode conter uma etapa incorreta e, ainda assim, terminar por acaso na resposta correta, ou apresentar uma conclusão plausível sustentada por uma premissa equivocada. Também pode omitir informações relevantes. A aparência de detalhamento não equivale à qualidade das evidências.

Pesquisas sobre explicações não fiéis em prompting de cadeia de pensamento mostram que, nas tarefas estudadas, as cadeias podem deixar de refletir fatores que influenciaram a resposta e podem racionalizá-la posteriormente. Isso sustenta uma cautela específica: não convém tratar automaticamente o texto como uma janela transparente para o processo que produziu a resposta. Os resultados experimentais tampouco permitem afirmar que toda cadeia seja infiel; eles delimitam um risco que deve ser avaliado, e não descartado.

Uma abordagem possível para investigar a fidelidade é intervir na cadeia ou alterá-la e observar se a resposta muda, como explora o trabalho de Lanham e colaboradores. Esses testes fornecem evidências sobre a relação entre o texto e a resposta nas condições examinadas. Não permitem observar diretamente todos os cálculos internos do modelo, e suas conclusões dependem das tarefas e dos métodos empregados.

O que a cadeia indica e que verificação é necessária

ObservaçãoO que pode sustentarO que não demonstra por si só
A resposta inclui etapas organizadas.Que o modelo produziu um texto intermediário legível.Que cada etapa esteja correta ou que a cadeia seja uma transcrição interna.
O cálculo coincide com uma operação independente.Que o resultado aritmético daquele caso está correto.Que a cadeia causou a resposta ou representa fielmente o processo interno.
As afirmações coincidem com os trechos dos documentos.Que a resposta é sustentada por esses trechos, se o escopo deles for preservado.Que o modelo interpretou internamente os documentos da maneira descrita.
O código corrigido passa em testes definidos.Que o comportamento verificado atende a esses testes.Que a explicação da depuração seja completa ou fiel.
06

Confusões frequentes e conceitos relacionados

Cadeia de pensamento não é sinônimo de raciocínio em modelos. Raciocínio é o conceito mais geral para falar de tarefas que exigem relacionar informações, inferir ou resolver problemas; CoT, neste contexto, refere-se a etapas intermediárias expressas em texto e às técnicas que as solicitam ou utilizam. Uma cadeia é uma saída observável, não uma medida completa de uma capacidade geral.

Também não é a mesma coisa que prompting em geral. O prompting abrange instruções e exemplos fornecidos ao modelo. CoT é uma estratégia de prompting quando se busca obter etapas intermediárias. Além disso, incluir uma sequência de etapas em um único prompt não equivale a encadear várias chamadas separadas a um modelo: em um fluxo encadeado, a saída de uma etapa pode se tornar a entrada de outra.

Em tarefas com geração aumentada por recuperação (RAG), a cadeia pode explicitar como uma pergunta se relaciona com trechos recuperados. A presença dessas etapas não valida, por si só, a recuperação nem a resposta: é preciso verificar se as fontes realmente fornecem as evidências e se a resposta preserva o escopo delas.

Por fim, uma sequência de texto não é a mesma coisa que um rastro executável. PAL e Program of Thoughts estudam abordagens que expressam parte do trabalho como um programa, para que um interpretador execute os cálculos. Um programa pode permitir verificar uma operação ou um resultado específico por meio da execução, mas essa verificação não demonstra a fidelidade do raciocínio textual. Por sua vez, verificadores de etapas avaliam etapas ou recebem supervisão sobre elas: tampouco devem ser confundidos automaticamente com a execução de código.

Distinções rápidas

ConceitoFocoPergunta prática
Raciocínio em modelosConceito geral de capacidade ou tarefa de inferência.Que tarefa de raciocínio está sendo avaliada?
Cadeia de pensamentoEtapas intermediárias expressas em texto.Quais etapas o modelo apresenta e quais foram verificadas?
PromptingInstruções e exemplos fornecidos ao modelo.Que informação o modelo recebeu antes de responder?
RAGGeração apoiada em informações recuperadas.Os trechos recuperados sustentam cada afirmação?
Programa executávelInstruções que um interpretador pode executar.Que comportamento ou cálculo os testes verificam?
07

Como avaliá-la com rigor

A avaliação deve separar pelo menos três perguntas: o resultado está correto? As etapas apresentadas são válidas? Há evidências de que essas etapas refletem fielmente o processo que produziu a resposta? Em geral, um único teste não responde sozinho às três perguntas.

Para avaliar o resultado, convém usar um método independente adequado ao domínio: refazer um cálculo, conferir afirmações em documentos ou executar testes no código. Para avaliar as etapas, é possível revisar explicitamente premissas, inferências, cálculos e referências às evidências. Em tarefas com várias soluções válidas, os critérios devem aceitar alternativas corretas, sem premiar explicações apenas plausíveis.

Para estudar a fidelidade, intervenções ou alterações podem fornecer informações sobre se a modificação de uma cadeia afeta a resposta e em que condições. Esses testes devem ser concebidos com controles e uma pergunta definida; observar uma mudança não basta para concluir que o processo interno completo foi recuperado. A interpretação deve se limitar ao que o teste mede.

Uma prática operacional é registrar separadamente a resposta final, a cadeia visível, as verificações externas realizadas e as incertezas. Se uma ferramenta verifica um cálculo, deve-se dizer que ela verificou aquele cálculo; não transformar isso em uma afirmação de que todo o raciocínio foi fiel. Se os documentos não sustentam uma afirmação, a lacuna deve ser apontada, mesmo que o texto passo a passo pareça convincente.

Lista de verificação para uma avaliação

  1. 01Definir o que está sendo avaliado: resultado, validade das etapas, fidelidade da explicação ou uma combinação explicitamente definida.
  2. 02Escolher um verificador independente adequado: cálculo, conferência documental, testes de código ou outro critério específico da tarefa.
  3. 03Verificar cada afirmação ou etapa relevante e registrar erros, omissões e ambiguidades.
  4. 04Se a fidelidade estiver sendo investigada, usar intervenções ou alterações com controles e limitar a conclusão ao desenho do estudo e às tarefas avaliadas.
  5. 05Relatar separadamente o resultado, as verificações realizadas e o que ainda não é possível concluir.
08

Leituras técnicas e limites das evidências

O trabalho de Wei e colaboradores é uma referência primária para a definição e o prompting few-shot com exemplos de cadeias. O trabalho sobre raciocinadores zero-shot estuda uma instrução para solicitar etapas sem que isso equivalha a fornecer exemplos resolvidos. Ambos ajudam a distinguir configurações de prompting, mas não provam, por si sós, a fidelidade de cada cadeia gerada.

PAL e Program of Thoughts exploram maneiras de separar a produção de etapas ou programas da execução de cálculos. São pertinentes para entender o que um interpretador pode verificar, sobretudo em tarefas computacionais; verificar um resultado executado não é um teste de transparência interna. O trabalho sobre verificação passo a passo estuda a supervisão de processos em comparação com a supervisão de resultados, uma distinção relevante para avaliação e treinamento.

Os estudos sobre explicações não fiéis e sobre medição da fidelidade examinam riscos e métodos experimentais específicos. Seus resultados servem para fundamentar cautela e elaborar avaliações, não para atribuir uma propriedade universal a todas as tarefas, modelos ou cadeias. As evidências apresentadas não permitem observar diretamente todo o processo interno de um modelo; por isso, afirmações sobre fidelidade devem ter escopo limitado.

09

Critérios práticos

Ao ler ou solicitar uma cadeia de pensamento, trate-a como uma explicação textual que pode ajudar a inspecionar uma resposta, não como prova automática de sua correção ou de sua origem interna. Peça etapas quando elas agregarem valor à tarefa, verifique separadamente o que puder ser verificado e preserve as fontes ou os testes que sustentam as conclusões.

Se o que importa é a correção, use um verificador independente adequado. Se o que importa é a fidelidade, elabore uma avaliação que intervenha na cadeia e declare o que ela mede e o que não mede. Se foi observada apenas uma explicação coerente, descreva-a como coerente ou útil para a inspeção: não a chame de fiel sem evidências específicas.

Esta ficha se distingue da entrada sobre raciocínio em modelos, que aborda o conceito geral, enquanto aqui o foco está no texto intermediário e em seus limites. Para saber mais, consulte também as entradas sobre prompting, avaliação, RAG, cadeia de pensamento e raciocínio.

10

Exemplos rápidos

11

Conceitos relacionados

12

Fontes consultadas