
Definition in einem Satz
Secuencia intermedia de razonamiento, visible o interna, que descompone un problema antes de producir una respuesta.
Definition: eine Folge textlich formulierter Zwischenschritte
Chain of Thought (CoT), auf Deutsch etwa „Gedankenkette“, bezeichnet eine Folge von Zwischenschritten in natürlicher Sprache, die ein Modell erzeugt oder als Beispiel erhält, bevor es eine endgültige Antwort ausgibt. Im üblichen Einsatz stellen diese Schritte einen Teil der Arbeit dar, die zu einer Schlussfolgerung führt: Beispielsweise können sie Angaben voneinander trennen, Beziehungen zwischen ihnen herstellen und eine Rechenoperation ausführen.
Der Begriff beschreibt den beobachtbaren Text und die damit verbundene Prompting-Technik. Er garantiert nicht, dass dieser Text eine vollständige oder getreue Abschrift der internen Berechnungen des Modells ist. Eine Gedankenkette kann als Gerüst zur Bearbeitung einer Aufgabe oder als verständliche Erläuterung für Menschen nützlich sein. Dass sie geordnet wirkt, beweist aber weder, dass jeder Schritt korrekt ist, noch dass die Schritte die endgültige Antwort verursacht haben oder zeigen, was im Modell vor sich ging.
CoT wird vor allem dann eingesetzt, wenn eine Aufgabe mehrere Schritte erfordert und das Modell diese darlegen soll oder wenn Beispiele für die Darstellung einer Lösung bereitgestellt werden. Für Teams, die Modelle bewerten, ist die Unterscheidung wichtig: Eine Schritt-für-Schritt-Antwort kann untersucht werden, ersetzt aber weder die Überprüfung der Antwort noch einen Nachweis ihrer Erklärungstreue.
Wie eine Gedankenkette entsteht: Beispiele, Anweisungen und Supervision
Es gibt mehrere miteinander verwandte, aber nicht gleichbedeutende Wege, Zwischenschritte zu erhalten. Beim Few-Shot-Prompting enthält der Prompt ein oder mehrere Beispiele aus Eingabe, textlich formuliertem Gedankengang und Antwort. Die Arbeit von Wei und seinen Mitautorinnen und Mitautoren untersucht diese Konfiguration und bezeichnet die in den Beispielen enthaltenen Zwischenschritte als Chain of Thought.
In einer Zero-Shot-Konfiguration kann das Modell direkt aufgefordert werden, das Problem Schritt für Schritt zu bearbeiten, ohne dass ihm vollständige Gedankengänge als Beispiele gezeigt werden. Diese Anweisung ist nicht dasselbe wie Few-Shot-Prompting: Die bereitgestellten Informationen im Prompt unterscheiden sich, auch wenn beide Ansätze darauf abzielen, Zwischenschritte hervorzubringen.
Ein weiterer Ansatz besteht darin, mit Daten zu trainieren, die solche Schritte enthalten, statt sie lediglich zum Zeitpunkt der Inferenz anzufordern. Prozess-Supervision liefert Signale zu Zwischenschritten, während Ergebnis-Supervision auf die endgültige Antwort zielt. Das sind andere Trainings- und Bewertungsentscheidungen als das Hinzufügen von Beispielen oder Anweisungen zu einem Prompt. Man sollte sie nicht so darstellen, als wäre ein einzelner Satz im Prompt gleichbedeutend mit einem Training anhand von Reasoning-Traces.
In all diesen Fällen kann das Ergebnis eine schriftliche Abfolge sein, die die ausgeführte Arbeit zu beschreiben scheint. Die Art, wie sie erzeugt wurde, macht eine Überprüfung nicht überflüssig: Beispiele können das Format vorgeben und Supervision kann Schritte bewerten. Beides verwandelt den generierten Text jedoch nicht automatisch in einen direkten Einblick in den internen Zustand des Modells.
Drei Ansätze, die auseinanderzuhalten sind
- 01Beispiele im Prompt: Ein oder mehrere gelöste Probleme samt Zwischenschritten zeigen und das Modell um eine ähnliche Darstellung bitten.
- 02Anweisung im Prompt: Zwischenschritte anfordern, ohne notwendigerweise gelöste Beispiele bereitzustellen.
- 03Supervision während des Trainings: Daten oder Signale verwenden, die Zwischenschritte bewerten, statt das Lernsignal auf das Endergebnis zu beschränken.
Drei Anwendungsbeispiele – und was sich daran überprüfen lässt
Die folgenden Beispiele dienen der Veranschaulichung. Sie zeigen, wie eine Gedankenkette als lesbares Protokoll verwendet werden kann, und unterscheiden diese Verwendung von den Nachweisen, die nötig sind, um ein Ergebnis als korrekt oder eine Erklärung als getreue Wiedergabe des internen Prozesses zu bezeichnen.
Der Nutzen hängt jeweils von der Aufgabe ab: Bei einer Rechenaufgabe lässt sich eine Operation nachprüfen, beim Kombinieren von Dokumenten kann man nachvollziehen, welche Textstellen eine Aussage stützen, und beim Debugging lässt sich das Programmverhalten testen. Keine dieser Prüfungen belegt für sich genommen, dass die Gedankenkette eine getreue Abschrift der internen Berechnung des Modells ist.
Wozu sie nützlich ist – und was sich daraus nicht ableiten lässt
Eine Gedankenkette kann als Gerüst dienen: Sie teilt eine Aufgabe in kleinere Teile auf, die nacheinander bearbeitet werden können. Außerdem kann sie Annahmen sichtbar machen, die in einer knappen Antwort sonst unausgesprochen blieben. Für Menschen, die ein Ergebnis prüfen, erleichtert diese Struktur, eine Rechenoperation, eine Prämisse oder eine Behauptung zu finden, die genauer kontrolliert werden sollte.
Die Gedankenkette darf jedoch nicht mit einem Beweis verwechselt werden. Sie kann einen falschen Schritt enthalten und trotzdem zufällig beim richtigen Ergebnis landen. Umgekehrt kann sie eine plausible Schlussfolgerung präsentieren, die auf einer falschen Prämisse beruht. Auch relevante Informationen können fehlen. Ein detailliert wirkender Text ist nicht automatisch ein hochwertiger Beleg.
Untersuchungen zu ungetreuen Erklärungen beim CoT-Prompting zeigen, dass Gedankengänge in bestimmten untersuchten Aufgaben Faktoren, die die Antwort beeinflusst haben, nicht wiedergeben und die Antwort nachträglich rationalisieren können. Daraus folgt eine konkrete Vorsichtsmaßnahme: Der Text sollte nicht automatisch als transparentes Fenster in den Prozess behandelt werden, der die Antwort hervorgebracht hat. Die experimentellen Ergebnisse belegen allerdings auch nicht, dass jede Gedankenkette ungetreu ist. Sie grenzen ein Risiko ein, das bewertet und nicht einfach ausgeschlossen werden sollte.
Um Erklärungstreue zu untersuchen, kann man die Gedankenkette verändern oder stören und beobachten, ob sich die Antwort ändert – ein Ansatz, den die Arbeit von Lanham und seinen Mitautorinnen und Mitautoren untersucht. Solche Tests liefern Hinweise auf die Beziehung zwischen Text und Antwort unter den geprüften Bedingungen. Sie erlauben keinen direkten Einblick in alle internen Berechnungen des Modells. Außerdem hängen die Schlussfolgerungen von den verwendeten Aufgaben und Methoden ab.
Was eine Gedankenkette nahelegt – und was zusätzlich geprüft werden muss
| Beobachtung | Was sie stützen kann | Was sie für sich genommen nicht belegt |
|---|---|---|
| Die Antwort enthält geordnete Schritte. | Das Modell hat einen lesbaren Zwischentext erzeugt. | Dass jeder Schritt korrekt ist oder die Kette eine interne Abschrift darstellt. |
| Die Rechnung stimmt mit einer unabhängigen Berechnung überein. | Dass das arithmetische Ergebnis in diesem Fall korrekt ist. | Dass die Gedankenkette die Antwort verursacht oder den internen Prozess getreu wiedergibt. |
| Die Aussagen stimmen mit den Dokumentstellen überein. | Dass die Antwort von diesen Textstellen gestützt wird, sofern ihr Geltungsbereich gewahrt bleibt. | Dass das Modell die Dokumente intern genau so interpretiert hat, wie es der Text beschreibt. |
| Der korrigierte Code besteht festgelegte Tests. | Dass das geprüfte Verhalten diese Tests erfüllt. | Dass die Debugging-Erklärung vollständig oder getreu ist. |
Häufige Verwechslungen und verwandte Begriffe
Chain of Thought ist kein Synonym für Reasoning in Modellen. Reasoning ist der allgemeinere Begriff für Aufgaben, bei denen Informationen verknüpft, Schlussfolgerungen gezogen oder Probleme gelöst werden. CoT bezeichnet hier textlich formulierte Zwischenschritte und Techniken, die diese Schritte anfordern oder verwenden. Eine Gedankenkette ist eine beobachtbare Ausgabe, keine vollständige Messung einer allgemeinen Fähigkeit.
CoT ist auch nicht mit Prompting im Allgemeinen gleichzusetzen. Prompting umfasst Anweisungen und Beispiele, die einem Modell gegeben werden. CoT ist eine Prompting-Strategie, wenn damit Zwischenschritte angeregt werden sollen. Eine Schrittfolge in einem einzelnen Prompt einzufügen ist außerdem nicht dasselbe wie mehrere getrennte Aufrufe eines Modells zu verketten: In einem verketteten Ablauf kann die Ausgabe einer Stufe zur Eingabe der nächsten werden.
Bei Aufgaben mit Retrieval-Augmented Generation (RAG) kann eine Gedankenkette erläutern, wie eine Frage mit abgerufenen Textstellen zusammenhängt. Das Vorhandensein solcher Schritte bestätigt jedoch weder die Qualität des Abrufs noch die Richtigkeit der Antwort. Es muss geprüft werden, ob die Quellen die Aussagen tatsächlich stützen und ob die Antwort ihren Geltungsbereich wahrt.
Schließlich ist eine Textfolge nicht dasselbe wie ein ausführbarer Trace. PAL und Program of Thoughts untersuchen Ansätze, bei denen ein Teil der Arbeit als Programm formuliert wird, damit ein Interpreter die Berechnung ausführt. Ein Programm kann es ermöglichen, eine konkrete Operation oder ein konkretes Ergebnis durch Ausführung zu überprüfen. Diese Prüfung belegt jedoch nicht die Treue des textlich formulierten Reasonings. Schrittprüfer wiederum bewerten einzelne Schritte oder werden mit entsprechenden Signalen trainiert; auch sie sind nicht ohne Weiteres mit der Ausführung von Code gleichzusetzen.
Schnelle Abgrenzung
| Begriff | Schwerpunkt | Praktische Frage |
|---|---|---|
| Reasoning in Modellen | Allgemeiner Begriff für eine Fähigkeit oder Inferenzaufgabe. | Welche Reasoning-Aufgabe wird bewertet? |
| Chain of Thought | Textlich formulierte Zwischenschritte. | Welche Schritte zeigt das Modell, und welche davon wurden geprüft? |
| Prompting | Dem Modell gegebene Anweisungen und Beispiele. | Welche Informationen erhielt das Modell vor seiner Antwort? |
| RAG | Generierung auf Grundlage abgerufener Informationen. | Stützen die abgerufenen Textstellen jede einzelne Aussage? |
| Ausführbares Programm | Anweisungen, die ein Interpreter ausführen kann. | Welches Verhalten oder welche Berechnung überprüfen die Tests? |
Wie sich eine Gedankenkette fundiert bewerten lässt
Bei der Bewertung sollten mindestens drei Fragen getrennt werden: Ist das Ergebnis korrekt? Sind die dargestellten Schritte gültig? Gibt es Hinweise darauf, dass diese Schritte den Prozess, der zur Antwort geführt hat, getreu wiedergeben? Ein einzelner Test beantwortet nur selten alle drei Fragen.
Für das Ergebnis sollte ein unabhängiges, zum jeweiligen Fachgebiet passendes Verfahren verwendet werden: eine Rechnung erneut durchführen, Aussagen mit Dokumenten abgleichen oder Code-Tests ausführen. Für die Schritte lassen sich Prämissen, Schlussfolgerungen, Berechnungen und Belegstellen ausdrücklich prüfen. Bei Aufgaben mit mehreren gültigen Lösungen müssen die Kriterien alternative korrekte Lösungen zulassen, statt lediglich plausibel klingende Erklärungen zu belohnen.
Interventionen oder Veränderungen der Gedankenkette können bei der Untersuchung ihrer Treue Hinweise darauf liefern, ob und unter welchen Bedingungen eine Änderung des Textes die Antwort beeinflusst. Solche Tests sollten kontrolliert werden und einer klar formulierten Frage dienen. Eine beobachtete Änderung reicht nicht aus, um daraus zu schließen, dass der vollständige interne Prozess offengelegt wurde. Die Interpretation muss auf das beschränkt bleiben, was der Test tatsächlich misst.
In der Praxis ist es hilfreich, die endgültige Antwort, die sichtbare Gedankenkette, die durchgeführten externen Prüfungen und die verbleibenden Unsicherheiten getrennt zu dokumentieren. Wenn ein Werkzeug eine Rechnung überprüft, sollte man festhalten, dass diese Rechnung geprüft wurde. Daraus darf nicht die Behauptung werden, das gesamte Reasoning sei getreu. Wenn Dokumente eine Aussage nicht stützen, sollte diese Lücke benannt werden – selbst wenn der Schritt-für-Schritt-Text überzeugend klingt.
Checkliste für die Bewertung
- 01Festlegen, was bewertet wird: das Ergebnis, die Gültigkeit der Schritte, die Erklärungstreue oder eine ausdrücklich definierte Kombination davon.
- 02Einen geeigneten unabhängigen Prüfer auswählen: Berechnung, Abgleich mit Dokumenten, Code-Tests oder ein anderes aufgabenspezifisches Kriterium.
- 03Jede relevante Behauptung und jeden relevanten Schritt prüfen und Fehler, Auslassungen sowie Mehrdeutigkeiten dokumentieren.
- 04Bei einer Untersuchung der Erklärungstreue Interventionen oder Veränderungen mit Kontrollen einsetzen und die Schlussfolgerung auf die untersuchten Aufgaben und das Testdesign begrenzen.
- 05Ergebnis, durchgeführte Prüfungen und offene Fragen getrennt berichten.
Technische Lektüre und Grenzen der Evidenz
Die Arbeit von Wei und seinen Mitautorinnen und Mitautoren ist eine Primärquelle für die Definition und das Few-Shot-Prompting mit Beispielen von Gedankengängen. Die Arbeit zu Zero-Shot-Reasonern untersucht eine Anweisung, mit der Schritte angefordert werden, ohne gelöste Beispiele bereitzustellen. Beide helfen, Prompting-Konfigurationen voneinander abzugrenzen; sie beweisen für sich genommen nicht, dass jede erzeugte Gedankenkette getreu ist.
PAL und Program of Thoughts untersuchen Möglichkeiten, die Erzeugung von Schritten oder Programmen von der Ausführung von Berechnungen zu trennen. Sie sind hilfreich, um zu verstehen, was ein Interpreter überprüfen kann, besonders bei rechnerischen Aufgaben. Ein ausgeführtes Ergebnis zu prüfen ist jedoch kein Nachweis für Transparenz über interne Vorgänge. Die Arbeit zur schrittweisen Verifikation untersucht Prozess-Supervision im Vergleich zu Ergebnis-Supervision – eine Unterscheidung, die für Bewertung und Training relevant ist.
Studien zu ungetreuen Erklärungen und zur Messung von Erklärungstreue untersuchen konkrete Risiken und experimentelle Methoden. Ihre Ergebnisse können Vorsicht begründen und bei der Entwicklung von Tests helfen. Sie rechtfertigen jedoch keine universelle Aussage über sämtliche Aufgaben, Modelle oder Gedankengänge. Die vorhandene Evidenz ermöglicht keinen direkten Einblick in den vollständigen internen Prozess eines Modells. Aussagen zur Erklärungstreue sollten deshalb klar begrenzt formuliert werden.
Praktische Leitlinien
Wer eine Chain of Thought liest oder anfordert, sollte sie als textliche Erklärung behandeln, die bei der Prüfung einer Antwort helfen kann – nicht als automatischen Beleg für deren Richtigkeit oder interne Entstehung. Fordern Sie Schritte an, wenn sie für die Aufgabe einen Mehrwert bieten, überprüfen Sie separat, was sich überprüfen lässt, und bewahren Sie die Quellen oder Tests auf, die Schlussfolgerungen stützen.
Wenn die Korrektheit entscheidend ist, sollte ein geeigneter unabhängiger Prüfer eingesetzt werden. Wenn die Erklärungstreue im Mittelpunkt steht, braucht es eine Bewertung, die gezielt in die Gedankenkette eingreift und klar angibt, was sie misst – und was nicht. Wurde lediglich eine schlüssige Erklärung beobachtet, sollte man sie als schlüssig oder für die Prüfung hilfreich beschreiben. Ohne spezifische Evidenz sollte man sie nicht als getreu bezeichnen.
Dieser Glossareintrag unterscheidet sich vom Eintrag zu Reasoning in Modellen, der den allgemeineren Begriff behandelt. Hier stehen der Zwischentext und seine Grenzen im Mittelpunkt. Ergänzend passen die Glossareinträge zu Prompting, KI-Evaluation, RAG, Chain of Thought und Reasoning.