
Definition in einem Satz
Contenido generado que parece plausible, pero no está respaldado por los datos, el contexto o las fuentes disponibles.
Definition: eine nicht belegte Ausgabe
In der künstlichen Intelligenz bezeichnet eine Halluzination eine Ausgabe, die Informationen als falsch, erfunden oder durch die für die Aufgabe verfügbaren Belege nicht gestützt darstellt. Die Definition ist operativ: Sie beschreibt das Verhältnis zwischen der Ausgabe des Systems, der gestellten Aufgabe und den Quellen oder Daten, die es verwenden sollte. Sie bedeutet nicht, dass das System ein bewusstes Erleben hat, etwas Nichtexistierendes wahrnimmt oder sich dazu entschließt, die fragende Person zu täuschen.
In der Forschung wird der Ausdruck unterschiedlich verwendet. Manche Arbeiten konzentrieren sich auf mangelnde Übereinstimmung mit einer Quelle oder einem bereitgestellten Kontext, andere auf falsche oder nicht überprüfbare Aussagen. Deshalb sollte stets angegeben werden, welches Kriterium gemeint ist. Eine Antwort kann einem Dokument widersprechen, in den verfügbaren Quellen keine Stütze finden oder faktisch falsch sein. Das sind verwandte, aber nicht identische Probleme.
Die Unterscheidung zwischen „falsch“ und „nicht belegt“ ist wichtig. Behauptet eine Antwort, ein Vertrag enthalte eine Klausel, die im Dokument nicht vorkommt, ist diese Zuschreibung unbelegt und lässt sich am Text überprüfen. Wird dagegen eine Aussage ohne Quellenangabe gemacht, lässt sich anhand des Kontexts allein womöglich nicht entscheiden, ob sie falsch ist: Sie kann wahr, falsch oder unbestimmt sein. Unzureichende Belege beweisen nicht automatisch das Gegenteil.
In diesem Artikel bezeichnet „Halluzination“ eine Aussage, die als verlässlich dargestellt wird, obwohl sie nach dem maßgeblichen Kriterium und den relevanten Belegen nicht trägt. Das Kriterium kann die Übereinstimmung mit einem Text, die Gültigkeit einer Berechnung, die Existenz einer Funktion in einer Bibliothek oder die Übereinstimmung mit maßgeblichen Quellen sein. Bei der Bewertung sollte klar benannt werden, was geprüft wurde, statt eine ganze Antwort pauschal als wahr oder falsch einzustufen.
Wie unbelegte Ausgaben entstehen können – und welcher Teil des Systems versagen kann
Ein generatives System erstellt eine Antwort auf Grundlage der Eingabe, des Kontexts und erlernter Muster. Die Ausgabe kann schlüssig wirken und dennoch Einzelheiten enthalten, die sich aus diesen Elementen nicht ableiten lassen. Eine mehrdeutige Frage, unzureichende Informationen oder eine Anweisung, die etwas Falsches voraussetzt, können eine fundierte Antwort erschweren. Diese Faktoren erklären nicht alle Fälle für sich genommen; allein aus dem endgültigen Text lässt sich keine bestimmte Ursache ableiten.
In einem System mit Informationsabruf, also RAG, werden Dokumente oder Textabschnitte gesucht und in den Kontext des Modells übernommen. An mehreren Stellen dieser Kette kann ein Fehler auftreten: Die Suche findet die relevante Quelle möglicherweise nicht, ruft ungeeignetes Material ab oder liefert verzerrte Ausschnitte. Anschließend kann das Modell das abgerufene Material falsch verstehen, Aussagen ergänzen, die darin nicht vorkommen, oder eine Idee der falschen Quelle zuschreiben. Ein fehlerhaftes Ergebnis beweist daher nicht, dass ausschließlich das generierende Modell die Ursache war.
Auch externe Werkzeuge können zum Einsatz kommen: ein Taschenrechner, eine Suche, eine Datenbank oder ein ausgeführtes Programm. Das Ergebnis kann falsch sein, weil das Werkzeug ungeeignete Daten geliefert hat, falsch verwendet wurde, das System seine Ausgabe falsch gelesen hat oder die abschließende Antwort etwas beschreibt, das das Werkzeug nicht bestätigt hat. Wenn der gesamte Ablauf nachvollziehbar ist, muss für die Bewertung auch die vollständige Verarbeitungskette betrachtet werden.
Bei multimodalen Aufgaben kommen Bild-, Audio- oder andere Eingaben hinzu. Eine Beschreibung kann einem Bild ein Detail zuschreiben, das nicht erkennbar ist, ein Wort falsch transkribieren oder eine Interpretation wie eine direkt beobachtete Tatsache darstellen. Die Bewertung sollte sich auf die jeweilige Eingabe stützen und zwischen dem unterscheiden, was tatsächlich darin enthalten ist, und dem, was das System daraus folgert.
Mögliche Fehlerquelle eingrenzen
- 01Die strittige Aussage bestimmen und klären, was die Aufgabe verlangte.
- 02Den ursprünglichen Kontext und gegebenenfalls die abgerufenen Quellen prüfen.
- 03Ausgaben von Werkzeugen und die Interpretation multimodaler Eingaben kontrollieren.
- 04Fehler bei Suche und Interpretation von unbelegten Ergänzungen unterscheiden.
- 05Festhalten, was sich prüfen ließ und was unbestimmt bleibt.
Unterscheidungen, die ungenaue Diagnosen vermeiden
Eine faktisch falsche Aussage widerspricht überprüfbaren Tatsachen. Eine unbelegte Aussage ist eine Aussage, für die sich im relevanten Material keine ausreichenden Belege feststellen ließen. Sie kann falsch sein, aber auch wahr und lediglich im untersuchten Kontext nicht nachgewiesen. Um einen Widerspruch festzustellen, braucht man eine geeignete Referenz. Um fehlende Belege festzustellen, genügt es, zu zeigen, dass die Quelle oder das Dokument, auf das sich die Aussage stützen sollte, sie nicht enthält – sofern dies das Kriterium der Aufgabe ist.
Ein ungültiger Schluss zieht eine Schlussfolgerung, die nicht aus den Prämissen folgt, selbst wenn jede Prämisse stimmt. Bei einem Zuschreibungsfehler wird eine Formulierung, Schlussfolgerung oder Angabe einer Quelle zugeordnet, die sie nicht stützt. Ein erfundenes Zitat ist ein besonders gut überprüfbarer Fall: Man kann nach der Passage suchen, ihren Fundort prüfen und feststellen, ob sie tatsächlich das besagt, was ihr zugeschrieben wird. Ein überzeugend wirkendes Zitierformat beweist weder, dass das Zitat echt noch dass es relevant ist.
Verzerrung oder Bias beschreibt systematische Muster, die zu ungleichen Ergebnissen führen oder bestimmte Darstellungen begünstigen können. Der Begriff ist kein Synonym für Halluzination: Eine Antwort kann verzerrt sein, ohne eine konkrete Tatsache zu erfinden; eine erfundene Aussage muss für sich genommen noch kein Verzerrungsmuster zeigen. Zufälligkeit wiederum bezeichnet Schwankungen zwischen Ausgaben. Dass zwei Antworten voneinander abweichen, reicht nicht aus, um eine davon als Halluzination einzustufen. Dafür müssen ihr Inhalt und die Belege geprüft werden.
Desinformation bezeichnet häufig die Verbreitung falscher oder irreführender Informationen und schließt in manchen Verwendungen eine Täuschungsabsicht ein. Eine Modellausgabe als „Halluzination“ zu bezeichnen, belegt keine Absicht. Der Begriff beschreibt das beobachtete Ergebnis, nicht einen menschlichen Zweck des Systems. Ebenso beweist ein Widerspruch zwischen Quellen nicht automatisch, dass eine Antwort erfunden ist: Er kann auf unterschiedlichen Definitionen, verschiedenen Zeitpunkten oder einer tatsächlichen Kontroverse beruhen.
Ein Abruffehler ist ebenfalls nicht dasselbe wie eine Halluzination bei der Generierung. Findet das System irrelevante Dokumente und antwortet es diesen Dokumenten getreu, kann das Problem beim Abruf oder Korpus liegen, obwohl die Antwort für die Frage ungeeignet ist. Ergänzt das Modell fehlende Angaben, liegt zusätzlich ein Problem der Belegbarkeit oder Quellentreue vor. In der Praxis können beide Fehlerarten zusammen auftreten.
Was wird bewertet?
| Begriff | Hilfreiche Frage | Geeignete Prüfung |
|---|---|---|
| Faktische Falschheit | Widerspricht die Aussage einer überprüfbaren Tatsache? | Mit verlässlichen, für das Thema geeigneten Quellen abgleichen. |
| Fehlende Belege | Stützen die verfügbaren Belege diese Aussage? | Die konkrete Stütze im Kontext, Dokument oder in der Quelle suchen. |
| Ungültiger Schluss | Folgt die Schlussfolgerung aus den Prämissen? | Die einzelnen Schlussfolgerungen und ihre Voraussetzungen prüfen. |
| Falsche Zuschreibung | Drückt die zitierte Quelle diese Idee tatsächlich aus? | Die Passage auffinden und Inhalt sowie Aussageumfang abgleichen. |
| Abruffehler | Wurden für die Aufgabe relevante Quellen gefunden? | Suchergebnisse, Abdeckung und Dokumentauswahl prüfen. |
Drei Beispiele aus der Praxis
Die folgenden Fälle sind hypothetische Beispiele, keine dokumentierten Vorfälle und keine professionelle Beratung. In allen drei Fällen kommt es darauf an, eine konkrete Aussage mit den für die Aufgabe geeigneten Belegen abzugleichen. Sie veranschaulichen, warum eine Antwort nicht allein deshalb als zuverlässig gelten sollte, weil sie flüssig oder fachsprachlich klingt. Der jeweilige Prüfmaßstab hängt davon ab, welche Frage gestellt wurde und welches Material dem System zur Verfügung stand.
Bei jedem Beispiel sollte zunächst die genaue Behauptung festgehalten werden. Danach lässt sich bestimmen, welche Quelle, welcher Test oder welcher Text sie bestätigen könnte. Ebenso wichtig ist, den Umfang der Prüfung zu benennen: Wurde ein vollständiges Dokument untersucht oder nur ein Auszug? Welche Version einer Bibliothek wurde getestet? Welche medizinische Quelle und welches Präparat sind gemeint? Ohne diese Angaben kann eine zutreffende Teilprüfung leicht zu einer weitergehenden Aussage verallgemeinert werden.
Die Beispiele zeigen außerdem, dass „nicht belegt“ eine präzisere und oft angemessenere Einstufung sein kann als „falsch“. Eine Prüfung sollte offenlegen, was die herangezogene Evidenz tatsächlich zeigt, und nicht mehr behaupten, als sich daraus ableiten lässt.
Beispiel Gesundheit: eine in der Quelle nicht erwähnte Kontraindikation
Angenommen, jemand fragt nach einer Zusammenfassung medizinischer Arzneimittelinformationen und das System behauptet, ein Medikament sei in Kombination mit einem anderen kontraindiziert. Der Begriff „kontraindiziert“ kann erhebliche Folgen haben: Es reicht nicht, dass der Satz medizinisch klingt oder ein Arzneimittel korrekt benennt. Für die Prüfung müsste das betreffende Produkt und die maßgebliche Quelle bestimmt, der genaue Warnhinweis gefunden und geprüft werden, ob der Umfang der Aussage dem Text entspricht.
Erwähnt das herangezogene Material diese Kontraindikation nicht, lässt sich sagen, dass die Aussage durch dieses Material nicht belegt ist. Um sie als falsch einzustufen, wären geeignete und aktuelle klinische Belege nötig; das Schweigen eines einzelnen Textausschnitts reicht dafür nicht aus. Das Beispiel ist auch nicht als Patientenberatung zu verstehen: Bei einer möglichen Wechselwirkung oder tatsächlichen Kontraindikation sollte medizinisches Fachpersonal oder eine maßgebliche Informationsquelle herangezogen werden.
Die Bewertung kann die Antwort in Einzelpunkte zerlegen: Hat sie die Medikamente richtig benannt? Hat sie eine Warnung einer bestimmten Quelle zugeschrieben? Enthält diese Quelle die Warnung tatsächlich? Übertreibt die Formulierung einen Vorsichtshinweis oder stellt sie eine Möglichkeit als absolutes Verbot dar? Ein medizinischer Benchmark kann beim Vergleich von Systemen für klar umrissene Aufgaben helfen. Ein Testergebnis für einen Datensatz entscheidet jedoch nicht über die Richtigkeit einer einzelnen Antwort und ersetzt keine dem Risiko angemessene Prüfung.
Beispiel Vertragsanalyse: eine nicht vorhandene Klausel zuschreiben
Stellen wir uns ein Werkzeug vor, das einen Vertrag zusammenfasst und behauptet, darin gebe es eine Klausel zur automatischen Verlängerung mit einer bestimmten Frist. Am direktesten lässt sich diese Aussage prüfen, indem man im Dokument nach dem zugrunde liegenden Text sucht und die relevanten Abschnitte untersucht. Ist die Klausel nicht enthalten, darf das System sie nicht als Vertragsinhalt darstellen. Eine angemessene Schlussfolgerung könnte lauten: „Im bereitgestellten Dokument nicht gefunden.“ Das ist präziser als die Behauptung, sie komme auch in keinem anderen Anhang oder keiner anderen Fassung vor.
Eine Auslegung kann strittig sein, ohne dass eine Klausel erfunden wurde. Eine mehrdeutige Formulierung kann beispielsweise mehrere juristische Lesarten zulassen. Dann müssen der Wortlaut, die Interpretation des Systems und jede rechtliche Schlussfolgerung auseinandergehalten werden. Auch ein Verweis auf eine Abschnittsnummer beweist weder, dass der Abschnitt existiert, noch dass er die Zusammenfassung stützt. Die Fundstelle und ihr Zusammenhang müssen geprüft werden.
Das Beispiel zeigt, weshalb der Umfang der Quelle wichtig ist. Wurde nur eine Seite bereitgestellt, lässt sich aus dem Fehlen einer Klausel auf dieser Seite nicht schließen, dass sie im gesamten Vertrag fehlt. Selbst wenn das vollständige Dokument vorliegt, kann es nicht enthaltene Anlagen oder externe Dokumente geben. Eine sorgfältige Prüfung hält fest, welches Material untersucht wurde, und macht aus einer unvollständigen Suche keine allgemeingültige Schlussfolgerung.
Beispiel Programmierung: eine nicht vorhandene Funktion erklären
Angenommen, ein Assistent beschreibt eine Funktion einer Bibliothek und liefert einen plausibel wirkenden Aufruf, aber in der vom Projekt verwendeten Version gibt es diese Funktion nicht. Ein glaubwürdiger Name und passende Argumente reichen nicht aus, um den Aufruf als gültig einzustufen. Prüfen lässt sich dies anhand der Dokumentation der relevanten Version, durch eine Untersuchung des verfügbaren Quellcodes oder mit einem kleinen Test in einer kontrollierten Umgebung.
Version und Kontext sind entscheidend. Die Funktion könnte in einer neueren Version, einer Erweiterung oder einem anderen Modul vorhanden sein. Wird sie in der Dokumentation einer bestimmten Version nicht gefunden, lässt sich die Aussage eingrenzen; bewiesen ist damit nicht, dass es die Funktion niemals gab. Außerdem müssen eine falsche Erklärung zu einer API, ein Umgebungsfehler, eine fehlende Abhängigkeit und eine fehlerhafte Konfiguration unterschieden werden.
Schreibt die Antwort die Methode einer bestimmten Dokumentation zu, lässt sich das Zitat separat prüfen. Wird keine Quelle genannt, kann der Code dennoch getestet werden; das Testergebnis gilt aber nur für die erprobten Bedingungen. Dass ein Codeausschnitt in einem Fall funktioniert, garantiert nicht, dass er in jedem Projekt korrekt, sicher oder kompatibel ist.
Eine mögliche Halluzination bewerten
Es gibt keine einzelne Prüfung, die für alle Aufgabentypen geeignet ist. Die Bewertung beginnt damit, die Antwort in überprüfbare Aussagen zu zerlegen. Eine längere Antwort kann korrekte Angaben, plausible Schlussfolgerungen, unbelegte Einzelheiten und fehlerhafte Zitate zugleich enthalten. Wird sie nur als Ganzes beurteilt, ist schwerer festzustellen, was zu korrigieren ist und welche Belege fehlen.
Anschließend wird der erforderliche Belegmaßstab festgelegt: Sollte sich die Antwort strikt auf ein Dokument beschränken, aktuelle Informationen liefern, eine Berechnung ausführen, ein Bild beschreiben oder abgerufene Ergebnisse zusammenfassen? Für jeden Zweck ist eine andere Prüfung nötig. Bei einer Frage zu einem Dokument kann der Abgleich konkreter Passagen angemessen sein; bei Code liefert ein ausführbarer Test Belege für das getestete Verhalten; bei aktuellen Fakten kann es erforderlich sein, aktuelle und maßgebliche Quellen heranzuziehen.
Bei RAG-Systemen ist es sinnvoll zu prüfen, ob jede Aussage in den abgerufenen Textausschnitten gestützt wird und ob diese relevant und hinreichend sind. Ein Tool zur Herkunfts- oder Provenienzprüfung kann dabei helfen, Aussagen mit Textausschnitten zu verknüpfen. Diese Zuordnung beweist jedoch nicht von sich aus, dass der Ausschnitt wahr, aktuell oder die am besten geeignete Quelle ist. Implizite Aussagen, komplexe Schlussfolgerungen oder Informationen außerhalb des Korpus werden damit möglicherweise ebenfalls nicht beurteilt.
Zitate und Quellenangaben sollten als konkrete Objekte geprüft werden: Gibt es sie tatsächlich? Gehören sie zur angegebenen Quelle? Stützen sie die Aussage in dem behaupteten Umfang? Ein echtes Zitat kann irrelevant, veraltet oder aus dem Zusammenhang gerissen sein. Umgekehrt kann eine Aussage richtig sein, obwohl das dazugehörige Zitat falsch zugeschrieben wurde. Das sind unterschiedliche Fehler.
Eine menschliche Prüfung ist besonders wichtig, wenn ein Fehler Gesundheit, Rechte, Finanzen, Sicherheit oder schwer umkehrbare Entscheidungen beeinträchtigen kann. Der Prüfaufwand sollte in einem angemessenen Verhältnis zu den möglichen Folgen und zur Überprüfbarkeit des Ergebnisses stehen. Bei einer Aufgabe mit geringem Risiko kann ein direkter Test genügen; bei einer Entscheidung mit hohem Risiko sollte die automatisierte Antwort nicht als unabhängige Verifikation behandelt werden.
Kurze Prüfliste
- 01Konkrete Aussagen herausarbeiten, statt nur den allgemeinen Ton zu bewerten.
- 02Festlegen, welche Belege erwartet wurden und welchen Umfang die Aufgabe hatte.
- 03Die ursprüngliche Stütze auffinden und, soweit relevant, ihre Eignung, Vollständigkeit und Aktualität prüfen.
- 04Fakten, Schlussfolgerungen, Zitate, Berechnungen und Werkzeugergebnisse getrennt verifizieren.
- 05Jedes Element als belegt, widerlegt oder nicht bestimmbar einstufen.
- 06Grenzen der Prüfung angeben und die Kontrolle entsprechend den möglichen Folgen ausweiten.
Maßnahmen zur Verringerung von Halluzinationen: hilfreich, aber keine Garantie
Der Abruf von Quellen kann die Verfügbarkeit von Belegen für eine Antwort verbessern und den Abgleich von Aussagen erleichtern. Er gewährleistet jedoch nicht, dass die richtige Quelle gefunden oder vom Modell zuverlässig verwendet wurde. Dokumente können unvollständig oder irrelevant sein oder einander widersprechen. Das System kann falsch auswählen, das Material fehlerhaft interpretieren oder Inhalte ergänzen, die darin nicht vorkommen.
Die Aufforderung an das Modell, bei Unsicherheit zu sagen, dass es die Antwort nicht weiß, oder sich zu enthalten, kann manche spekulativen Antworten verringern. Sie macht die Enthaltung aber nicht zu einem unfehlbaren Erkennungsverfahren. Das System kann sich enthalten, obwohl Belege vorliegen, oder sicher antworten, obwohl sie fehlen. Die Anweisung beeinflusst das Verhalten; sie ist kein unabhängiger Wahrheitsnachweis.
Automatische Prüfsysteme können Widersprüche markieren, Zitate kontrollieren oder eine Antwort mit einer Sammlung von Quellen vergleichen. Ihre Ergebnisse hängen von der Aufgabe, den Daten und der Methode ab. Ein Prüfsystem kann einen subtilen Fehler übersehen, Einschränkungen mit dem Generator teilen oder eine ungeeignete Quelle akzeptieren. Evaluationen und Benchmarks messen Verhalten unter festgelegten Bedingungen; sie zertifizieren nicht alle künftigen Antworten in anderen Kontexten.
Eine Forschungspublikation eines Modellanbieters legt die Hypothese nahe, dass bestimmte Anreize beim Training und bei der Evaluation Antworten durch Raten begünstigen können, statt Unsicherheit einzugestehen. Diese Erklärung stammt von dem Anbieter und ist weder eine universelle Erklärung noch ein für jeden Fall unabhängig bestätigter Konsens. Eine mögliche Erklärung für Ursachen ist von den konkreten Belegen zu trennen, anhand derer eine bestimmte Ausgabe bewertet wird.
Verwandte Begriffe und praktische Maßstäbe
Halluzinationen stehen mit anderen Begriffen des Glossars in Verbindung, ersetzen sie aber nicht. Der Eintrag zu Grounding behandelt, wie eine Antwort auf identifizierbare Informationen oder einen nachvollziehbaren Kontext gestützt wird. RAG bezeichnet eine Architektur, die Material abruft und in die Generierung einbezieht. Keiner dieser Begriffe bedeutet, dass die Aussagen zwangsläufig korrekt sind.
Unsicherheit betrifft die Grenzen dessen, was sich feststellen lässt, oder die Sicherheit, mit der eine Schlussfolgerung vertreten wird. Sie klar auszudrücken kann helfen; eine unsicher klingende Formulierung garantiert jedoch keine angemessene Kalibrierung. Fact-Checking ist der Prozess, Aussagen mit Belegen abzugleichen. Dabei lassen sich Fehler entdecken, doch die Qualität hängt von der Auswahl der Quellen und der geprüften Frage ab. Über den Glossarindex lassen sich diese verwandten Einträge finden und ihre jeweiligen Schwerpunkte unterscheiden.
Als praktische Orientierung kann man vor der Verwendung einer Antwort fragen: Welche konkrete Aussage brauche ich? Welche Quelle oder welcher Test könnte sie bestätigen? Ist die Quelle für diesen Fall und Zeitpunkt relevant? Stützt das Zitat tatsächlich die behauptete Aussage? Welche Teile bleiben unbestimmt? Lassen sich diese Fragen nicht beantworten, ist es präziser, die Antwort als nicht verifiziert zu bezeichnen, statt ihr ein abschließendes Etikett zu geben.
Für eine dokumentierte Prüfung sollten die Aussage, das untersuchte Material, die Prüfmethode und das Ergebnis festgehalten werden. Verwenden Sie klar begrenzte Einstufungen: durch die geprüfte Quelle gestützt, durch sie widerlegt, in diesem Material nicht belegt oder anhand der verfügbaren Belege nicht beurteilbar. Geben Sie auch den Umfang an, etwa „im bereitgestellten Dokument“ oder „in der getesteten Version“. So lassen sich Fehler korrigieren, ohne mehr zu behaupten, als die Prüfung belegt.
Die abschließende Regel ist einfach: Flüssige Sprache, ein sicherer Ton, viele Einzelheiten und ein formal überzeugendes Zitat sind keine Belege. Berechtigtes Vertrauen entsteht durch eine zur Aufgabe passende Prüfung mit relevanten Quellen und klar benannten Grenzen.
Kriterien für das weitere Vorgehen
| Situation | Praktisches Vorgehen |
|---|---|
| Die Aussage verweist auf eine konkrete Quelle | Prüfen, ob die Quelle existiert, relevant ist und genau den behaupteten Umfang stützt. |
| Die Antwort fasst ein Dokument zusammen | Aussagen mit dem verfügbaren vollständigen Dokument abgleichen und dessen Grenzen festhalten. |
| Die Antwort hängt von einem Werkzeug oder einer Version ab | Werkzeug, Daten und Version dokumentieren und einen geeigneten Test wiederholen. |
| Die verfügbaren Belege reichen nicht aus | Das Ergebnis als unbestimmt kennzeichnen und geeignete weitere Quellen suchen. |
| Ein möglicher Fehler könnte erheblichen Schaden verursachen | Fachkundige Prüfung einholen und die automatisierte Antwort nicht als alleinige Grundlage verwenden. |