Die entscheidende Frage: Was bedeutet es, wenn ein Benchmark kontaminiert ist?
Die Aussage, ein KI-Benchmark sei kontaminiert, kann verschiedene Sachverhalte beschreiben. Eine Testfrage könnte wortwörtlich in den Daten vorkommen, mit denen ein Modell trainiert wurde; sie könnte in einer leicht veränderten Form wiederauftauchen; oder das Modell könnte während des Trainings Muster gelernt haben, die denen der Testaufgabe stark ähneln. Diese Möglichkeiten haben nicht dieselbe Beweiskraft und führen nicht automatisch zu demselben Effekt auf die Punktzahl.
Es ist sinnvoll, drei Behauptungen auseinanderzuhalten. Die erste lautet, dass sich Evaluationsmaterial mit einem relevanten Datensatz überschneidet. Die zweite besagt, dass das Modell vor der Evaluation diesem Material ausgesetzt war. Die dritte und anspruchsvollste Behauptung ist, dass diese Exposition eine Verbesserung des Ergebnisses verursacht hat. Ein Detektor kann Hinweise zu den ersten Fragen liefern; um die dritte zu belegen, braucht es in der Regel einen Vergleich unter Bedingungen, die den Effekt möglichst isolieren.
Diese Unterscheidung ist wichtig, wenn man einen Warnhinweis interpretiert. Eine Textübereinstimmung kann auf eine potenzielle Exposition hindeuten, verrät aber für sich genommen weder, wann der Text in den Daten auftauchte, noch, ob das Modell ihn gelernt hat oder wie stark er die Antwort beeinflusste. Umgekehrt schließt eine fehlende exakte Übereinstimmung Paraphrasen, abgeleitete Daten oder Vertrautheit mit dem Aufgabentyp nicht aus.
Dieser Artikel beschränkt sich auf die Studien, die sich anhand der am Ende aufgeführten Quellen überprüfen lassen. Sie eignen sich dazu, verschiedene Methoden und ihre Annahmen zu erläutern. Sie reichen jedoch nicht aus, um die aggregierten Zahlen, die Zahl der Studien oder den Literaturstichtag einer in der redaktionellen Vorlage genannten systematischen Übersichtsarbeit zu bestätigen. Daher werden hier weder ein Korpus aus 55 Studien noch eine allgemeine Spanne von 6 % bis 40 % für die Leistungsinflation als verifizierte Tatsachen dargestellt.
Vier praktisch unterscheidbare Formen der Kontamination
Bei der Untersuchung eines konkreten Kontaminationsvorwurfs hilft es, zunächst einzuordnen, was sich überschneidet. Diese Einteilung ist ein praktischer analytischer Rahmen; sie bedeutet nicht, dass alle hier berücksichtigten Studien dieselbe Taxonomie verwenden. Außerdem können die Kategorien zusammen auftreten: Eine Aufgabe kann wortwörtlich verbreitet worden sein und zugleich ein Problemtyp sein, der in den Trainingsdaten sehr häufig vorkommt.
Der exakte Treffer ist der sichtbarste Fall: Eine Testfrage, eine Referenzantwort oder eine Lösung kommt ohne wesentliche Änderungen im Trainingsmaterial vor. Eine Textsuche kann solche Treffer finden. Wie sie zu interpretieren sind, hängt jedoch davon ab, welche Korpora untersucht werden konnten, wie vollständig diese sind und welche Transformationen auf die Daten angewandt wurden. Wird in einem unvollständigen Korpus nichts gefunden, beweist das nicht, dass keine Exposition stattgefunden hat.
Bei oberflächlichen Veränderungen werden Formatierung, Zeichensetzung, Reihenfolge oder Formulierung angepasst, während ein großer Teil des Inhalts erhalten bleibt. Ein wörtlicher Vergleich findet solche Fälle möglicherweise nicht. Eine Suche nach Textfragmenten, eine Normalisierung des Textes oder andere Retrieval-Verfahren können mögliche Treffer sichtbar machen. Sie können aber auch falsch-positive Ergebnisse liefern: Allgemeine Formulierungen oder Aufgabenvorlagen kommen oft in vielen Dokumenten vor, ohne dass eine konkrete Testaufgabe kopiert wurde.
Semantische Äquivalenz ist schwieriger festzustellen. Zwei Aufgaben können dieselbe Art von Schlussfolgerung verlangen, obwohl sie anders formuliert sind und keine längeren Textpassagen teilen. Semantische Ähnlichkeit kann mögliche Paare zutage fördern, beweist aber weder, dass das Modell eines davon gesehen hat, noch, dass eine solche Exposition seine Antwort erklärt. Ob zwei Beispiele als äquivalent gelten, kann zudem von menschlichen Bewertungen und den dafür verwendeten Kriterien abhängen.
Die Exposition gegenüber einem Aufgabentyp ist etwas anderes als das Kopieren konkreter Beispiele. Ein Modell kann während des Trainings viele Probleme, Fragen oder Codefragmente in einem ähnlichen allgemeinen Format erhalten haben, ohne dass sich ein bestimmtes Benchmark-Beispiel in den Trainingsdaten nachweisen lässt. Eine solche Vertrautheit könnte die Antwort erleichtern. Um sie zu messen, muss jedoch klar definiert werden, was als Exposition zählt und wie sich ihr Effekt von allgemein während des Trainings erworbenen Fähigkeiten trennen lässt.
Fünf Methodengruppen und ihre Voraussetzungen
Kein einzelner Detektor kann sämtliche Fragen beantworten. Die Verfahren beobachten unterschiedliche Signale und setzen unterschiedliche Zugriffsmöglichkeiten voraus. Die folgende Tabelle ordnet fünf Ansätze, die bei der Lektüre von Kontaminationsstudien hilfreich sind. Sie ist ein Vergleichsleitfaden und keine allgemeingültige Rangliste der Zuverlässigkeit. Insbesondere liefert ein direkterer Hinweis auf eine Textübereinstimmung nicht zwangsläufig eine bessere Schätzung des kausalen Effekts auf die Punktzahl.
Was die einzelnen Ansätze beobachten – und was offenbleibt
| Methodengruppe | Typischer Zugriff oder benötigte Eingabe | Mögliche Aussage | Zentrale Einschränkung |
|---|---|---|---|
| Direkter Textabgleich | Benchmark-Aufgaben und zugängliche Trainingskorpora oder eine Sammlung möglicher Quellen | Vorhandensein identischer oder sehr ähnlicher Textsequenzen im untersuchten Material | Das Ergebnis hängt von der Abdeckung des Korpus ab; ein Treffer beweist weder, dass das Modell das Material genutzt hat, noch, dass es die Punktzahl beeinflusste |
| Dokument-Retrieval | Testaufgaben und Zugriff auf ein durchsuchbares Korpus; der Ansatz kann textbasiertes Retrieval nutzen | Mögliche Dokumente, die Inhalte mit Bezug zu den Testaufgaben enthalten | Die Ergebnisse hängen von Sammlung, Suchanfrage und Schwellenwerten ab; ein gefundenes Dokument belegt für sich nicht, dass es Teil des Trainings war |
| Testset Slot Guessing | Zugriff auf ein Modell, an das sich gemäß dem Protokoll Fragen zu Teilen von Beispielen richten lassen | Hinweise darauf, dass das Modell Teile einer Testaufgabe ergänzen oder erkennen kann | Eine richtige Antwort kann auf allgemeinen Fähigkeiten oder Vertrautheit mit dem Format beruhen und muss nicht auf Exposition gegenüber dem konkreten Beispiel zurückgehen |
| Inferenz der Trainingsdatenzugehörigkeit | Je nach Verfahren Zugriff auf Antworten oder Signale des Modells sowie auf Vergleichsbeispiele | Ein statistischer Unterschied, der mit einer Zugehörigkeit eines Beispiels zu den Trainingsdaten vereinbar ist | Die Aussagekraft hängt von Annahmen zu Training und Datenverteilung ab; verfügbare Evaluationen zeigen Grenzen der Zuverlässigkeit |
| Leistungsvergleich | Ergebnisse des Modells auf einem Hauptbenchmark und Referenztests sowie explizite Annahmen | Ein Leistungsmuster, das mit Kontamination vereinbar ist, und ein möglicher Leistungsunterschied | Der Vergleich hängt davon ab, wie die Referenztests ausgewählt werden und welche Annahmen gelten; die Ursache der Leistung wird damit nicht zwangsläufig identifiziert |
Was die verfügbaren Studien aussagen können
Eine 2024 auf der NAACL veröffentlichte Studie stellt Methoden zum Retrieval in Korpora und ein Protokoll namens Testset Slot Guessing vor, mit denen sich Kontamination in Benchmarks untersuchen lässt – auch in Szenarien mit offenen und proprietären Modellen. Diese Methoden erweitern die Möglichkeiten über die Suche nach wortwörtlichen Kopien hinaus. Welche Art von Evidenz sie liefern, hängt jedoch weiterhin davon ab, wie Suchanfragen definiert werden, welche Korpora verfügbar sind und welche Zugriffe das Modell erlaubt.
Eine 2025 in den Findings der NAACL veröffentlichte Übersicht und Evaluation untersucht die Annahmen von Detektoren und prüft Verfahren zur Inferenz der Trainingsdatenzugehörigkeit. Für eine kritische Einordnung besonders relevant ist ihr Ergebnis, dass manche Tests bei Korpora, die für das Pretraining verwendet wurden, Ergebnisse nahe am Zufallsniveau erzielten. Das bedeutet nicht, dass jede Inferenz der Trainingsdatenzugehörigkeit nutzlos ist. Es ist aber ein Hinweis darauf, dass die Bezeichnung „Detektor“ eine Klassifikation noch nicht schlüssig macht.
ConStat schlägt eine leistungsbasierte Erkennung vor, bei der Ergebnisse auf Hauptbenchmarks mit Ergebnissen auf Referenzbenchmarks verglichen werden, und zwar unter festgelegten Annahmen. Ein solcher Vergleich kann dabei helfen einzuschätzen, ob das beobachtete Verhalten mit Kontamination vereinbar ist. Ein Unterschied wird dadurch jedoch nicht automatisch zum Kausalitätsbeweis. Um ihn zu beurteilen, muss man prüfen, welche Referenzen ausgewählt wurden, warum sie vergleichbar sein sollen und welche alternativen Erklärungen denselben Unterschied hervorrufen könnten.
Eine kontrollierte Studie zur maschinellen Übersetzung verändert gezielt die Exposition gegenüber Evaluationsdaten, um Leistungsänderungen bei Modellen zu messen. Laut der Arbeit unterscheiden sich die Effekte je nachdem, ob die Eingabe, die Ausgabe oder beides kontaminiert wird. Das Design ist aufschlussreich, weil es die Exposition gezielt verändert, anstatt sie allein aus beobachteten Ergebnissen abzuleiten. Die Schlussfolgerungen gelten dennoch für die untersuchten experimentellen Bedingungen und lassen sich nicht ohne Weiteres auf andere Benchmarks, Aufgaben oder Trainingsverfahren übertragen.
Zusammengenommen zeigen diese Arbeiten, warum Fragen möglichst präzise gestellt werden sollten. Wurde eine Zeichenfolge in einem bestimmten Korpus gefunden? Wurde ein statistisches Signal entdeckt, das mit einer Zugehörigkeit zu den Trainingsdaten vereinbar ist? Hat das Modell auf Sondierungsfragen richtig geantwortet? Oder wurde eine Leistungsänderung gemessen, nachdem Kontamination kontrolliert eingeführt worden war? Das sind unterschiedliche Ergebnisse. Werden sie alle mit demselben Begriff bezeichnet, können wichtige Unterschiede bei Zugriff, Annahmen und Aussagekraft der Schlussfolgerung verloren gehen.
Warum Schätzungen der Leistungsinflation nicht austauschbar sind
Eine Schätzung, um wie viel Kontamination eine Punktzahl erhöht, lässt sich nur zusammen mit dem Verfahren interpretieren, mit dem sie ermittelt wurde. Entscheidend sind der Benchmark, die als kontaminiert betrachtete Einheit, der Anteil betroffener Beispiele, die Aufgabe, das Modell und die Trainingsphase. Auch Referenzdaten und Vergleichsdesign spielen eine Rolle. Zwei Prozentwerte können unterschiedliche Größen beschreiben, obwohl beide als „Inflation“ bezeichnet werden.
So kann eine Schätzung beispielsweise die Leistung mit und ohne gezielt eingeführte Exposition vergleichen. Eine andere kann mögliche Überschneidungen in Korpora erschließen und ihre Wirkung mithilfe bestimmter Annahmen hochrechnen. Eine dritte könnte Punktzahlen verschiedener Modelle oder unterschiedlicher Aufgabenmengen gegenüberstellen. Ohne ausreichende Informationen zu diesen Designs wäre es nicht methodisch sauber, die Zahlen so zu ordnen, als handle es sich um wiederholte Messungen derselben Größe.
Die redaktionelle Vorlage nennt für veröffentlichte Schätzungen zu MMLU, GSM8K, HumanEval und HellaSwag eine ungefähre Spanne von 6 % bis 40 %. Mit den für diesen Beitrag überprüften Quellen lässt sich nicht feststellen, welche Primärstudien die beiden Endpunkte stützen, welche Definition von Inflation angewandt wurde oder ob sich die Zahlen vergleichen lassen. Deshalb wird diese Spanne hier weder als bestätigtes Ergebnis noch als gemeinsame Messgröße für Kontamination in Benchmarks dargestellt.
Dieselbe Vorsicht gilt für Benchmark-Namen und aggregierte Zahlen aus Übersichtsarbeiten. Bevor eine Schätzung weitergegeben wird, sollte man zur Primärstudie zurückkehren und festhalten, was genau gemessen wurde: der Prozentsatz der Aufgaben mit Texttreffern, die Zahl gefundener Beispiele, der Unterschied in der Punktzahl, der Anteil von Treffern, der einer experimentellen Bedingung zugeschrieben wird, oder eine andere Variable. Ist die Messgröße unklar, kann eine Zahl mehr Präzision suggerieren, als das Design tatsächlich hergibt.
Vorhandensein, Exposition und Kausalität: eine Evidenzleiter
Eine solide Analyse vermeidet den Sprung von einem Signal zu einer kausalen Schlussfolgerung. Zunächst wird der Befund präzise beschrieben: etwa, dass eine Suche in einer bestimmten Sammlung ähnliche Dokumente identifiziert hat. Anschließend ist zu prüfen, ob diese Sammlung die relevanten Trainingsdaten zuverlässig repräsentiert und ob sich belegen lässt, dass das Modell vor der Evaluation Zugriff auf die Dokumente hatte. Um schließlich eine Änderung der Punktzahl dieser Exposition zuzuschreiben, braucht es einen überzeugenden Vergleich, der alternative Erklärungen ausschließt.
Das beobachtbare Erinnern eines Modells ist nicht dasselbe wie die Kenntnis seiner Trainingsgeschichte. Eine Sondierungsfrage kann das Modell dazu bringen, einen Teil eines Beispiels zu ergänzen. Der Erfolg könnte jedoch auf allgemeinem Wissen, Regelmäßigkeiten der Aufgabe oder Hinweisen in der Frage beruhen. Umgekehrt beweist die fehlende Wiedergabe eines Testbeispiels nicht, dass das Modell es nie gesehen hat: Der Abruf kann misslingen, insbesondere wenn die Suchanfrage anders formuliert ist oder das Modell den Text nicht wörtlich reproduziert.
Kausale Schlussfolgerungen sind bei kontrollierten Experimenten klarer, wenn die Exposition gezielt verändert und die Leistung unter vergleichbaren Bedingungen gemessen wird. Auch dann gilt die Schlussfolgerung nur für das jeweilige Protokoll. Dass ein Experiment einen möglichen Effekt zeigt, reicht nicht aus, um die Punktzahl eines bestimmten Modells der Kontamination zuzuschreiben. Dazu müsste das Experiment mit der tatsächlichen Exposition, dem untersuchten Modell, den Daten und dem Benchmark verknüpft werden.
Deshalb ist es sinnvoll, die Beweiskraft abgestuft zu beschreiben: ein Kandidat für eine Überschneidung, Hinweise auf wahrscheinliche Exposition oder ein experimenteller Nachweis eines Effekts unter klar begrenzten Bedingungen. Das sind keine allgemein gültigen offiziellen Kategorien, sondern eine Möglichkeit, deutlich zu machen, was beobachtet wurde und welche Schlussfolgerung noch aussteht.
Praktische Fragen zur Prüfung eines Kontaminationsvorwurfs
Bei der Bewertung einer Behauptung sollte man zunächst die Originalstudie ausfindig machen und ihre Ergebnisse von der Interpretation Dritter trennen. Eine Pressemitteilung, Vergleichstabelle oder Zusammenfassung kann bei der Orientierung helfen. Die Tragfähigkeit der Behauptung hängt jedoch von den Daten, dem Protokoll und den Einschränkungen der Primärarbeit ab.
Ebenso sollte geprüft werden, welchen Zugriff das Forschungsteam hatte. Hat es die Trainingsdaten untersucht oder nur ein ungefähres Ersatzkorpus? Hatte es Zugriff auf Wahrscheinlichkeiten, Modellgewichte oder lediglich auf Antworten des Modells? Lässt sich das Verfahren bei einem geschlossenen Modell reproduzieren? Fehlender direkter Zugriff macht eine Analyse nicht automatisch ungültig, verändert aber, welche Schlussfolgerungen möglich sind und wie stark diese von Annahmen abhängen.
Die folgende Liste kann sowohl Teams helfen, die Evaluationen veröffentlichen, als auch Personen, die sie interpretieren. Bleiben mehrere Fragen unbeantwortet, sollte die Schlussfolgerung als vorläufig beschrieben werden. Außerdem sollte genau benannt werden, welches Signal beobachtet wurde, statt jede Abweichung in der Punktzahl der Kontamination zuzuschreiben.
Checkliste zur Interpretation von Ergebnissen
- 01Bestimmen Sie den Gegenstand der Behauptung: Geht es um eine textuelle Überschneidung, wahrscheinliche Exposition, beobachtbares Erinnern oder eine Wirkung auf die Punktzahl?
- 02Benennen Sie die verglichenen Daten und die Abdeckung der Korpora; legen Sie offen, welches Material nicht untersucht werden konnte.
- 03Beschreiben Sie den erforderlichen Zugriff: je nach Verfahren auf Korpora, Modellantworten, Wahrscheinlichkeiten oder Parameter.
- 04Prüfen Sie mögliche falsch-positive und falsch-negative Ergebnisse sowie die Schwellenwerte und Kriterien, nach denen Beispiele als ähnlich gelten.
- 05Suchen Sie nach einem geeigneten Vergleich zur Bestimmung des Effekts: Welche alternative Bedingung ermöglicht die Schätzung dessen, was ohne Exposition geschehen wäre?
- 06Prüfen Sie, ob Trainingsphasen und Expositionsarten getrennt betrachtet werden; setzen Sie sie ohne Evidenz nicht gleich.
- 07Vergewissern Sie sich, dass jede angegebene Zahl klar definiert ist und Nenner sowie Geltungsbereich ausdrücklich genannt werden.
- 08Stimmen Sie die Schlussfolgerung auf das Design ab: Halten Sie fest, was beobachtet und was erschlossen wurde und was ungewiss bleibt.
Fazit: Kontamination als Risiko behandeln, für das abgestufte Evidenz nötig ist
Kontamination von Benchmarks ist ein relevantes Problem bei der Interpretation von Evaluationen. Sie ist jedoch weder eine automatische Erklärung für eine hohe Punktzahl noch eine Eigenschaft, die ein einzelner Detektor abschließend bestimmen kann. Eine Textübereinstimmung, ein Signal zur Trainingsdatenzugehörigkeit, eine richtige Antwort auf eine Sondierungsfrage und ein in einem Experiment gemessener Effekt sind unterschiedliche Arten von Evidenz.
Die hier berücksichtigten verfügbaren Studien bieten einander ergänzende Methoden und dokumentieren zugleich deren Grenzen: Retrieval hängt von den untersuchten Daten ab, die Inferenz der Trainingsdatenzugehörigkeit kann unter bestimmten Bedingungen unzuverlässig sein, und leistungsbasierte Schätzungen beruhen auf Annahmen. Kontrollierte Experimente helfen bei der Untersuchung kausaler Zusammenhänge, ihre Ergebnisse müssen jedoch auf die tatsächlich getesteten Bedingungen begrenzt werden.
Am transparentesten ist es, Methode, Zugriff, Vergleichsentscheidungen, mögliche Fehler und Unsicherheiten offenzulegen und Exposition klar von Wirkung zu unterscheiden. Eine Transparenz-Checkliste kann als Dokumentationsvorschlag nützlich sein. Die für diesen Artikel geprüften Quellen erlauben es jedoch nicht, den Inhalt einer bestimmten Checkliste zu bestätigen oder sie als etablierten Standard darzustellen. Für Leserinnen, Leser und Forschende bleibt das zentrale Kriterium einfach: Jede Schlussfolgerung sollte der Evidenz entsprechen, die sie stützt – ein Verdacht darf nicht als nachgewiesene Ursache ausgegeben werden.
Offene Fragen
- Anhand der bereitgestellten Quellen wurden weder die Zahl der Studien noch der Literaturstichtag der in der Vorlage genannten systematischen Übersichtsarbeit überprüft.
- Die Primärstudien, die die ungefähre Spanne von 6 % bis 40 % für MMLU, GSM8K, HumanEval und HellaSwag stützen sollen, sowie die Bedingungen für einen Vergleich dieser Werte konnten nicht verifiziert werden.
- Die verfügbaren Quellen erlauben es nicht, den Inhalt einer bestimmten Contamination Transparency Card zu bestätigen oder sie als etablierten Standard darzustellen.
- Die Ergebnisse der einzelnen Methoden hängen von Korpus, Modell, Zugriff und Protokoll ab; Schlussfolgerungen sollten nicht automatisch auf andere Benchmarks übertragen werden.
Weiter entdecken
Verwendete Quellen
Korrekturen und Transparenz
Wenn du falsche oder veraltete Angaben findest, sende uns die Seite und die zu prüfende Quelle.
Korrektur vorschlagen