Ein Reproduktionstest statt einer isolierten Programmieraufgabe
RECLAIM ist ein Benchmark, der messen soll, ob ein KI-Agent ein konkretes Ergebnis aus einem Machine-Learning-Artikel reproduzieren kann. Das Preprint stellt eine Sammlung von 100 Artikeln der NeurIPS 2025 vor. Für jeden Artikel gibt es eine Aufgabe: Der Agent soll anhand des Artikels und der von den Autorinnen und Autoren veröffentlichten Materialien arbeiten – und dabei ein vorab festgelegtes Budget an GPU-Stunden einhalten.
Anders als bei einem herkömmlichen Programmiertest geht es um eine ganze Abfolge von Arbeitsschritten. Um ein Ergebnis zu erzielen, muss ein Agent möglicherweise Software installieren, Fehler beheben, die Methode verstehen, Experimente ausführen und die Resultate überprüfen. Die Evaluation soll diese gesamte Kette erfassen und nicht lediglich feststellen, ob das System plausibel wirkenden Code erzeugt.
Außerdem werden vorab sowohl das zu reproduzierende Ergebnis als auch die Bedingungen für einen erfolgreichen Versuch festgelegt. Das ist wichtig: Ohne ein vorab definiertes Ziel könnten Vergleiche zwischen Agenten davon abhängen, wie unterschiedlich bewertet wird, was als gelungene Reproduktion gilt. Das Abstract des Preprints erläutert die genauen Regeln für die einzelnen Artikel allerdings nicht. Auf dieser Grundlage lässt sich daher nicht nachvollziehen, wie das Kriterium in jedem Fall konkret umgesetzt wurde.
Drei Stufen, abhängig davon, was die Autorinnen und Autoren veröffentlicht haben
RECLAIM ordnet die Aufgaben danach ein, welche Ressourcen verfügbar sind. Auf der Stufe Run stehen Code, Daten und Modellgewichte zur Verfügung. Bei Retrain fehlen die Gewichte, sodass der Agent das Modell trainieren muss. Bei Reimplement ist der Code nicht verfügbar; der Agent muss die Implementierung selbst schreiben. Laut Preprint bestimmt das von den Autorinnen und Autoren veröffentlichte Material die Schwierigkeitsstufe.
Diese Einteilung hilft bei der Einordnung der Ergebnisse, denn die Aufgaben beginnen nicht alle unter denselben Voraussetzungen. Ein bereits vorbereitetes System auszuführen, seine Gewichte durch Training wiederherzustellen und eine Methode neu zu implementieren, erfordert jeweils andere Arbeit. Eine zusammengefasste Erfolgsquote ohne Aufschlüsselung nach Stufen würde daher wichtige Unterschiede verdecken.
Die Stufen bedeuten allerdings nicht, dass alle Aufgaben innerhalb einer Stufe gleich anspruchsvoll sind. Die Artikel können sich in ihren Methoden und Experimenten unterscheiden. Das verfügbare Abstract führt weder die Ressourcen für jeden einzelnen Artikel auf noch zeigt es, wie stark die jeweiligen Anforderungen variieren. Die Stufen beschreiben somit, welche Materialien verfügbar sind – nicht, dass alle Aufgaben innerhalb einer Stufe exakt gleich schwierig wären.
So sind die RECLAIM-Stufen zu verstehen
Die Tabelle fasst die Definition der drei Stufen aus dem Preprint zusammen. Sie ist keine unabhängige Bewertung des Schwierigkeitsgrads der einzelnen Artikel.
| Stufe | Angegebene Ressourcen | Aufgabe des Agenten |
|---|---|---|
| Run | Code, Daten und Modellgewichte | Die veröffentlichten Materialien ausführen und das festgelegte Ergebnis erzielen |
| Retrain | Modellgewichte fehlen | Das Modell trainieren und die übrigen Arbeitsschritte der Aufgabe erledigen |
| Reimplement | Code fehlt | Die Methode implementieren und versuchen, das Ergebnis zu reproduzieren |
Die Ergebnisse zeigen eine Lücke zwischen den Stufen
Dem Preprint zufolge wurden vier Agenten getestet, jeweils einmal pro Artikel. Der beste Agent auf jeder Stufe reproduzierte 41 % der Run-Artikel, 27 % der Retrain-Artikel und 15 % der Reimplement-Artikel. Innerhalb dieser Sammlung und nach dem beschriebenen Verfahren nahm der Erfolg also ab, je weniger Ressourcen für die Rekonstruktion des Systems verfügbar waren.
Diese Zahlen sind Ergebnisse des Benchmarks und keine allgemeingültige Messung der Fähigkeiten beliebiger Agenten. Ohne zusätzliche Informationen sollten sie auch nicht als direkter Vergleich der Agenten untereinander gelesen werden: Das Abstract nennt jeweils das beste Ergebnis pro Stufe, führt aber weder die vier Systeme noch ihre individuellen Resultate auf. Auch zur Streuung zwischen den Versuchen enthält es nicht genügend Einzelheiten, um sie nachzuvollziehen.
Laut Preprint verbrauchten gescheiterte Versuche im Durchschnitt 29 % des zugewiesenen Budgets. Die Autorinnen und Autoren deuten das so, dass viele Agenten noch verfügbares Budget hatten, als sie abbrachen. Der Befund legt nahe, dass eine Begrenzung der Rechenleistung allein nicht alle Fehlschläge erklärt. Er zeigt jedoch nicht von selbst, warum ein einzelner Versuch abgebrochen wurde oder welche Änderung für eine erfolgreiche Reproduktion ausgereicht hätte.
Ein weiterer häufiger Fehler bestand darin, die Methode zu implementieren, ohne auch nur einen Teil davon mit den im Artikel veröffentlichten Zahlen abzugleichen. Das Abstract nennt diesen Fehler in 63 von 400 Durchläufen. Die Beobachtung macht einen wichtigen Unterschied sichtbar: Eine plausible Implementierung zu erstellen ist nicht dasselbe, wie sie anhand verfügbarer Belege zu überprüfen. Die Methode aufzuschreiben garantiert nicht, dass der Agent die maßgeblichen Bedingungen tatsächlich reproduziert hat.
Die Erfolgsquoten mit Bedacht lesen
- 01Zuerst die Ressourcenstufe bestimmen: Run, Retrain oder Reimplement.
- 02Die Quote als Ergebnis des besten Agenten auf dieser Stufe lesen, nicht als Durchschnitt aller Agenten.
- 03Berücksichtigen, dass jeder Agent und jeder Artikel nur einmal getestet wurde.
- 04Aus dem Anteil reproduzierter Ergebnisse keine Aussage über die allgemeine Gültigkeit der Artikel ableiten.
Was der Benchmark bewertet – und was nicht
RECLAIM prüft, ob ein Agent mit den verfügbaren Materialien und innerhalb eines festgelegten Rechenbudgets ein zuvor ausgewähltes Ergebnis erzielen kann. Dem Abstract zufolge bewertet eine separate Instanz eines Sprachmodells die Durchläufe anhand von Protokollen und Ausgaben, statt sich auf den Bericht des Agenten zu stützen. Entscheidend ist damit, was während der Ausführung tatsächlich geschah – nicht nur, was das System behauptet, getan zu haben.
Diese Abgrenzung bestimmt zugleich, wie weit sich die Ergebnisse interpretieren lassen. Ein konkretes Ergebnis zu reproduzieren überprüft nicht automatisch sämtliche methodischen Entscheidungen eines Artikels, die Qualität der Daten, die Robustheit der Analysen oder die Gültigkeit der wissenschaftlichen Schlussfolgerungen. Umgekehrt beweist ein nicht abgeschlossener Benchmarkversuch für sich genommen nicht, dass das ursprüngliche Ergebnis falsch ist. Technische Probleme, Schwierigkeiten bei der Implementierung oder Einschränkungen der Ressourcen könnten ebenfalls eine Rolle spielen; das Abstract schlüsselt solche Gründe nicht auf.
Diese Unterscheidung ist für Leserinnen und Leser sowie für Teams wichtig, die den Benchmark als Fortschrittsindikator verwenden möchten. Eine niedrige Quote kann auf Schwierigkeiten der Agenten hinweisen, Experimente mit unvollständigen Informationen zu rekonstruieren. Ohne weitere Belege sollte sie jedoch nicht als Urteil über den geprüften Artikel verstanden werden.
Auch die Evaluation muss reproduzierbar sein
Wer Agenten unabhängig miteinander vergleichen möchte, braucht mehr als die Größe des Benchmarks und seine Erfolgsquoten. Dazu gehören die Auswahl der Artikel, das konkrete Zielergebnis jeder Aufgabe, das operative Erfolgskriterium, die GPU-Budgets und die Zeitlimits. Ebenfalls relevant sind die Namen und Konfigurationen der Agenten, die ihnen erteilten Anweisungen, die Umgebungen, die verfügbaren Materialien sowie die Protokolle und Ausgaben, anhand derer jeder Durchlauf bewertet wurde.
Das Abstract bestätigt, dass RECLAIM für jeden Artikel das Ergebnis, das Erfolgskriterium und ein Budget an GPU-Stunden vorab festlegt. Außerdem beruht die Bewertung auf Protokollen und Ausgaben. Die hier vorliegenden Angaben nennen jedoch weder die konkreten Budgets noch das Auswahlverfahren für die 100 Artikel. Auch die Namen der vier Agenten fehlen. Ebenso bleibt offen, ob Umgebungen und Skripte für eine Wiederholung der Evaluation veröffentlicht wurden. Diese Punkte sollten im Dokument und in den zugehörigen Materialien geprüft werden, bevor detailliertere Vergleiche gezogen werden.
RECLAIM wird als Benchmark beschrieben, der jedes Jahr anhand neuer Konferenzen neu zusammengestellt werden kann. Das eröffnet grundsätzlich eine Möglichkeit, Veränderungen bei den Fähigkeiten von Agenten über die Zeit zu verfolgen – vorausgesetzt, künftige Ausgaben behalten vergleichbare Kriterien bei oder dokumentieren Änderungen. Eine Vergleichbarkeit zwischen den Jahren kann nicht einfach vorausgesetzt werden, wenn sich die Artikel, Materialien oder Regeln ändern.
Welche Informationen für einen Vergleich nötig sind
Diese Angaben helfen dabei, Unterschiede in den Fähigkeiten von Unterschieden bei den Evaluationsbedingungen zu unterscheiden.
| Angabe | Was sie klärt |
|---|---|
| Artikel und Zielergebnisse | Was reproduziert werden sollte und wie die Fälle ausgewählt wurden |
| Erfolgskriterien | Welche Bedingungen ein Durchlauf erfüllen musste, um als Reproduktion zu gelten |
| Budget und Zeitlimits | Welche Ressourcen für die einzelnen Aufgaben erlaubt waren und wie die Grenzen angewendet wurden |
| Agenten, Anweisungen und Umgebung | Mit welchen Systemen und unter welchen Bedingungen die berichteten Quoten erzielt wurden |
| Protokolle, Ausgaben und Bewertung | Welche Belege die bewertende Instanz erhielt und wie sie das Erfolgskriterium anwandte |
Ein Maß für Fähigkeiten mit klar begrenzter Aussagekraft
Der zentrale Beitrag von RECLAIM besteht darin, eine umfassende Aufgabe – die Rekonstruktion eines Forschungsergebnisses – in einen Benchmark mit vorab definierten Zielen und Ressourcen zu überführen. Die drei Stufen machen sichtbar, wie sich die Arbeit verändert, wenn Code, Daten und Modellgewichte verfügbar sind, wenn ein Modell trainiert werden muss oder wenn eine Methode neu implementiert werden muss. Die veröffentlichten Ergebnisse zeigen, dass in dieser Evaluation die Reproduktion seltener gelang, je weniger Ressourcen verfügbar waren.
Die belastbarste Einordnung ist zugleich die vorsichtigste: RECLAIM berichtet über die Leistung von vier Agenten bei 100 konkreten Aufgaben, für die der Benchmark Kriterien und Budgets festlegt. Um die Reichweite dieser Ergebnisse beurteilen zu können, braucht es die vollständigen Angaben zur Auswahl, Durchführung und Bewertung. Die wissenschaftliche Qualität der Artikel erfordert wiederum andere Analysen als die Reproduktion eines einzelnen Ergebnisses.
Offene Fragen
- Die vorliegenden Quellenangaben erläutern nicht, wie die 100 Artikel ausgewählt wurden oder welches konkrete Ergebnis für jeden Artikel festgelegt wurde.
- Die GPU-Stundenbudgets und Zeitlimits für die einzelnen Aufgaben werden nicht genannt.
- Das Abstract identifiziert die vier Agenten nicht und enthält keine individuellen Ergebnisse für sie.
- Aus den vorliegenden Angaben geht nicht hervor, ob Umgebungen, Anweisungen, Skripte und vollständige Bewertungsregeln öffentlich verfügbar sind.
- Das allgemeine Erfolgskriterium wird als vorab festgelegt beschrieben; seine konkrete Umsetzung für die einzelnen Artikel ist jedoch nicht aufgeführt.
Weiter entdecken
Verwendete Quellen
Korrekturen und Transparenz
Wenn du falsche oder veraltete Angaben findest, sende uns die Seite und die zu prüfende Quelle.
Korrektur vorschlagen