Ein Bericht über den KI-Einsatz – kein Beleg für mehr Entdeckungen
AI in Science: Early Insights untersucht, wie künstliche Intelligenz in der wissenschaftlichen Arbeit eingesetzt wird. MIT FutureTech datiert den Bericht auf den 16. September 2026 und nennt Google und Google DeepMind als Kooperationspartner. Die Studie verbindet drei Arten von Evidenz: eine Stichprobe von 15 Millionen Interaktionen mit Gemini, ein Verzeichnis mit mehr als 2.600 spezialisierten Modellen und eine Befragung von mehr als 600 Wissenschaftlerinnen und Wissenschaftlern aus den USA und dem Vereinigten Königreich.
Diese Kombination beleuchtet das Thema aus unterschiedlichen Blickwinkeln. Sie macht den Bericht aber nicht zu einem Experiment, das belegt, dass KI die wissenschaftliche Produktion erhöht. Die Interaktionen erfassen Aktivitäten in einem Produkt, das Verzeichnis beschreibt verfügbare Werkzeuge, und die Befragung sammelt Antworten von Menschen. Keine dieser Messungen belegt für sich genommen, dass mehr oder bessere Ergebnisse veröffentlicht werden oder dass KI zu mehr Entdeckungen führt.
Diese Unterscheidung ist wichtig, denn eine schneller erledigte Aufgabe bedeutet nicht automatisch, dass ein wissenschaftliches Projekt insgesamt kürzer dauert. Die gewonnene Zeit kann für die Überprüfung von Ergebnissen, Experimente, weitere Hypothesen oder zuvor aufgeschobene Aufgaben verwendet werden. Um zu ermitteln, was tatsächlich geschieht, braucht es neben Daten zur Nutzung auch geeignete Vergleiche und Messgrößen für die Ergebnisse.
Drei Datenquellen, die unterschiedliche Fragen beantworten
Die erste Komponente ist die Stichprobe von Interaktionen mit Gemini. Sie kann helfen zu beschreiben, welche Arten von Aufgaben bei der Nutzung dieses Systems auftreten. Sie bildet jedoch nicht automatisch die gesamte wissenschaftliche Tätigkeit oder den gesamten KI-Einsatz ab. Gespräche mit einem einzelnen Produkt umfassen nicht unbedingt die Arbeit mit anderen Werkzeugen, privaten Systemen oder Verfahren, die nicht über eine dialogbasierte Oberfläche laufen. Die Zahl von 15 Millionen beschreibt die Größe der angegebenen Stichprobe, nicht die Zahl der beteiligten Forschenden.
Die zweite Komponente ist ein Verzeichnis mit mehr als 2.600 spezialisierten Modellen. Es macht deutlich, dass die Analyse über allgemeine Sprachmodelle hinausgeht: Es gibt Systeme, die für bestimmte Aufgaben oder Fachgebiete entwickelt wurden. Die Anzahl der Modelle sagt aber nicht aus, wie viele Labore sie einsetzen, wie häufig sie genutzt werden oder welche Ergebnisse sie hervorbringen. Solche Schlussfolgerungen würden Daten zur Einführung und Bewertung der Modelle erfordern und lassen sich nicht allein aus der Größe des Verzeichnisses ableiten.
Die dritte Quelle ist eine Befragung von mehr als 600 Wissenschaftlerinnen und Wissenschaftlern aus den USA und dem Vereinigten Königreich. Sie gibt Einblick in die Erfahrungen und Schätzungen der Teilnehmenden. Wie diese Antworten einzuordnen sind, hängt davon ab, wie die Personen angeworben wurden, wer geantwortet hat und wie die Fragen formuliert waren. Die hier vorliegenden Quellenangaben reichen nicht aus, um die Repräsentativität der Stichprobe, die Rücklaufquote oder eine mögliche Gewichtung zu beurteilen. Die Antworten sollten daher nicht als Messung der gesamten Wissenschaftsgemeinschaft dargestellt werden.
Was die einzelnen Quellen zeigen können – und was sie nicht belegen
| Quelle | Was sich damit beobachten lässt | Grenze der Aussagekraft |
|---|---|---|
| Interaktionen mit Gemini | Aktivitäten und Interaktionstypen in der erfassten Stichprobe | Entspricht weder der gesamten KI-Nutzung noch belegt sie für sich genommen wissenschaftliche Ergebnisse |
| Verzeichnis spezialisierter Modelle | Verfügbare Werkzeuge für bestimmte Aufgaben oder Fachgebiete | Die Zahl der Modelle misst weder ihre Verbreitung noch ihre Wirksamkeit oder ihren Einfluss |
| Befragung von Forschenden | Erfahrungen und Einschätzungen der Antwortenden | Die Aussagekraft hängt von Stichprobenauswahl, Rücklauf und selbstberichteten Angaben ab |
Fast sieben Stunden pro Woche: eine selbstberichtete Schätzung
Am leichtesten aus dem Zusammenhang zu reißen ist die Angabe, die Befragten sparten nach eigener Aussage fast sieben Stunden pro Woche. Dem Bericht zufolge handelt es sich um eine Schätzung der Teilnehmenden. Sie sollte nicht so wiedergegeben werden, als hätte eine Stoppuhr erfasst, wie lange Aufgaben vor und nach dem Einsatz von KI dauerten. Ebenso wenig ist sie eine unabhängige Messung der Produktivität.
Selbstauskünfte sind nützlich, um zu erfahren, wie Menschen die Wirkung eines Werkzeugs einschätzen. Sie können auch auf konkrete Aufgaben verweisen, die schneller erledigt werden. Zugleich hängen sie vom Erinnerungsvermögen, vom individuellen Verständnis des Begriffs „Zeitersparnis“ und davon ab, mit welcher hypothetischen Situation ohne KI die Befragten ihre Erfahrung vergleichen. Ohne eine beobachtete Ausgangslage lässt sich nicht mit derselben Genauigkeit feststellen, ob die angegebene Ersparnis tatsächlich freigewordener Zeit entspricht.
Aus der Zahl folgt auch nicht, dass alle Forschenden gleich viel Zeit sparen, dass der Effekt in jedem Fachgebiet anhält oder dass die eingesparte Zeit vollständig in zusätzliche Forschung fließt. Ein Teil kann für die Korrektur von Antworten, die Wiederholung von Analysen oder die Überprüfung von Informationen aufgewendet werden. Andere Aufgaben, etwa Verwaltung oder eine erste Erkundung eines Themas, können erleichtert werden, ohne dass sich dadurch der gesamte Forschungszyklus verkürzt.
Die treffendste Formulierung lautet deshalb: Die Befragten schätzen ihre wöchentliche Zeitersparnis auf annähernd sieben Stunden. Um aus dieser Wahrnehmung eine Aussage über Produktivität zu machen, braucht es zusätzliche Evidenz: Längsschnittmessungen, vergleichbare Definitionen der Aufgaben und beobachtbare Ergebnisse. Außerdem braucht es eine Vergleichsgruppe oder eine Ausgangsbasis, anhand derer sich beurteilen lässt, was ohne das Werkzeug geschehen wäre.
Allgemeine und spezialisierte Modelle sind keine austauschbaren Messgrößen
Die Studie führt Angaben zu Gemini und ein Verzeichnis spezialisierter Modelle zusammen. Dabei handelt es sich um zwei unterschiedliche Kategorien. Ein allgemeines Sprachmodell kann für verschiedene Aufgaben eingesetzt werden, etwa zum Verfassen oder Zusammenfassen von Texten. Ein spezialisiertes Modell ist für eine engere Aufgabe oder einen bestimmten Bereich konzipiert. Dass beide zum Bild von KI in der Wissenschaft gehören, bedeutet weder, dass sie dieselben Aufgaben erfüllen, noch, dass sie einander ersetzen oder sich anhand eines einzigen Kennwerts vergleichen lassen.
Die mit der Arbeit von MIT FutureTech verbundene Taxonomie wissenschaftlicher Aufgaben bietet einen Rahmen, um einzuordnen, welche Tätigkeiten als wissenschaftliche Arbeit betrachtet werden. Eine solche Einteilung kann bei der Klassifizierung von Aufgaben helfen. Sie belegt aber nicht, dass KI diese Aufgaben korrekt erledigt oder die Gesamtdauer eines Forschungsvorhabens verkürzt. Bei der Bewertung eines konkreten Werkzeugs kommt es auf die jeweilige Aufgabe, das Fachgebiet, die Bewertungsmaßstäbe und den nötigen menschlichen Eingriff an.
In der Praxis kann der Nutzen sogar innerhalb eines einzelnen Projekts unterschiedlich ausfallen. Ein Werkzeug kann eine Recherche- oder Analysephase unterstützen und zugleich umfangreiche Prüfungen erfordern, bevor seine Ergebnisse in eine experimentelle Entscheidung einfließen. Es genügt daher nicht, allgemein zu fragen, ob ein Modell „für die Wissenschaft nützlich“ ist. Entscheidend ist, für welche Aufgabe, unter welchen Kontrollen und auf Grundlage welcher Leistungsnachweise es eingesetzt wird.
Nützliche Fragen beim Vergleich wissenschaftlicher Werkzeuge
| Frage | Warum sie wichtig ist |
|---|---|
| Welche konkrete Aufgabe übernimmt das Werkzeug? | Verhindert den Vergleich von Werkzeugen mit unterschiedlichen Funktionen und Zielen |
| Wie wird die Ausgabe überprüft? | Berücksichtigt den Aufwand für Kontrolle und Validierung, nicht nur das erste Ergebnis |
| Welches Ergebnis wird bewertet? | Unterscheidet Geschwindigkeit, Genauigkeit, Reproduzierbarkeit und Nutzen für das Projekt |
| Auf wen lassen sich die Ergebnisse übertragen? | Macht deutlich, ob die Evidenz für ein Werkzeug, ein Fachgebiet oder eine größere Gruppe gilt |
Validierung und Experimente bleiben Teil der Arbeit
Der Bericht hält fest, dass die Validierung von Ergebnissen und das Testen von Hypothesen weiterhin Zeit beanspruchen. Das schränkt eine vereinfachende Lesart ein, nach der die Automatisierung eines Prozessschritts die Hindernisse der Forschung beseitigt. Ein Vorschlag der KI muss unter Umständen überprüft werden; eine plausible Hypothese ist noch kein bestätigtes Ergebnis; und eine digitale Analyse ersetzt nicht automatisch Beobachtungen oder Experimente, die zur Beantwortung einer Frage nötig sind.
Besonders relevant ist der Unterschied zwischen digitaler und physischer Arbeit. Die Berichterstattung von Scientific American über die Studie hebt hervor, dass KI bestimmte Forschungsaufgaben beschleunigen kann, ohne dass sich Laborexperimente im gleichen Maß beschleunigen. Das bietet einen hilfreichen Kontext für die Frage nach Engpässen. Ein Medienbericht aus zweiter Hand ersetzt jedoch weder die Daten noch die Methodik des ursprünglichen Berichts.
Auch die klinische Validierung stellt eigene Anforderungen: Eine Idee oder ein vorläufiges Ergebnis belegt nicht, dass eine Intervention bei Menschen sicher oder wirksam ist. Allgemein hängt der Weg von einem Vorschlag zu einer belastbaren Schlussfolgerung von den für das jeweilige Fachgebiet passenden Prüfverfahren ab. Die verfügbaren Quellen erlauben die Aussage, dass Validierung und Experimente weiterhin Arbeit erfordern. Sie reichen aber nicht aus, um den Zeitaufwand der einzelnen Phasen zu beziffern oder allen Fachgebieten denselben Engpass zuzuschreiben.
Eine Abfolge, die Vorschläge von Evidenz unterscheidet
- 01Klären, welche Aufgabe oder Hypothese mit dem Werkzeug bearbeitet werden soll.
- 02Die Ausgabe prüfen und sie mit Methoden und Quellen abgleichen, die für das Fachgebiet geeignet sind.
- 03Die Hypothese, sofern erforderlich, durch Experimente oder klinische Bewertung überprüfen.
- 04Aufwand, durchgeführte Prüfungen und erzielte Ergebnisse getrennt dokumentieren.
Grenzen: Auswahl, geografische Reichweite und Kausalität
Die Befragung umfasst Forschende aus den USA und dem Vereinigten Königreich. Sie sollte deshalb nicht ohne Weiteres als repräsentativ für Forschende in anderen Ländern, Einrichtungen oder Fachgebieten gelten. Unterschiede bei Ressourcen, Werkzeugzugang, beruflichen Standards und Infrastruktur können sich sowohl auf die Nutzung als auch auf die Erfahrungen auswirken. Die bereitgestellten Quellen enthalten hier nicht genügend Angaben, um die Repräsentativität zu beurteilen oder die Antworten auf die gesamte Wissenschaftsgemeinschaft zu übertragen.
Ebenfalls zu beachten ist, wer einer Teilnahme an einer Befragung zu KI zustimmt. Scientific American merkt bei der Einordnung der Studie an, dass eine Rekrutierung über Panels die Teilnahme häufigerer Nutzerinnen und Nutzer solcher Werkzeuge begünstigen könnte. Das ist ein Hinweis auf eine mögliche Auswahlverzerrung, aber kein Beleg dafür, dass die Befragung tatsächlich in eine bestimmte Richtung verzerrt ist. Um das Ausmaß einzuschätzen, wären Angaben zum Rekrutierungsverfahren, zur Rücklaufquote sowie zu den Merkmalen der Teilnehmenden und Nichtteilnehmenden nötig.
Schließlich führt der Bericht verschiedene Arten von Evidenz zusammen. Ein Zusammenhang zwischen KI-Nutzung und angegebener Zeitersparnis beweist jedoch keine Kausalität. Für eine kausale Schlussfolgerung wären Untersuchungsdesigns erforderlich, die den Einfluss des Werkzeugs von anderen Faktoren trennen können – etwa von Vorerfahrung, Aufgabentyp, Personalverfügbarkeit oder Rechenressourcen. Darüber hinaus müssten die Ergebnisse so bewertet werden, dass neben Geschwindigkeit oder wahrgenommener Zeitersparnis auch Qualität und Zuverlässigkeit berücksichtigt werden.
Welche Daten eine belastbarere Schlussfolgerung ermöglichen würden
Eine weiterführende Bewertung könnte vergleichbare Aufgaben über einen längeren Zeitraum erfassen und die anfängliche Bearbeitung von der anschließenden Überprüfung und Validierung trennen. Außerdem sollte sie genau angeben, wer teilgenommen hat, wie diese Personen ausgewählt wurden, welche Fragen sie beantworteten und wie die Antworten ausgewertet wurden. Transparenz in diesen Punkten würde die Beurteilung erleichtern, auf welche Gruppen sich die Ergebnisse übertragen lassen.
Um festzustellen, ob die wahrgenommene Zeitersparnis in zusätzliche Forschung mündet, wären Ergebnisindikatoren erforderlich, die vorsichtig zu interpretieren sind. Dazu könnten die Dauer klar definierter Arbeitsschritte, die Qualität von Analysen, ihre Reproduzierbarkeit oder der Anteil von Ergebnissen gehören, die eine angemessene Validierung bestehen. Kein einzelner Indikator fasst den Wert einer Forschungsarbeit vollständig zusammen. Geschwindigkeit sollte Zuverlässigkeit nicht als Maßstab verdrängen.
Die Schlussfolgerung, die sich aus diesen Quellen ziehen lässt, ist begrenzter, aber dennoch relevant: KI-Werkzeuge werden eingesetzt, und Forschende berichten von einer wahrgenommenen Zeitersparnis. Zugleich bleiben Validierung und Experimente wesentliche Bestandteile des Prozesses. Wie groß der tatsächliche Effekt ist, wie er sich auf verschiedene Fachgebiete verteilt und ob er die wissenschaftliche Produktion beeinflusst, muss durch weitere Messungen geklärt werden. Die fast sieben Stunden als Schätzung der Befragten zu bezeichnen – und nicht als nachgewiesenen Produktivitätsgewinn – bewahrt diese wichtige Unterscheidung.
Offene Fragen
- Die bereitgestellten Quellen reichen nicht aus, um die Repräsentativität der Befragung, ihre Rücklaufquote oder eine mögliche Gewichtung zu beurteilen.
- Aus den verfügbaren Angaben gehen weder die erfassten Zeiträume und Auswahlkriterien noch die Verteilung der 15 Millionen Interaktionen mit Gemini hervor.
- Auf Grundlage der vorliegenden Informationen lässt sich nicht bestimmen, welcher Anteil der angegebenen Zeitersparnis nach Einrechnung von Überprüfung und Validierung tatsächlich frei wird.
- Der Bericht erlaubt für sich genommen nicht den Schluss, dass KI mehr Veröffentlichungen, bessere Ergebnisse oder Entdeckungen verursacht.
- Die sekundäre Berichterstattung weist auf eine mögliche Überrepräsentation häufiger KI-Nutzender im Panel hin. Ihr Ausmaß lässt sich anhand der hier verfügbaren Daten nicht beziffern.
Weiter entdecken
Verwendete Quellen
Korrekturen und Transparenz
Wenn du falsche oder veraltete Angaben findest, sende uns die Seite und die zu prüfende Quelle.
Korrektur vorschlagen