Was verglichen wird – und was sich nicht vorab feststellen lässt
Ein Web-Rechercheassistent ist nicht einfach eine Suchmaschine, die eine Liste von Webseiten ausgibt. Er soll Informationen finden, ordnen und zu einer Zusammenfassung mit Referenzen verarbeiten, die sich von Menschen überprüfen lassen. Die Bewertung sollte deshalb nicht damit enden, festzustellen, dass der Bericht Links enthält. Es muss geprüft werden, ob jede Quelle die Aussage stützt, neben der sie steht, ob relevante Quellen gefunden wurden und ob der Text unterschiedliche Auffassungen korrekt wiedergibt.
Dieser Leitfaden schlägt vor, ChatGPT Deep Research, Gemini Deep Research, Perplexity Pro Search und Claude Research anhand vergleichbarer Aufträge zu prüfen. Er kürt keinen Sieger und behauptet nicht, eine der Anwendungen sei nachweislich präziser, vollständiger oder schneller als eine andere. Die verfügbare Dokumentation beschreibt Funktionen aus Sicht der Anbieter, enthält aber keinen gemeinsamen Vergleichstest für alle vier Produkte. Außerdem liegt in den hier geprüften Quellen keine Dokumentation zu Claude Research vor, mit der sich dessen Optionen, Verfügbarkeit oder Funktionsweise bestätigen ließen. Diese Eigenschaften müssen daher vor Beginn einer Bewertung direkt überprüft werden; Rückschlüsse aus Ähnlichkeiten mit anderen Produkten sind nicht zulässig.
Entscheidend ist der Unterschied zwischen einer angekündigten Funktion und einem nachgewiesenen Ergebnis. Wenn ein Produkt mehrstufige Recherche, Websuche, Quellenauswahl oder Links beschreibt, beweist das nicht, dass es bei einer konkreten Anfrage die besten Quellen gefunden hat. Das lässt sich nur herausfinden, indem man dieselben Aufgaben ausführt, die Testbedingungen dokumentiert und eine Stichprobe der wichtigsten Aussagen manuell überprüft.
Einen fairen und reproduzierbaren Test entwerfen
Ein aussagekräftiger Vergleich beginnt mit der Dokumentation der Testbedingungen, nicht mit einer ungeordneten Sammlung von Screenshots. Notiere Datum und Uhrzeit, den sichtbaren Namen und die Version der verwendeten Funktion, Kontotyp beziehungsweise Tarif, aktivierte Einstellungen, den genauen Wortlaut jedes Auftrags und alle hochgeladenen Dokumente. Bewahre außerdem die vollständigen Ausgaben auf, einschließlich Referenzen, Hinweisen zu Nutzungslimits und Rückfragen. Tarife, Nutzungskontingente und Funktionen ändern sich. Werden sie nicht festgehalten, kann ein Ergebnisunterschied auf den jeweiligen Zugriff und nicht auf das Verhalten des Systems zurückzuführen sein.
Verwende vier Aufträge mit unterschiedlichen Zielen. Bitte bei aktuellen Informationen um eine Angabe mit einem festgelegten Stichtag und einer Primärquelle. Liste bei einer mehrteiligen Frage jede Teilfrage auf und verlange, dass die Antwort erkennen lässt, welche Belege welche Teilfrage abdecken. Lege für eine eingeschränkte Suche im Voraus fest, welche Domains verwendet werden dürfen, und prüfe, ob die endgültigen Referenzen diese Einschränkung einhalten. Verwende für eigene Dokumente dieselbe Datei in allen Anwendungen, die einen Upload erlauben, und verlange, dass der Bericht Belege aus dem Dokument von Web-Belegen unterscheidet. Ist eine Funktion nicht verfügbar, halte sie unter diesen Bedingungen als nicht bewertbar fest. Ersetze sie nicht stillschweigend durch einen anderen Modus.
Der gleiche Wortlaut verringert Unterschiede in der Interpretation, beseitigt sie aber nicht vollständig. Es empfiehlt sich, eine zweite Runde mit einer gleichwertig formulierten Anfrage durchzuführen, um instabile Ergebnisse zu erkennen. Die Aufträge dürfen während des Tests nicht so verändert werden, dass ein Produkt begünstigt wird. Auch Modi oder Tarife, die nicht tatsächlich vergleichbar sind, dürfen nicht als gleichwertig behandelt werden. Lässt sich die Konfiguration nicht angleichen, sollte der Vergleich diese Einschränkung beschreiben, statt sie zu verschweigen.
Mindestprotokoll
- 01Vier Aufträge festlegen: aktuelle Angabe, mehrteilige Recherche, Suche nach Domains und Analyse eigener Dokumente.
- 02Für jedes Produkt Datum, Tarif, Funktion, Sucheinstellungen, Dateien und sichtbare Nutzungslimits notieren.
- 03Denselben Auftrag eingeben, die vollständige Antwort speichern und die Konfiguration während des Durchgangs nicht ändern.
- 04Die zentralen Aussagen anhand der Originalseiten prüfen und korrekte, schwache, irrelevante oder nicht funktionierende Quellenangaben festhalten.
- 05Wichtige Aufträge wiederholen und stabile Unterschiede von Abweichungen zwischen einzelnen Durchläufen trennen.
Was sich bei Quellen, Belegen und Meinungsverschiedenheiten messen lässt
Die Qualität der Referenzen muss Aussage für Aussage bewertet werden. Identifiziere für jeden überprüfbaren Satz im Bericht die zugehörige Quellenangabe und rufe die Originalseite auf. Prüfe, ob die Seite die Angabe tatsächlich enthält, ob sie sich auf dieselbe Population, denselben Zeitraum und denselben Kontext bezieht und ob die Formulierung im Bericht über das hinausgeht, was sich aus der Quelle ableiten lässt. Eine Seite kann für das allgemeine Thema relevant sein und trotzdem die konkrete Zahl oder den vom Assistenten behaupteten Kausalzusammenhang nicht belegen.
Erfasse getrennt, welche Quellenangaben sich öffnen lassen und relevant sind, welche nur einen Teil der Aussage stützen, welche keinen ausreichenden Bezug haben und welche nicht zugänglich sind. Verbindet eine Aussage mehrere Fakten, zerlege sie, bevor du den Beleg bewertest. Eine zusammengefasste Quote ohne diese Prüfung kann irreführend sein: Viele korrekte Referenzen zu nebensächlichen Angaben gleichen eine zentrale, unbelegte Aussage nicht aus.
Auch die Vielfalt der Belege spielt eine Rolle. Eine Primärquelle – etwa eine Rechtsvorschrift, ein ursprünglicher Datensatz oder ein Dokument der für die Daten verantwortlichen Institution – erfüllt nicht immer dieselbe Funktion wie eine journalistische Analyse oder ein wissenschaftlicher Überblick. Nicht jede Frage erfordert eine Primärquelle. Es sollte jedoch festgehalten werden, welche Art von Belegen verwendet wird und ob voneinander unabhängige Quellen vertreten sind. Widersprechen sich zwei Quellen, sollte der Bericht erläutern, worin der Unterschied besteht, warum er auftritt und was sich anhand der verfügbaren Belege nicht klären lässt, statt eine einzelne Darstellung als Konsens auszugeben.
Die Prüfzeit ergänzt die Bewertung. Miss, wie lange eine Person benötigt, um die zentralen Aussagen zu überprüfen, die einschlägige Passage zu finden und zu entscheiden, ob der Beleg ausreicht. Diese Zeit ist kein absolutes Qualitätsmaß: Sie hängt vom Thema, der Zugänglichkeit der Quellen und der Erfahrung der prüfenden Person ab. Für Teams, die unter festen Fristen überprüfbare Berichte erstellen müssen, ist sie dennoch eine wichtige praktische Kennzahl.
Bewertungsmatrix für jeden Bericht
| Kriterium | Worauf zu achten ist | Empfohlene Erfassung |
|---|---|---|
| Abdeckung | Ob der Bericht alle Teile des Auftrags beantwortet und offenlegt, was ungeklärt bleibt. | Abgedeckte, ausgelassene und nicht überprüfbare Teile. |
| Belegkraft der Quellenangaben | Ob die Originalquelle die zugehörige Aussage direkt stützt und dabei den richtigen Umfang und Zeitraum abdeckt. | Direkt, teilweise, unzureichend, irrelevant oder nicht zugänglich. |
| Qualität und Vielfalt | Ob relevante Primärquellen, unabhängige Quellen und abweichende Perspektiven berücksichtigt werden. | Quellentyp, Herkunft und erfasste Meinungsverschiedenheiten. |
| Nachvollziehbarkeit | Wie einfach sich die Quelle öffnen, die relevante Passage finden und der Bezug zu einem Satz verstehen lässt. | Funktionierender Link, auffindbare Passage und Mehrdeutigkeiten. |
| Prüfaufwand | Wie viel Zeit die Überprüfung der wichtigsten Ergebnisse erfordert. | Minuten pro Bericht und festgestellte Schwierigkeiten. |
Vier Aufgaben, die praktische Unterschiede sichtbar machen
Bei der Suche nach einer aktuellen Angabe sollte der Auftrag festlegen, was als aktuell gilt und welche Art von Beleg erforderlich ist. Verlange das Datum der Angabe, die veröffentlichende Stelle und einen Link zur Originalquelle. Prüfe anschließend, ob das System das Veröffentlichungsdatum mit dem Erhebungszeitraum verwechselt, eine vorläufige Zahl als endgültig behandelt oder einen Nachrichtenartikel zitiert hat, der nicht zur Primärangabe führt. Dieser Test untersucht Aktualität und Nachvollziehbarkeit, nicht die allgemeine Recherchefähigkeit.
Formuliere bei einer mehrstufigen Frage eine Liste von Teilfragen und verlange eine Zusammenfassung, in der die Unterschiede zwischen ihnen sichtbar bleiben. Eine flüssig geschriebene Antwort kann verschleiern, dass ein Teil durch solide Belege und ein anderer nur durch eine schwache Quelle gestützt wird. Prüfe außerdem, ob die Schlussfolgerung aus den Quellen folgt oder eine Schlussfolgerung enthält, die nicht als solche gekennzeichnet ist. Um die Prüfung zu erleichtern, sollte jeder wichtige Punkt mit der konkreten Referenz versehen sein, die ihn stützt.
Lege für den Test einer auf bestimmte Websites beschränkten Suche zunächst fest, ob ausschließlich eine Liste von Domains zugelassen werden soll oder ob diese lediglich bevorzugt, andere aber nicht ausgeschlossen werden sollen. Das sind unterschiedliche Vorgaben. Kontrolliere danach die Quellen in der Antwort: Eine Einstellung für bestimmte Websites garantiert für sich genommen nicht, dass alle endgültigen Referenzen von diesen Websites stammen. Die OpenAI-Dokumentation beschreibt für Deep Research eine Suche, die auf vertrauenswürdige Websites eingeschränkt werden kann. Die Gemini-Hilfe dokumentiert Einstellungen und die Auswahl von Quellen. Dabei handelt es sich um Angaben zu beschriebenen Optionen, nicht um einen Nachweis, dass jeder einzelne Durchlauf diese Vorgaben einhält.
Verwende für eigene Dokumente eine Datei ohne sensible Daten, die überprüfbare Aussagen enthält. Bitte den Assistenten ausdrücklich, zwischen Informationen aus dem Dokument und Informationen aus dem Web zu unterscheiden. Prüfe, ob die Quellenangaben zur Datei, zu Webseiten oder zu beidem führen und ob der Bericht jeden Beleg korrekt zuordnet. Die offizielle Gemini-Dokumentation beschreibt Datei-Uploads und die Auswahl von Quellen als Optionen; OpenAI beschreibt ebenfalls die Verwendung bereitgestellter Dateien in Deep Research. Die tatsächliche Verfügbarkeit und das Verhalten müssen im jeweils getesteten Konto bestätigt werden.
Perplexity beschreibt Pro Search als Modus mit Modellauswahl und verschiedenen Suchmodi, darunter Web, Academic, Finance und Files, und erklärt, dass die Antworten auf Originalquellen verweisen. Diese Angaben helfen dabei, einen Test zu entwerfen, der den verwendeten Modus dokumentiert. Sie ersetzen weder die Prüfung der Originalseiten noch erlauben sie eine Vorhersage darüber, welcher Anteil der Quellenangaben korrekt ist. Ein gültiger Vergleich muss Modus, Tarif und Bedingungen erfassen und anschließend jede Referenz nach denselben Maßstäben bewerten, die auch für die übrigen Produkte gelten.
Funktionen und Zugriffsgrenzen richtig einordnen
Offizielle Seiten eignen sich dazu, festzustellen, was Anbieter über ihre Produkte erklären. Sie sind jedoch keine unabhängige Bewertung. OpenAI beschreibt Deep Research als mehrstufigen Rechercheablauf mit Quellenangaben und unterscheidet diese Funktion von einer schnelleren Suche. Auch der Leitfaden der OpenAI Academy erläutert diesen Ablauf. Google gibt an, dass die Google-Suche in Gemini Deep Research standardmäßig als Quelle eingebunden ist, und dokumentiert Optionen zur Auswahl von Quellen, zur Bearbeitung des Rechercheplans und zum Hochladen von Dateien. Perplexity beschreibt Pro Search, dessen Modi und die Verknüpfung mit Originalquellen. Diese Aussagen helfen bei der Konfiguration des Tests; sie rechtfertigen keine Rangfolge der Produkte nach Genauigkeit.
Zugriffsgrenzen müssen Teil der Ergebnisse sein. Halte fest, ob ein Konto die Funktion nutzen kann, welchen Tarif der Anbieter dafür verlangt, welche Nutzungskontingente angezeigt werden und ob Datei-Uploads oder Quellensteuerungen verfügbar sind. Übertrage das Ergebnis eines einzelnen Kontos nicht auf alle Nutzerinnen und Nutzer. Tarifseiten können sich ändern; ein heute genanntes Kontingent darf nicht als dauerhaft dargestellt werden. Prüfe die Bedingungen unmittelbar vor der Veröffentlichung erneut und nenne das Datum dieser Prüfung.
Auch die unter den bereitgestellten Quellen verfügbare wissenschaftliche Evidenz ist begrenzt. Eine arXiv-Studie befasst sich mit der Glaubwürdigkeit von Quellen und der Belegbarkeit von Antworten bei ChatGPT und Perplexity, umfasst jedoch weder Claude noch Gemini. Ihre Ergebnisse gelten für die in dieser Arbeit untersuchten Produkte und Bedingungen. Sie dürfen nicht automatisch auf aktuelle Versionen übertragen und nicht dazu verwendet werden, in diesem Vergleich einen Sieger auszurufen. Eine frühere Studie kann bei der Entwicklung von Kriterien helfen; die Prüfung aktueller Produkte erfordert jedoch eigene Daten und eine ausdrücklich beschriebene Methode.
Insbesondere verhindert das Fehlen einer verifizierten Quelle zu Claude Research, dass dessen Funktionen oder Verfügbarkeit hier als Tatsachen beschrieben werden. Das Tool kann in den Test aufgenommen werden, sobald die offizielle Dokumentation und der aktuelle Zugang bestätigt sind. Bis dahin sind alle Aussagen zu seinen Einstellungen, Quellen oder Quellenangaben noch zu überprüfen. Diese Vorsicht verhindert, dass Informationslücken durch Annahmen gefüllt werden.
Entscheidungsmatrix nach Aufgabe
| Anforderung | Was Vorrang haben sollte | Was vor der Auswahl zu prüfen ist |
|---|---|---|
| Eine aktuelle Angabe finden | Aktualisierungsdatum, Primärquelle und Übereinstimmung zwischen Angabe und Quellenbeleg. | Bezugszeitraum, methodische Änderungen und Zugänglichkeit der Quelle. |
| Eine komplexe Frage recherchieren | Abdeckung der Teilfragen, Umgang mit Widersprüchen und Trennung von Belegen und Schlussfolgerungen. | Ob jede wichtige Schlussfolgerung direkt und ausreichend gestützt ist. |
| Die Suche einschränken | Klare Optionen zum Beschränken oder Priorisieren von Domains und nachvollziehbare endgültige Referenzen. | Ob das System die vereinbarte Liste tatsächlich eingehalten hat. |
| Webinhalte und eigene Dokumente kombinieren | Klare Zuordnung der Belege und Referenzen, über die sich das Originaldokument erneut aufrufen lässt. | Verfügbarkeit des Uploads, Umgang mit Dateien und Unterscheidung zwischen Quellen. |
| Einen überprüfbaren Bericht erstellen | Verständliche Quellenangaben, funktionierende Links und geringer Prüfaufwand. | Tatsächliche Prüfzeit und Anteil der belegten Aussagen. |
Auswählen, ohne einen absoluten Sieger zu küren
Die Wahl hängt von der Aufgabe, dem Risiko eines Fehlers und der verfügbaren Zeit für die Überprüfung ab. Für eine interne Notiz mit geringem Risiko kann ein Bericht genügen, dessen zentrale Aussagen sich leicht kontrollieren lassen. Für eine Veröffentlichung, eine regulatorische Analyse oder eine berufliche Entscheidung kann es nötig sein, Primärquellen gegenzuprüfen, Meinungsverschiedenheiten zu dokumentieren und ein Prüfprotokoll aufzubewahren. Das Tool mit den meisten Links ist nicht automatisch am besten nachvollziehbar, und eine längere Antwort bedeutet nicht zwangsläufig eine vollständigere Recherche.
Lege vor der Einführung einer Lösung eine Mindestschwelle für die Akzeptanz fest. Bestimme beispielsweise, welcher Anteil der zentralen Aussagen direkt belegt sein muss, welche Quellen für bestimmte Datentypen verpflichtend sind und welche Fehler eine erneute Suche erforderlich machen. Die Schwelle sollte sich nach dem geplanten Einsatz richten und für alle Produkte gleichermaßen gelten. Kann ein Tool eine unverzichtbare Bedingung nicht erfüllen – etwa wegen fehlenden Zugriffs, unzureichender Steuerungsmöglichkeiten oder schwacher Quellenangaben –, lautet die angemessene Schlussfolgerung, dass es sich unter den geprüften Bedingungen nicht für diesen Arbeitsablauf eignet. Daraus folgt nicht, dass es generell schlechter ist.
Bewahre Ergebnisse, Anweisungen und Prüfschritte auf, damit sich die Bewertung wiederholen lässt, wenn sich Produkte oder Tarife ändern. Die Matrix dient dazu, beobachtete Belege zu vergleichen; sie macht aus einem kleinen Test keine allgemeingültige Rangliste. Weichen die Ergebnisse zwischen den Durchläufen stark voneinander ab, sollte diese Schwankung genannt werden. Fehlen für ein Produkt Daten, ist der Vergleich als unvollständig zu kennzeichnen. Am besten begründet ist eine Entscheidung, die offenlegt, was getestet wurde, was sich überprüfen ließ und was ungewiss bleibt.
Offene Fragen
- Es wurde keine verifizierte Dokumentation zu Claude Research bereitgestellt. Funktionen, Quellen, Einstellungen und Verfügbarkeit müssen noch überprüft werden.
- Die bereitgestellten Quellen enthalten weder einen aktuellen gemeinsamen Test der vier Produkte noch beobachtete Ergebnisse anhand vergleichbarer Aufträge.
- Tarife, Nutzungskontingente und Zugriffsoptionen können sich ändern. Sie müssen für jedes Konto und zum Redaktionsschluss erneut geprüft werden.
- Produktdokumentation beschreibt die vom Anbieter angegebenen Optionen, erlaubt für sich genommen aber keine Aussage über die Genauigkeit der Quellenangaben oder die Vollständigkeit der Berichte.
Weiter entdecken
Verwendete Quellen
Korrekturen und Transparenz
Wenn du falsche oder veraltete Angaben findest, sende uns die Seite und die zu prüfende Quelle.
Korrektur vorschlagen