Grenze die Entscheidung ein, die du testen willst
Beim Screening von Titeln und Abstracts wird entschieden, welche Datensätze aus einer bibliografischen Suche die Einschlusskriterien offenbar erfüllen und in die nächste Phase gelangen sollen. Das ist nicht gleichbedeutend mit der endgültigen Feststellung, dass eine Studie geeignet ist: Häufig enthält das Abstract nicht genügend Informationen, sodass für die definitive Entscheidung der Volltext geprüft werden muss. Der hier vorgeschlagene Pilotversuch untersucht deshalb eine klar begrenzte Aufgabe: Datensätze so zu klassifizieren, dass entschieden werden kann, welche anschließend weiter geprüft werden müssen. Er ersetzt weder eine systematische Übersichtsarbeit noch deren Protokoll.
Die praktische Frage lautet nicht: „Kann KI das Screening übernehmen?“, sondern: „Welche Methode unterstützt dieses Team bei diesen Kriterien und diesem Datensatz, ohne das Risiko zu erhöhen, relevante Studien zu übersehen?“ Eine nützliche Antwort berücksichtigt Fehler, Konsistenz, Nachvollziehbarkeit und den menschlichen Arbeitsaufwand. Dass ein Werkzeug schnell ein Label ausgibt, beweist weder, dass dieses Label richtig ist, noch dass die Netto-Zeitersparnis erheblich ist.
Drei Optionen sind zu unterscheiden. Beim manuellen Screening lesen Personen die Datensätze und halten ihre Entscheidungen beispielsweise in einer Tabellenkalkulation fest. Ein spezialisiertes Werkzeug wurde für Aufgaben rund um die Literaturrecherche entwickelt; welche Funktionen es konkret bietet, muss jedoch für das Produkt und die tatsächlich verwendete Version überprüft werden. Ein allgemeines KI-Modell kann angewiesen werden, Texte zu klassifizieren. Es darf aber nicht vorausgesetzt werden, dass es einen geeigneten Screening-Ablauf, ein Entscheidungsprotokoll oder angemessene Kontrollen für eine Übersichtsarbeit bietet. In allen Fällen ist die Konfiguration relevant.
Lege Kriterien und Testfälle fest, bevor du vergleichst
Bevor du ein Werkzeug öffnest, überführe die Fragestellung der Übersichtsarbeit in Ein- und Ausschlusskriterien, die auf einzelne Datensätze angewendet werden können. Lege Population, Intervention oder Exposition, Vergleich, Ergebnisse, Studiendesign, Kontext sowie alle zeitlichen oder sprachlichen Einschränkungen fest, die tatsächlich zum Protokoll gehören. Nicht jeder dieser Aspekte ist für jede Übersichtsarbeit relevant. Entscheidend ist, klar zu formulieren, welche Informationen über die Eignung entscheiden und wie vorzugehen ist, wenn Informationen fehlen.
Ergänze Regeln für mehrdeutige Fälle. Was gilt beispielsweise, wenn das Abstract die Bestätigung eines Kriteriums nicht erlaubt: Wird der Datensatz für die Volltextprüfung beibehalten oder ausgeschlossen? Wie wird eine Studie behandelt, die relevant erscheint, ihr Design aber nicht nennt? Was passiert, wenn der Titel die Kriterien zu erfüllen scheint, das Abstract ihnen jedoch widerspricht? Klärt das Team diese Fragen nicht im Voraus, können zwei Methoden uneinig wirken, obwohl sie in Wirklichkeit unterschiedliche oder unvollständige Regeln anwenden.
Stelle einen Datensatz mit eindeutig geeigneten, eindeutig ungeeigneten und zweifelhaften Beispielen zusammen. Eine institutionelle Anleitung zur Studienauswahl empfiehlt, Kriterien mit Datensätzen aus diesen drei Gruppen zu pilotieren. Hier wird dieser Hinweis für den zusätzlichen Zweck angepasst, verschiedene Alternativen zu vergleichen. Die Titel und Abstracts sollten so erhalten bleiben, wie sie erfasst wurden. Ausnahmen sind notwendige und dokumentierte Änderungen zum Schutz von Daten oder zur Vereinheitlichung des Formats. Wähle nicht nur einfache Beispiele: Der Pilot soll sichtbar machen, wo die Anweisungen nicht ausreichen.
Lege eine Referenzentscheidung durch unabhängige menschliche Prüfung sowie ein Verfahren zur Klärung von Meinungsverschiedenheiten fest. Die Referenz ist keine unfehlbare Wahrheit, sondern eine dokumentierte Entscheidung gemäß dem Protokoll, bei der Unsicherheiten sichtbar bleiben. Wenn Prüfende unterschiedlicher Meinung sind, kläre den Fall, präzisiere die einschlägige Regel und dokumentiere die Änderung. Wende anschließend dieselbe Regel erneut auf alle drei Alternativen an.
Mindestvorbereitung für den Testdatensatz
- 01Friere eine Version der Fragestellung und der Eignungskriterien ein.
- 02Wähle geeignete, ungeeignete und mehrdeutige Datensätze aus und dokumentiere, wie du sie ausgewählt hast.
- 03Bitte zwei Personen, die Kriterien anzuwenden, ohne die Labels der Werkzeuge einzusehen.
- 04Klärt Meinungsverschiedenheiten und bewahrt die Begründung sowie die angewendete Regel auf.
- 05Trenne Datensätze, die zum Anpassen von Anweisungen verwendet werden, von den Datensätzen, die du zur Überprüfung zurückhältst.
Vergleiche die drei Ansätze, ohne ungeprüfte Funktionen zu unterstellen
Das manuelle Screening orientiert sich unmittelbar an den Kriterien des Teams, erfordert aber, dass jede Entscheidung gelesen und dokumentiert wird. Eine Tabellenkalkulation kann Datensätze sortieren und Labels festhalten, wenn das Team sie dafür vorbereitet. Sie liefert jedoch von sich aus weder eine methodische Entscheidung noch eine Lösung für Meinungsverschiedenheiten. Damit der Vergleich fair ist, legst du die Spalten, die zulässigen Labels und die Personen, die Entscheidungen ändern dürfen, vorab fest.
Spezialisierte Werkzeuge sind mögliche Kandidaten für einen Pilotversuch, keine Qualitätsgarantie. Rayyan, Elicit, SciSpace und scite.ai werden in den bereitgestellten Quellen als Werkzeuge im Zusammenhang mit Literaturübersichten oder bibliografischer Analyse genannt. Das kann als Ausgangspunkt für eine Kandidatenliste dienen, bestätigt aber nicht, dass jedes Produkt derzeit ein Screening von Titeln und Abstracts umfasst, dass es dies in einer für dein Protokoll geeigneten Weise tut oder dass die Funktionen unter vergleichbaren Zugangsbedingungen verfügbar sind. Prüfe jede Aufgabe direkt im Produkt und anhand aktueller Dokumentation, bevor du den Test entwirfst.
Ein allgemeines Modell kann sich eignen, um explizite Anweisungen zu den Kriterien auszuprobieren. Das Ergebnis hängt jedoch vom übermittelten Text, den Anweisungen, der Konfiguration und der erzeugten Antwort ab. Gehe nicht davon aus, dass das Modell bei jedem Durchlauf dieselbe Klassifizierung ausgibt, eine überprüfbare Begründung nennt oder einen ausreichenden Verlauf speichert. Prüfe diese Eigenschaften direkt und dokumentiere die sichtbare Version, das Datum und die verfügbaren Parameter. Ändert sich das System zwischen den Durchläufen, gehört diese Variation zum Ergebnis und darf nicht verschwiegen werden.
Verwende für jede Alternative dieselben Eignungsinformationen. Wenn ein Werkzeug keine Entscheidung exportieren, keine Begründung speichern oder eine Konfiguration nicht exakt wiederholen kann, halte dies als operative Einschränkung fest. Versuche nicht, eine fehlende Funktion durch Annahmen darüber zu ersetzen, was der Anbieter vermutlich anbietet.
Erster Vergleich: Was bei jeder Alternative zu prüfen ist
| Ansatz | Was getestet wird | Was nicht vorausgesetzt werden darf | Mindestdokumentation |
|---|---|---|---|
| Manuell mit Tabellenkalkulation | Menschliche Anwendung der Kriterien und ein vereinbarter Ablauf zur Dokumentation. | Dass die Tabelle Konsistenz sicherstellt oder zweifelhafte Fälle klärt. | Entscheidung, prüfende Person, Begründung und Status jedes Datensatzes. |
| Spezialisiertes Werkzeug | Screening-Funktionen, die im Produkt und im Testkonto tatsächlich bestätigt wurden. | Aktuelle Verfügbarkeit, Preis, Export, Begründungen oder Eignung für das Protokoll. | Produkt und Version, Konfiguration, Entscheidungen und überprüfte Exportmöglichkeiten. |
| Allgemeines KI-Modell | Klassifizierung anhand festgelegter Anweisungen zu Titeln und Abstracts. | Wiederholbarkeit, Nachvollziehbarkeit, dauerhafter Zugriff oder ausreichende Genauigkeit. | Sichtbares Modell oder Version, vollständige Anweisungen, Datum, Ausgabe und menschliche Prüfung. |
Entwirf einen vergleichbaren und reproduzierbaren Test
Verwende für alle drei Alternativen denselben Datensatz, dieselben Kriterien und dieselben Regeln für den Umgang mit Unsicherheiten. Formuliere eine einheitliche, verständliche Anweisung. Muss ein Werkzeug das Format anpassen, bewahre die Bedeutung unverändert und dokumentiere die Anpassung. Verbessere die Anweisungen für eine Option nicht erst, nachdem du ihre Fehler gesehen hast, ohne die Tests der anderen Optionen zu wiederholen: Das würde die Alternative begünstigen, die mehr Anpassungen erhalten hat.
Trenne die Entwicklung des Tests von seiner Auswertung. Du kannst eine erste Gruppe von Datensätzen verwenden, um Anweisungen zu präzisieren und Formatprobleme aufzudecken. Halte eine zweite Gruppe zurück, um das Ergebnis mit eingefrorenen Anweisungen zu prüfen. Ist der verfügbare Korpus klein, benenne diese Einschränkung und stelle wenige Fälle nicht als schlüssigen Nachweis einer allgemeinen Leistungsfähigkeit dar. Ziel des Pilotversuchs ist es, für den konkreten Arbeitsablauf des Teams relevante Erkenntnisse zu gewinnen, nicht einen universellen Sieger auszurufen.
Sorge nach Möglichkeit dafür, dass diejenigen, die die Referenzentscheidung festgelegt haben, die Systemlabels nicht zuerst sehen. Vergleiche anschließend jede Ausgabe mit der Referenz und prüfe in der Auswertungsstichprobe alle von einer KI vorgeschlagenen Ausschlüsse manuell. Diese Kontrolle ist besonders wichtig, weil ein falscher Ausschluss eine potenziell relevante Studie aus der weiteren Prüfung entfernen kann. Halte auch Meinungsverschiedenheiten fest: Sie können darauf hinweisen, dass ein Kriterium präzisiert werden muss oder ein Fall eine Schlichtung erfordert.
Prüfe die Wiederholbarkeit, wenn eine Methode unterschiedliche Ausgaben erzeugen kann. Wiederhole einen Teil des Datensatzes mit derselben Konfiguration und vergleiche die Entscheidungen. Lässt sich die Konfiguration eines Werkzeugs nicht festlegen, dokumentiere, welche Kontrollen tatsächlich vorhanden sind. Das Fehlen einer solchen Kontrolle beweist für sich genommen nicht, dass eine Klassifizierung falsch ist. Es begrenzt jedoch, in welchem Umfang sich der Pilotversuch reproduzieren und überprüfen lässt.
Miss Fehler, Konsistenz und Arbeitsaufwand
Reduziere die Bewertung nicht auf eine einzige Trefferzahl. Zähle die falsch ausgeschlossenen Datensätze: Fälle, die eine Alternative ausschließt, obwohl die Referenz sie für die Volltextprüfung beibehält. Zähle auch die falsch eingeschlossenen Datensätze: Fälle, die eine Alternative beibehält, obwohl die Referenz sie ausschließt. Berichte über unklare Fälle und Meinungsverschiedenheiten, die geprüft oder geschlichtet werden mussten. Nenne die jeweiligen Anzahlen zusammen mit der Größe des Datensatzes und erläutere, wie die Referenz zustande kam.
Nicht alle Fehler haben dieselben praktischen Folgen. Für ein Team, das keine möglicherweise relevanten Studien verlieren möchte, kann ein falscher Ausschluss schwerer wiegen als die Prüfung einiger zusätzlicher Datensätze. Diese Gewichtung muss vor der Sichtung der Ergebnisse als Entscheidungskriterium festgelegt werden und darf nicht nachträglich gewählt werden, um die bevorzugte Option zu rechtfertigen. Verlangt das Protokoll unabhängige Entscheidungen durch mehrere Personen, sollte der Pilotversuch diese Anforderung nicht ohne eine genehmigte methodische Begründung ersetzen.
Erfasse die benötigte Zeit getrennt: Vorbereitung, Import, Ausführung, Prüfung der Ausgaben, Klärung mehrdeutiger Fälle sowie Export oder Bereinigung der Daten. Vergleiche den gesamten menschlichen Arbeitsaufwand und nicht nur die Zeit, die ein Werkzeug für die Ausgabe von Labels benötigt. Miss auch, ob das Team nachvollziehen kann, was mit einem Datensatz geschehen ist: wer entschieden hat, welches Kriterium angewendet wurde, auf welche Informationen sich die Entscheidung stützte und ob sie später geändert wurde.
Eine Alternative mit kürzerer anfänglicher Lesezeit kann mehr Aufwand für die Überprüfung verursachen. Umgekehrt kann ein manueller Ablauf bei einem kleinen Korpus oder schwer zu formalisierenden Kriterien einfacher sein. Der Pilotversuch soll diese Kosten im tatsächlichen Arbeitskontext des Teams sichtbar machen. Stelle einen in einem begrenzten Test beobachteten Unterschied nicht als allgemeine Eigenschaft des Produkts dar.
Auswertungstabelle für den Pilotversuch
| Indikator | Welche Frage wird beantwortet? | Wie wird er dokumentiert? |
|---|---|---|
| Falsch ausgeschlossene Datensätze | Wie viele laut Referenz zur Volltextprüfung vorgesehene Datensätze wurden ausgeschlossen? | Anzahl und Liste der Kennungen zur Überprüfung. |
| Falsch eingeschlossene Datensätze | Wie viele laut Referenz ausgeschlossene Datensätze wurden beibehalten? | Anzahl, betroffene Kriterien und geschätzter zusätzlicher Arbeitsaufwand. |
| Unsicherheiten und Meinungsverschiedenheiten | Welche Fälle ließen sich nicht ohne menschliches Eingreifen klären? | Anzahl, Grund, Schlichtung und Änderungen an den Kriterien. |
| Konsistenz | Wurden die Labels bei einer erneuten Ausführung wiederholt? | Anzahl und Art der Entscheidungen, die sich unter dokumentierten Bedingungen änderten. |
| Menschlicher Arbeitsaufwand und Nachvollziehbarkeit | Wie viel Aufwand waren Validierung und Rekonstruktion der Entscheidungen? | Zeit pro Phase und verfügbare Felder für die Prüfung. |
Berücksichtige Grenzen, Daten und Entscheidungen, die Aufsicht erfordern
Ein unvollständiger Titel oder ein unvollständiges Abstract kann entscheidende Informationen verbergen. Fehlt ein Kriterium im Datensatz, kann das System es nicht zuverlässig klären, ohne eine weitere Quelle heranzuziehen. Die Aufforderung, eine Informationslücke zu schließen, kann zu einer sicher klingenden, aber nicht durch den Text gestützten Schlussfolgerung führen. Lege deshalb eine Ausgabe für Unsicherheit fest und verwende sie. Hängt die Eignung von methodischen Details ab, die im Abstract fehlen, behalte den Datensatz für die Volltextphase bei.
Auch die Kriterien können unzureichend operationalisiert sein. Formulierungen wie „relevante Population“ oder „Studie von ausreichender Qualität“ reichen nicht aus, wenn das Team nicht festgelegt hat, welche Textbelege sie erfüllen. Interpretieren Personen und Systeme eine Regel unterschiedlich, sollte die Regel präzisiert werden, bevor das Problem allein dem Werkzeug zugeschrieben wird. Dokumentiere nach jeder Änderung die Version der Kriterien und wende sie anschließend nach einem einheitlichen Verfahren erneut auf den zurückgehaltenen Datensatz an.
Prüfe vor dem Hochladen von Datensätzen die einschlägigen Bedingungen für Zugang, Datenverarbeitung, Speicherung, Aufbewahrung und Wiederverwendung des zu testenden Dienstes. Die bereitgestellten Quellen enthalten keine aktuellen Angaben zu Zugang, Preisen oder Datenverarbeitung der möglichen Produkte; diese Punkte müssen direkt überprüft werden. Enthalten die Materialien sensible Informationen oder gelten institutionelle Einschränkungen, halte dich an die Vorgaben der Organisation und übermittle keine Daten, bevor die Genehmigung vorliegt.
Die Verantwortung für die Genehmigung der Kriterien, die Klärung mehrdeutiger Fälle und die endgültige Entscheidung über die Eignung bleibt beim Team. Eine universitäre Orientierungshilfe zum Einsatz von KI in Evidenzsynthesen stellt den Einsatz solcher Werkzeuge in den Zusammenhang mit fachlichem Urteil. Das ist eine Orientierungshilfe, aber kein Nachweis dafür, dass eine bestimmte Funktion sicher oder wirksam ist. Transparenz bedeutet, festzuhalten, was automatisiert und was geprüft wurde, was sich geändert hat und welche Einschränkungen der Test hatte.
Triff die Wahl anhand einer Entscheidungsmatrix, nicht anhand eines Versprechens
Vergleiche nach Abschluss die Ergebnisse mit den vor dem Pilotversuch vereinbarten Prioritäten. Kann das Team falsch ausgeschlossene Studien nicht tolerieren, scheidet jede Konfiguration aus, die solche Fehler erzeugt, ohne dass eine geeignete Prüfung sie entdecken kann. Ist Nachvollziehbarkeit unverzichtbar, muss der Ablauf das Abrufen der Labels und die Erklärung späterer Änderungen ermöglichen. Ist Zeitersparnis das Ziel, zählt auch die Zeit für die Aufsicht und nicht nur die Ausführungszeit des Werkzeugs.
Behalte das manuelle Screening bei, wenn der Datensatz für das Team handhabbar ist, die Kriterien eine kontextbezogene Auslegung verlangen oder keine automatisierte Alternative die Mindestanforderungen an Sicherheit und Dokumentation erfüllt. Ziehe ein spezialisiertes Werkzeug in Betracht, wenn seine relevanten Funktionen bestätigt wurden, der Test mit den eigenen Datensätzen akzeptable Ergebnisse liefert und sich die Resultate exportieren und überprüfen lassen. Teste ein allgemeines Modell nur mit kontrollierten Anweisungen, genehmigten Daten und ausreichender Prüfung, damit seine Ausgaben nicht ungeprüft zu Ausschlüssen führen.
Sind die Ergebnisse vielversprechend, integriere das Werkzeug als ausdrücklich dokumentierte Änderung des Verfahrens. Halte seine Rolle, die verwendeten Versionen, menschliche Kontrollen, den Umgang mit Meinungsverschiedenheiten und die Korrektur von Fehlern fest. Bewerte den Ablauf erneut, wenn sich Kriterien, Produkt, Modell oder Konfiguration ändern. Reicht die Evidenz nicht aus, benenne die Unsicherheit und erweitere den Pilotversuch, statt zu behaupten, eine Option sei überlegen.
Für die Navigation im redaktionellen Angebot von Inferama lässt sich dieser Leitfaden mit den Seiten „Entdecken“, „Vergleichen“ und „Lernen“ verknüpfen. Diese Navigation ändert nichts am methodischen Maßstab: Die Entscheidung muss durch dokumentierte Ergebnisse des Pilotversuchs und die Anforderungen des Protokolls begründet werden, nicht durch eine Produktbeschreibung oder eine Liste ungeprüfter Funktionen.
Praktische Matrix für die Entscheidung über die nächsten Schritte
| Beobachtetes Ergebnis | Vorsichtige Entscheidung | Bedingung vor dem nächsten Schritt |
|---|---|---|
| Nicht akzeptable oder schwer erkennbare Fehler beim Ausschluss | Menschliche Entscheidung beibehalten; Ausschlüsse nicht automatisieren. | Kriterien und Fehlerfälle überprüfen; einen kontrollierten Test wiederholen. |
| Kontrollierbare Fehler, ausreichende Nachvollziehbarkeit und geringerer Gesamtaufwand | Begrenzten Einsatz als Unterstützung beim Screening erwägen. | Verfahren genehmigen, menschliches Eingreifen dokumentieren und unklare Fälle überwachen. |
| Funktionen oder Bedingungen des Produkts nicht überprüft | Nicht so vergleichen, als sei die betreffende Fähigkeit bestätigt. | Arbeitsablauf, Export, Zugang und Datenverarbeitung direkt prüfen. |
| Schwankende Ergebnisse, kleiner Korpus oder umstrittene Referenz | Unsicherheit benennen und den Pilotversuch erweitern oder neu entwerfen. | Anpassung der Anweisungen und Auswertung trennen; Schlichtungen dokumentieren. |
Offene Fragen
- Die bereitgestellten Quellen bestätigen nicht, welche aktuellen Screening-Funktionen für Titel und Abstracts Rayyan, Elicit, SciSpace oder scite.ai bieten.
- Es liegen keine aktuellen Angaben zu Zugang, Preisen, Nutzungsbeschränkungen oder Richtlinien zur Datenverarbeitung der möglichen Produkte vor.
- Es gibt weder unabhängige Vergleichsergebnisse noch Ergebnisse eines eigenen Pilotversuchs, die eine allgemeine Aussage erlauben würden, welcher Ansatz genauer oder schneller ist.
- Die Qualität der Referenzentscheidung hängt von den Kriterien und dem Schlichtungsverfahren ab, die das jeweilige Team festlegt.
Weiter entdecken
Verwendete Quellen
Korrekturen und Transparenz
Wenn du falsche oder veraltete Angaben findest, sende uns die Seite und die zu prüfende Quelle.
Korrektur vorschlagen