Ilustración editorial para De responder a ejecutar: cómo cambió la interfaz entre las personas y la IA
Imagen generada con gpt-image-2.5-sunburst para InferamaQuelle ↗
01

Eine Geschichte danach erzählen, was sich delegieren lässt

Die Geschichte der künstlichen Intelligenz wird oft anhand ihrer Techniken, ihrer Ergebnisse oder der Begeisterungswellen erzählt, die sie begleitet haben. Man kann sie aber auch von einer konkreteren Frage aus betrachten: Was konnte ein Mensch einem System auftragen, und welchen Teil der Aufgabe konnte er ihm überlassen? Diese Perspektive rückt Interaktion und Delegation in den Mittelpunkt, nicht nur die Fähigkeit, eine Antwort zu erzeugen.

Ein überzeugendes Gespräch, eine in ein Produkt integrierte Benutzeroberfläche und eine von Software ausgeführte Handlung sind unterschiedliche Dinge. Im ersten Fall erzeugt das System eine Antwort, die der Mensch verwenden kann. Im zweiten findet der Dialog im Zusammenhang mit den Funktionen eines Dienstes statt. Im dritten kann das System in einen externen Ablauf eingreifen, sofern ihm dafür Werkzeuge und Berechtigungen zur Verfügung stehen. Eine Oberfläche wirkt nicht schon deshalb gesprächsorientiert, weil das System eine Aufgabe von Anfang bis Ende erledigen kann.

Die hier verfügbaren Quellen zeigen verschiedene aktuelle oder als Kontext angeführte Beispiele. Sie dokumentieren jedoch nicht hinreichend detailliert, wann eine gemeinsame historische Abfolge begann und wie sie sich entwickelte. Deshalb vergleicht dieser Beitrag unterschiedliche Interaktionsformen und grenzt ein, was sich über die jeweiligen Beispiele sagen lässt. Er entwirft weder eine universelle Chronologie noch behauptet er, dass jede neue Form zwangsläufig zuverlässiger oder nützlicher ist als die vorherige.

02

Fünf Fragen, um Interaktion und Fähigkeit auseinanderzuhalten

Um Produkte zu vergleichen, ohne ihre Unterschiede zu vermischen, sollte man fünf Dimensionen getrennt betrachten. Die Benutzeroberfläche beschreibt, wie ein Mensch mit dem System kommuniziert. Der Mechanismus gibt – soweit es die Dokumentation zulässt – an, was die Software mit der Anfrage macht. Der Handlungsspielraum klärt, ob das Ergebnis eine Antwort, eine Empfehlung oder ein außerhalb des Gesprächs ausgeführter Vorgang ist. Die Aufsicht umfasst erforderliche Berechtigungen und Bestätigungen. Schließlich macht die verfügbare Evidenz deutlich, ob eine Aussage aus der Produktdokumentation, einer externen Analyse oder einer ausgewerteten Demonstration stammt.

Diese Trennung hilft auch dabei, verwandte Begriffe präzise zu verwenden. Ein Prompt ist eine Eingabe oder Anweisung, die eine Antwort steuert. Ein Agent bezeichnet häufig ein System, das über mehrere Schritte hinweg auf ein Ziel hinarbeitet; die Verwendung des Begriffs ist jedoch nicht einheitlich. Tool-Calling bedeutet, dass ein Modell den Einsatz eines verfügbaren Werkzeugs anfordert. Daraus folgt nicht automatisch, dass das Werkzeug tatsächlich ausgeführt wird, der Vorgang gelingt oder ohne Aufsicht abgeschlossen werden kann. Keiner dieser Begriffe beschreibt für sich genommen die tatsächliche Leistung eines Produkts.

Vergleichsrahmen

Wer dieselben Fragen auf jeden Fall anwendet, vermeidet es, Unterschiede der Benutzeroberfläche in eine Fortschrittswertung umzudeuten.

DimensionPraktische FrageWas sich daraus allein nicht ableiten lässt
BenutzeroberflächeWie übermittelt die Person eine Anfrage und erhält eine Antwort?Dass das System jede Formulierung oder jeden Kontext versteht.
MechanismusBeschreibt die Dokumentation Textgenerierung, Informationsabruf, Regeln oder den Einsatz von Werkzeugen?Dass der interne Mechanismus vollständig bekannt ist oder immer funktioniert.
HandlungAntwortet oder empfiehlt das System, oder verändert es etwas außerhalb des Gesprächs?Dass eine Empfehlung tatsächlich umgesetzt wurde.
AufsichtWelche Berechtigungen, Bestätigungen oder menschlichen Prüfungen sind erforderlich?Dass das System in anderen Zusammenhängen autonom oder sicher ist.
EvidenzSteht die Aussage in der Dokumentation des Anbieters, oder gibt es eine unabhängige Bewertung?Dass die Fähigkeit auf vergleichbare Weise gemessen wurde.
03

Textdialog: Eine Antwort ist noch keine Handlung

Beim Textdialog nimmt die Interaktion die Form von Frage und Antwort an. Die Person schreibt eine Anfrage, das System gibt Text zurück. Als journalistischen Kontext beschreibt BBC Mundo ChatGPT als ein System, das Fragen beantworten oder Inhalte erzeugen kann. Das reicht aus, um eine allgemeine dialogorientierte Nutzung zu skizzieren. Es genügt jedoch nicht, um festzustellen, welcher konkrete Mechanismus eine einzelne Antwort hervorbringt, welche Einschränkungen geprüft wurden oder welche Funktionen zu einem bestimmten Zeitpunkt verfügbar waren.

Diese Unterscheidung ist wichtig, denn eine Antwort kann eine Aufgabe unterstützen, ohne sie auszuführen. Bittet jemand um Hilfe beim Verfassen einer Nachricht, belegt ein Entwurf nicht, dass das System die Nachricht auch versendet hat. Fragt jemand, wie eine Reservierung vorgenommen werden kann, bedeutet eine Anleitung nicht, dass Verfügbarkeiten abgefragt oder eine Reservierung bestätigt wurden. Das sind illustrative Situationen und keine Aussagen über die Funktionen eines bestimmten Produkts.

Ebenso wäre es falsch, allein aus der Bezeichnung Chatbot abzuleiten, dass ein früher textbasierter Dialog zwangsläufig auf Regeln oder Gesprächsskripten beruhte. IBM bietet einen historischen Überblick, der frühe dialogorientierte Chatbots erwähnt. Die hier verfügbaren Angaben erläutern jedoch nicht, wie ein bestimmtes System funktionierte. Ohne Produktdokumentation oder eine direkte historische Quelle lässt sich nicht zuverlässig rekonstruieren, welche Regeln, Datenbanken oder Techniken in einem konkreten Fall zum Einsatz kamen.

Die vergleichende Lehre ist bescheiden, aber nützlich: Ein Gespräch ist eine Zugangsform und kein vollständiger Fähigkeitsnachweis. Um ein System zu bewerten, braucht es Angaben zur Aufgabe, zu akzeptablen Antworten, zu Fehlern und zu den Einsatzbedingungen. Ein flüssiger Austausch ersetzt diese Evidenz nicht.

04

Assistenten in Produkten: Gespräche im Kontext eines Dienstes

Ein in ein Produkt integrierter Assistent verändert den Ort der Interaktion: Die Person kann im Kontext eines bestimmten Dienstes ein Gespräch führen, statt eine separate Benutzeroberfläche zu verwenden. Durch die Integration kann es weniger Schritte erfordern, eine Funktion zu finden oder Hilfe anzufordern. Die Nähe zu den Produktfunktionen beweist jedoch nicht, dass der Assistent auf alle diese Funktionen zugreifen kann, jede Anfrage richtig versteht oder sie ohne Eingreifen ausführt.

Die verfügbaren Adobe-Quellen umfassen einen Leitfaden zur Benutzeroberfläche des KI-Assistenten. Die Dokumentation zum Primo Research Assistant beschreibt ein generatives Werkzeug für Forschungsaufgaben. Diese Materialien eignen sich dazu, Beispiele für Assistenten zu beschreiben, die in Produkte oder Dienste eingebunden sind. Die vorliegenden Informationen legen weder genau fest, welche Funktionen bei ihrer Markteinführung verfügbar waren, noch erlauben sie es, eine Abfolge veränderter Funktionen anhand verifizierter Daten zu rekonstruieren.

Ein anderer Fall wird von Facephi beschrieben: Dort geht es um die Gestaltung einer Entscheidungsoberfläche für Analystinnen und Analysten, die mit KI-Empfehlungen arbeiten. Das verweist auf eine wichtige Produktfrage: Eine Empfehlung anzuzeigen ist nicht dasselbe, wie das Urteil der Person zu ersetzen, die sie erhält. Der Quelle zufolge dokumentiert sie jedoch weder eine historische Entwicklung noch belegt sie für sich genommen die Ergebnisse einer bestimmten Benutzeroberfläche.

Bei der Beschreibung eines integrierten Assistenten sollte man in der Praxis prüfen, welche Informationen er abrufen kann, welche Funktionen verfügbar sind, welches Ergebnis er anzeigt und wer einen Vorgang bestätigt. Dokumentieren die Quellen nur die Benutzeroberfläche oder den allgemeinen Zweck, muss die Beschreibung auf diese Grenzen beschränkt bleiben. Es ist nicht sachgerecht, die Lücken mit der Annahme zu füllen, das System habe Zugriff auf Nutzerdaten oder sämtliche Funktionen des Produkts.

So lässt sich eine integrierte Funktion überprüfen

Dieses Vorgehen hilft dabei, eine dokumentierte Benutzeroberfläche von einer nachgewiesenen Handlung zu unterscheiden.

  1. 01Die in der Dokumentation beschriebene Funktion und, falls verfügbar, ihr Datum oder ihre Version ermitteln.
  2. 02Die angekündigte Fähigkeit von einer tatsächlich beobachteten Handlung unterscheiden.
  3. 03Prüfen, welche Berechtigungen, Daten und Bestätigungen der Vorgang erfordert.
  4. 04Festhalten, was bei einem Fehler, einer mehrdeutigen Anfrage oder unvollständigen Informationen geschieht.
  5. 05Die Schlussfolgerung auf das beschränken, was die Dokumentation oder ein reproduzierbarer Test belegt.
05

Werkzeuge und Handlungen: eine Grenze, die Belege erfordert

Wenn ein System Werkzeuge verwenden kann, kann die Interaktion über die Texterzeugung hinausgehen. Ein Werkzeug kann beispielsweise Informationen abrufen oder einen Vorgang in einem anderen Dienst anstoßen. Dabei darf man mehrere Schritte nicht verwechseln: Das Modell kann einen Werkzeugaufruf vorschlagen; die Software kann ihn überprüfen; ein externer Dienst kann antworten; und möglicherweise muss eine Person das Ergebnis genehmigen. Dass einer dieser Schritte stattfindet, belegt weder, dass alle übrigen abgeschlossen werden, noch dass der Ablauf korrekt ist.

Der Begriff Tool-Calling bezeichnet eine technische Möglichkeit, kein garantiertes Ergebnis. Ein Agent kann mehrere Schritte koordinieren, aber auch diese Bezeichnung belegt nicht, dass das System die richtigen Schritte auswählt, den Kontext beibehält, sich von Fehlern erholt oder rechtzeitig anhält. Um zu belegen, dass ein Produkt eine bestimmte Handlung ausführt, braucht es Quellen, die den Vorgang beschreiben, und nach Möglichkeit eine reproduzierbare Demonstration seiner Grenzen und Voraussetzungen.

Die für diesen Beitrag zusammengestellten Quellen enthalten kein hinreichend detailliertes Beispiel für ein System, das ein Werkzeug aufruft und eine externe Handlung abschließt. Ebenso wenig beschreiben sie für einen solchen Fall Berechtigungen und Bestätigungen. Deshalb wird diese Fähigkeit weder dem Primo Research Assistant noch dem Adobe-Assistenten oder einem anderen genannten Produkt zugeschrieben. Der Vergleich mit dialogorientierten Assistenten dient hier dazu, die zu prüfenden Fragen zu formulieren. Er ist kein Beleg dafür, dass eine neue historische Phase bereits nachgewiesen wurde.

06

Was sich vergleichen lässt – und was nicht

Ein fairer Vergleich würde für jedes System dieselbe Aufgabe und gleichwertige Kriterien verwenden. Man könnte beispielsweise untersuchen, ob eine Person Informationen findet, eine Antwort formuliert oder einen Vorgang abschließt. Zuvor müsste man jedoch konkrete Systeme auswählen, ihre Versionen festlegen und ausreichend Dokumentation beschaffen, um Aufgabe, Berechtigungen, menschliches Eingreifen und Ergebnis zu kennen. Die verfügbare Evidenz erlaubt es nicht, dieselbe Aufgabe für die genannten Beispiele zu rekonstruieren.

Deshalb vergleicht dieser Beitrag Kategorien und Grenzen der Evidenz, nicht die Leistungswerte. Der Kontext von BBC Mundo zu ChatGPT und IBMs Verweis auf dialogorientierte Chatbots liefern allgemeine Hintergrundinformationen. Die Leitfäden von Adobe und Primo dokumentieren konkrete Produkte aus Sicht ihrer Anbieter. Der Beitrag von Facephi bietet Kontext dazu, wie Empfehlungen dargestellt werden und welche Rolle menschliches Urteilsvermögen spielt. Die Quellen unterscheiden sich in Art und Umfang und dürfen nicht so behandelt werden, als wären sie vergleichbare Tests.

Diese Vorsicht beugt drei häufigen Fehlern vor. Erstens darf die Beschreibung einer Funktion nicht mit einer unabhängigen Überprüfung ihrer Leistung gleichgesetzt werden. Zweitens sollte einem Produkt keine Fähigkeit zugeschrieben werden, die in einem Benutzeroberflächen-Leitfaden nicht erwähnt wird. Drittens ist nicht jede Verringerung der nötigen Schritte gleichbedeutend mit „Autonomie“, solange ein Mensch weiterhin die wichtigen Entscheidungen trifft. Integration, Werkzeugzugriff und Ergebnisqualität sind getrennte Variablen.

Welche Aussagen die verfügbaren Quellen erlauben

Der Detailgrad einer Aussage muss zur Art der Evidenz passen. Was nicht dokumentiert ist, sollte nicht durch Annahmen ergänzt werden.

Dokumentiertes BeispielVorsichtige AussageFehlende Informationen
ChatGPT im von BBC Mundo beschriebenen KontextDie Quelle stellt es als System dar, das Fragen beantworten oder Inhalte erzeugen kann.Vergleichbare Bewertungen von Zuverlässigkeit, Mechanismen und externen Handlungen.
Frühe Chatbots im Überblick von IBMDie Quelle erwähnt sie als Teil des historischen Kontexts der KI.Primärdokumentation zu einem bestimmten System und seinen konkreten Mechanismen.
Primo Research AssistantDie Dokumentation des Anbieters bezeichnet ihn als generatives Werkzeug für Forschungsaufgaben.Funktionen bei der Markteinführung, Entwicklung, Einschränkungen und unabhängige Tests.
KI-Assistent von AdobeDie Quelle ist ein Leitfaden zur Benutzeroberfläche des Produkts.Eine Funktionschronologie und Belege für die Ausführung konkreter Handlungen.
Von Facephi behandelte EntscheidungsoberflächeDie Quelle befasst sich mit der Darstellung von Empfehlungen für Analystinnen und Analysten sowie mit menschlichem Urteilsvermögen.Eine historische Bewertung oder vergleichbare Produktergebnisse.
07

Mehr Interaktionsmöglichkeiten sind kein gemessener Fortschritt

Eine Benutzeroberfläche kann es einer Person erleichtern, ein Anliegen auszudrücken. Ein integrierter Assistent kann Unterstützung neben den Funktionen eines Dienstes bereitstellen. Ein Werkzeug kann Software ermöglichen, auf ein anderes System einzuwirken. Jede dieser Veränderungen erweitert oder ordnet die Interaktionsmöglichkeiten neu. Für sich genommen belegt keine davon eine allgemeine Verbesserung von Zuverlässigkeit, Nutzen oder Autonomie.

Um eine messbare Verbesserung zu belegen, müsste man genau festlegen, welche Aufgabe geprüft wird, was als erfolgreicher Abschluss gilt, welche Fehler zählen, welches Maß an Aufsicht zulässig ist und mit welchen Systemen der Vergleich erfolgt. Außerdem müsste die beobachtete Leistung von der kommerziellen oder dokumentarischen Beschreibung einer Funktion unterschieden werden. Fehlen diese Angaben, kann sich eine Aussage auf eine bequemere Benutzeroberfläche oder einen größeren Handlungsspielraum beziehen – aber nicht auf eine allgemein höhere Fähigkeit.

Unsicherheiten sind kein Mangel, den man verbergen müsste. Sie markieren, was Leserinnen und Leser aus den verfügbaren Unterlagen ableiten können. Hier gibt es Beispiele für Gespräche, für Assistenten in Diensten und für die Gestaltung rund um Empfehlungen. Es fehlt jedoch eine einheitliche Grundlage, um eine Folge von Produkten nachzuzeichnen oder ihre Ergebnisse vergleichend zu bewerten. Die Übersicht ist deshalb eine Sammlung von Fragen und Unterscheidungen, keine Rangliste von Systemen.

08

Entscheidend ist, was delegiert wird – und mit welchen Belegen

Wer die Entwicklung der KI aus der Perspektive der Interaktion betrachtet, kann wichtige Veränderungen erkennen, ohne sie als unvermeidliche Stufenleiter zu behandeln. Eine Antwort anzufordern, einen Assistenten innerhalb eines Produkts zu nutzen und einen Vorgang zu delegieren sind unterschiedliche Erfahrungen. Um zu wissen, wie stark sich die Fähigkeiten tatsächlich verändert haben, muss man konkrete Funktionen, ihre Zeitpunkte, Berechtigungen, Bestätigungen und das Verhalten bei Fehlern nachverfolgen.

Mit der verfügbaren Evidenz lassen sich Textdialog, integrierte Assistenz und die grundsätzliche Möglichkeit des Werkzeugeinsatzes unterscheiden. Nicht belegt ist, dass die genannten Beispiele drei aufeinanderfolgende Phasen darstellen, dass dieselbe Aufgabe in jeder Phase besser abgeschlossen wurde oder dass die erwähnten Systeme externe Handlungen ausführen. Diese Grenze beizubehalten macht den Vergleich nützlicher: So wird eine neue Benutzeroberfläche nicht mit einer nachgewiesenen Fähigkeit verwechselt.

Wenn künftige Produktversprechen behaupten, ein System könne etwas bereits „tun“, bleibt eine praktische Frage entscheidend: Was genau hat es unter welchen Bedingungen getan, wer hat es bestätigt und wo ist der Vorgang dokumentiert? Die Antwort hilft dabei, zu unterscheiden, was das System vorschlägt und was es tatsächlich ausführt – und was eine neue Benutzeroberfläche von einer gemessenen Verbesserung unterscheidet.

Offene Fragen

  • Die verfügbaren Quellen legen nicht fest, welche Funktionen der Primo Research Assistant bei seiner Markteinführung hatte, und beschreiben seine Entwicklung nicht.
  • Der Adobe-Leitfaden identifiziert eine Benutzeroberfläche, belegt für sich genommen aber weder eine Funktionschronologie noch die Ausführung von Handlungen.
  • IBMs Überblick ist eine Sekundärquelle; die bereitgestellten Informationen reichen nicht aus, um die Mechanismen eines bestimmten historischen Chatbots zu rekonstruieren.
  • Die bereitgestellten Quellen bieten keine ausreichende Evidenz, um dieselbe Aufgabe bei den drei Interaktionsformen zu vergleichen.
  • Es wird hier kein überprüfbarer Fall dokumentiert, in dem ein Werkzeugeinsatz mit Berechtigungen und Bestätigungen eine externe Handlung abschließt.
09

Weiter entdecken

09

Verwendete Quellen

03

Korrekturen und Transparenz

Wenn du falsche oder veraltete Angaben findest, sende uns die Seite und die zu prüfende Quelle.

Korrektur vorschlagen