Die Architektur ist wichtig, erklärt aber nicht alles
Eine Architektur legt fest, wie Informationen repräsentiert und verarbeitet werden: Welche Elemente einander beeinflussen können, in welcher Reihenfolge Berechnungen stattfinden und welche Teile des Kontexts bei der Ausgabe zur Verfügung stehen. Bei Sprachaufgaben hat das praktische Folgen. Ein Übersetzungssystem muss beispielsweise Wörter der Eingabe mit Wörtern der Ausgabe in Beziehung setzen und eine zusammenhängende Zielsequenz erzeugen.
Eine Architektur erklärt jedoch nicht vollständig, wozu ein System fähig ist. Auch das Trainingsziel, die verfügbaren Daten, der Rechenaufwand und die Anpassung des Modells an eine Aufgabe spielen eine Rolle. Deshalb führt es in die Irre, die Geschichte als Abfolge zu erzählen, in der jedes neue Design das vorherige „übertrifft“ und verdrängt. Häufig verändert sich vor allem das Verhältnis zwischen Vor- und Nachteilen; verschiedene Verfahren bleiben in unterschiedlichen Anwendungsbereichen nützlich.
Maschinelle Übersetzung eignet sich gut, um diese Veränderungen zu untersuchen, denn sie verlangt, mehrere Probleme zugleich zu lösen: Es muss geschätzt werden, welche Ausdrücke einer Sprache denen einer anderen entsprechen, und anschließend muss ein Satz in der Zielsprache entstehen. Sprachmodellierung bietet einen weiteren Untersuchungsfall: Dabei wird gelernt, Sequenzen Wahrscheinlichkeiten zuzuordnen und – bei autoregressiven Modellen – vorherzusagen, welches Token als Nächstes folgen könnte. Anhand dieser Beispiele lassen sich Designentscheidungen vergleichen, ohne Architektur und Aufgabe miteinander zu verwechseln.
Vor rekurrenten Netzen: statistische maschinelle Übersetzung
Bevor neuronale Übersetzungsmodelle wie die in dieser Entwicklungsgeschichte beschriebenen Ansätze aufkamen, wandte ein Forschungszweig statistische Methoden auf das Übersetzungsproblem an. Der Artikel von Peter F. Brown und seinen Mitautoren über statistische Methoden für maschinelle Übersetzung dokumentiert diesen frühen Ansatz. Statt Übersetzung als eine feste Sammlung von handgeschriebenen Sprachregeln zu behandeln, schätzten diese Methoden anhand von Daten probabilistische Beziehungen und suchten auf Grundlage dieser Schätzungen nach einer geeigneten Ausgabe.
Der Unterschied zu einem neuronalen Netz besteht nicht einfach darin, dass ein Ansatz Zahlen verwendet und der andere nicht – beide führen Berechnungen aus. Entscheidend ist vielmehr, wie Beziehungen repräsentiert und die an der Aufgabe beteiligten Komponenten organisiert werden. In einem statistischen System wird das Problem anhand von Wahrscheinlichkeitsmodellen und Verfahren zur Auswahl einer Übersetzung formuliert. In neuronalen Encoder-Decoder-Systemen lernt dagegen ein Netz interne Repräsentationen der Eingabesequenz und nutzt sie, um eine Ausgabesequenz zu erzeugen.
Dieser Ausgangspunkt dient als Vergleichsmaßstab, nicht als vollständige Geschichte der statistischen Übersetzung. Ein grundlegender Artikel erlaubt es, einen konkreten Beitrag zu beschreiben, reicht aber nicht aus, um alle Varianten, produktiv eingesetzten Systeme oder technischen Entscheidungen des Forschungsfelds nachzuzeichnen. Der Übergang zu neuronalen Methoden bedeutet auch nicht, dass frühere Ansätze sofort verschwanden oder dass eine Architektur allein auf jedem Datensatz eine bessere Übersetzung garantierte.
Rekurrenter Encoder-Decoder: kodieren und Schritt für Schritt erzeugen
Die Arbeit von Sutskever, Vinyals und Le untersuchte eine neuronale Encoder-Decoder-Architektur auf Basis von LSTM-Netzen für die Übersetzung vom Englischen ins Französische. Der Encoder verarbeitet die Eingabesequenz, der Decoder erzeugt die Ausgabesequenz. In der im Artikel beschriebenen Form wird die Eingabe durch einen Vektor fester Länge repräsentiert, den der Decoder zur Erzeugung der Übersetzung verwendet.
Dieses Design ermöglichte es, eine Transformation zwischen Sequenzen zu lernen, ohne für jedes Wort eine Zuordnung von Hand entwerfen zu müssen. Encoder und Decoder konnten anhand von Übersetzungsbeispielen nützliche Repräsentationen lernen. Der Vektor fester Länge konzentrierte zugleich sämtliche Informationen des Eingabesatzes in einer Darstellung mit begrenzter Größe. Bei langen Sequenzen oder Informationen, die der Decoder präzise wiederfinden muss, kann das Schwierigkeiten bereiten: Die Repräsentation muss alles enthalten, was für die Erzeugung der Ausgabe erforderlich ist.
Rekurrenz bringt einen weiteren Kompromiss mit sich. Der Zustand, der eine Position verarbeitet, hängt vom vorherigen Zustand ab; die Sequenz wird daher Schritt für Schritt durchlaufen. Diese Struktur bietet eine natürliche Möglichkeit, Eingaben variabler Länge zu verarbeiten und einen Zustand zu bewahren, der das bisher Verarbeitete zusammenfasst. Gleichzeitig begrenzt sie, wie viel entlang der Sequenz parallel berechnet werden kann, denn jeder Schritt benötigt das Ergebnis des vorherigen. Das ist kein abstrakter Nachteil: Es wirkt sich auf die Organisation der Berechnungen und die Kosten des Trainings mit Sequenzen aus.
Es ist wichtig, zwischen den Ergebnissen dieser Arbeit und einer weitergehenden Schlussfolgerung zu unterscheiden. Der Artikel evaluierte eine konkrete Architektur für die Übersetzung vom Englischen ins Französische. Er beweist weder, dass alle rekurrenten Netze Informationen auf dieselbe Weise verdichten, noch, dass ein Vektor fester Länge immer unzureichend ist. Diese Einschränkung motiviert die Untersuchung von Mechanismen, die einen direkteren Zugriff auf die Eingabe ermöglichen; sie beweist nicht, dass Rekurrenz nutzlos wäre.
Ablauf eines rekurrenten Encoder-Decoders
Konzeptionelle Darstellung des in der neuronalen Übersetzung beschriebenen Ablaufs.
- 01Der Encoder durchläuft die Elemente des Eingabesatzes und aktualisiert seinen rekurrenten Zustand.
- 02Die abschließende Repräsentation fester Länge fasst die Eingabe für den Decoder zusammen.
- 03Der Decoder erzeugt die Übersetzung sequenziell. Jeder Schritt hängt vom erhaltenen Kontext und von den bis dahin erzeugten Elementen ab.
Attention: auf die Eingabe zugreifen, ohne die Rekurrenz aufzugeben
Bahdanau, Cho und Bengio schlugen einen Attention-Mechanismus vor, mit dem Ausrichtung und Übersetzung gemeinsam gelernt werden sollten. Die Motivation war, den Engpass zu verringern, der dadurch entsteht, dass der gesamte Ausgangssatz in einem einzigen Vektor fester Länge repräsentiert wird. Statt den Decoder ausschließlich von dieser Zusammenfassung abhängig zu machen, kann der Mechanismus bei der Vorhersage jedes Zielworts relevante Teile der Eingabe suchen.
Anschaulich kann der Decoder verschiedenen Elementen des Ausgangssatzes je nach Generierungsschritt unterschiedliche Bedeutung zuweisen. Wenn er ein bestimmtes Wort erzeugen muss, kann er sich stärker auf einen relevanten Teil der Eingabe stützen als auf den Rest. Dadurch lässt sich die Beziehung zwischen Eingabe und Ausgabe flexibler darstellen; zugleich wird eine Operation im Zusammenhang mit der Ausrichtung explizit, die bei der Übersetzung auf irgendeine Weise gelöst werden muss.
Die Attention aus dieser Arbeit ist noch nicht mit dem Transformer gleichzusetzen. Sie wird in eine Architektur eingebaut, die rekurrente Komponenten beibehält: Sowohl die Verarbeitung der Sequenz als auch die Erzeugung bleiben Schritt für Schritt organisiert. Die wesentliche Änderung besteht darin, dass der Decoder selektiv auf Informationen aus der Eingabe zugreifen kann, statt sie ausschließlich über eine einzige Zusammenfassung zu erhalten. Attention verbessert damit einen Aspekt des Problems – den Zugriff auf die Eingabe –, beseitigt aber nicht die sequenzielle Abhängigkeit rekurrenter Netze.
Dieser Unterschied hilft, eine häufige Vereinfachung zu vermeiden: „Attention“ bezeichnet nicht eine einzige Architektur und bedeutet nicht automatisch vollständige Parallelisierung. Der Begriff kann einen Mechanismus beschreiben, der in Modelle mit weiterhin vorhandener Rekurrenz integriert wird. Um zu verstehen, was sich in einem Design geändert hat, muss man fragen, wo der Mechanismus angewendet wird, auf welche Repräsentationen er zugreift und welche Berechnungen weiterhin von vorherigen Schritten abhängen.
Der Transformer: Self-Attention und ein anderes Verhältnis der Rechenkosten
Der Transformer verarbeitet Sequenzen mithilfe von Attention-Mechanismen und kommt dabei ohne Rekurrenz aus. Der ursprüngliche Artikel untersuchte dieses Design für Aufgaben der maschinellen Übersetzung und stellte einen Encoder und einen Decoder mit Self-Attention-Schichten und Feedforward-Netzen vor. Self-Attention ermöglicht es, dass die Repräsentationen einer Sequenz Informationen von anderen Positionen derselben Sequenz aufnehmen. Im Decoder wird der Zugriff so eingeschränkt, dass Vorhersagen keine zukünftigen Tokens verwenden.
Der Verzicht auf Rekurrenz verändert die Organisation der Berechnung. Während des Trainings lassen sich die Repräsentationen verschiedener Positionen innerhalb einer Schicht parallel berechnen, statt darauf zu warten, dass der jeweils vorherige rekurrente Schritt abgeschlossen ist. Diese Möglichkeit war einer der im ursprünglichen Design hervorgehobenen Vorteile für die Parallelisierung. Das bedeutet nicht, dass alle Vorgänge des Systems gleichzeitig ablaufen: Die Schichten werden weiterhin der Reihe nach aufgebaut, und bei der autoregressiven Erzeugung muss ein Token entstehen, bevor das nächste davon abhängig erzeugt werden kann.
Mit dem Wechsel entstehen auch Kosten. Bei Self-Attention kann jede Position mit vielen anderen Positionen in Beziehung gesetzt werden. Deshalb steigt mit der Sequenzlänge der Aufwand, diese Beziehungen zu berechnen und zu speichern. Die Architektur beseitigt die Rechenkosten also nicht, sondern verlagert, wo sie anfallen. Der ursprüngliche Artikel vergleicht Rechenaufwand, Zahl der sequenziellen Operationen und die Komplexität der Pfade zwischen Positionen und misst außerdem Ergebnisse bei Übersetzungsaufgaben. Diese Vergleiche belegen Vorteile unter den untersuchten Bedingungen, aber keine allgemeingültige Regel für jede Aufgabe oder Sequenzlänge.
Auch sollte man die Entwicklung nicht als abrupten Übergang darstellen. Der Transformer zeigte eine Alternative, die die Parallelisierung während des Trainings nutzen konnte. Rekurrente Netze und andere Verfahren wurden dadurch jedoch nicht unmöglich. Die Wahl einer Architektur hängt von der Aufgabe, der Kontextlänge, den Ressourcen, dem Ziel und dem Trainingssystem ab. Die Geschichte beschreibt eine wichtige Veränderung des Verhältnisses zwischen Kontextzugriff und sequenzieller Ausführung – nicht das automatische Verschwinden aller zuvor verfügbaren Optionen.
Was sich mit Self-Attention ändert
Schematischer Vergleich architektonischer Eigenschaften; keine universelle Rangliste der Leistungsfähigkeit.
| Aspekt | RNN oder rekurrenter Encoder-Decoder | Transformer |
|---|---|---|
| Abhängigkeit zwischen Positionen | Der Zustand einer Position hängt vom Zustand der vorherigen ab. | Self-Attention setzt Positionen innerhalb einer Schicht in Beziehung, ohne sie über einen rekurrenten Zustand zu durchlaufen. |
| Training einer Sequenz | Der rekurrente Ablauf begrenzt parallele Berechnungen zwischen den Schritten. | Positionen einer Schicht können während des Trainings parallel verarbeitet werden. |
| Autoregressive Erzeugung | Die Ausgabe entsteht Schritt für Schritt. | Auch die Ausgabe entsteht Schritt für Schritt, wenn jedes Token von den vorherigen abhängt. |
| Zugriff auf die Eingabe | Kann von rekurrenten Zuständen abhängen oder mit Attention Teile der Eingabe abfragen. | Self-Attention kann Informationen mehrerer Positionen kombinieren; ihre Kosten wachsen mit den Beziehungen zwischen diesen Positionen. |
Autoregressive Modelle vom Typ GPT: Trainingsziel und Architektur
Die GPT-Linie zeigt, warum Architektur und Trainingsziel unterschieden werden müssen. Die OpenAI-Arbeit zum generativen Vortraining beschreibt ein Verfahren in zwei Phasen: zunächst generatives Vortraining mit nicht annotiertem Text, anschließend diskriminatives Fine-Tuning für Aufgaben des Sprachverständnisses. Beim autoregressiven generativen Ziel lernt das Modell, das nächste Token anhand des vorherigen Kontexts vorherzusagen. Bei der Generierung wird dieselbe Abhängigkeit Schritt für Schritt angewendet: Jedes neue Token wird in den Kontext aufgenommen, um das folgende zu erzeugen.
Bei Modellen vom Typ GPT liegt der Schwerpunkt auf dem Decoder und der autoregressiven Vorhersage, statt notwendigerweise einen getrennten Encoder und Decoder für eine Übersetzung aufzubauen. Dadurch kann dieselbe Modellierungsform – eine Sequenz fortzusetzen – als Ausgangspunkt für Sprachaufgaben dienen. Daraus folgt jedoch nicht, dass die Architektur allein allgemeine Fähigkeiten hervorbringt. Das Ergebnis hängt auch vom Text des Vortrainings, vom Umfang und Verfahren des Trainings sowie davon ab, wie die nachfolgende Aufgabe formuliert und bewertet wird.
Vortraining kann Parameter bereitstellen, die anschließend an eine Aufgabe angepasst werden. Es darf jedoch weder mit dem Fine-Tuning selbst noch mit der Evaluation verwechselt werden. „Das Modell wird darauf trainiert, das nächste Token vorherzusagen“ beschreibt ein Trainingsziel. Es bedeutet nicht, dass das Modell jede Anweisung versteht, über aktuelle Informationen verfügt oder jede Aufgabe zuverlässig löst. Für solche Aussagen braucht es Ergebnisse zum konkreten Modell und zur konkreten Aufgabe.
Die Beziehung zwischen Transformer und GPT ist daher nicht die zwischen zwei Synonymen. Transformer bezeichnet eine auf Attention beruhende Architektur; GPT verweist auf eine Familie autoregressiver Modelle und auf einen Ansatz, bei dem auf generatives Vortraining – in der hier angeführten grundlegenden Arbeit – die Anpassung an Aufgaben folgt. Eine Architektur kann mit verschiedenen Zielen eingesetzt werden, und ein Trainingsziel legt nicht allein alle späteren Anwendungen oder Verhaltensweisen fest.
Vom Vortraining zur Aufgabe
Zusammenfassung des im ursprünglichen Artikel zum generativen Vortraining beschriebenen Verfahrens.
- 01Das Modell wird mit nicht annotiertem Text und einem generativen Ziel vortrainiert.
- 02Anschließend wird das Modell gemäß der Formulierung der Arbeit durch diskriminatives Fine-Tuning auf eine nachfolgende Aufgabe vorbereitet.
- 03Das System wird für diese Aufgabe evaluiert. Seine Ergebnisse lassen sich nicht allein aus dem Namen der Architektur oder dem Vortrainingsziel ableiten.
Der übergreifende Vergleich: Was sich änderte und was blieb
Der nützlichste Vergleich ist keine Liste von Gewinnern, sondern eine Reihe von Fragen. Verarbeitet das Modell die Sequenz Schritt für Schritt, oder kann es Repräsentationen mehrerer Positionen parallel berechnen? Wie ruft es Informationen aus der Eingabe ab, wenn es eine Ausgabe erzeugt? Welches Ziel wird optimiert? Welche Kosten entstehen, wenn die Sequenz länger wird? Welcher Teil des Ergebnisses ist auf das Design zurückzuführen und welcher auf Daten, Rechenaufwand oder Anpassung? Mit diesen Fragen lassen sich heutige Systeme untersuchen, ohne anzunehmen, eine einzelne Innovation erkläre ihre gesamte Leistung.
Bei RNNs organisiert der rekurrente Zustand die Informationen und erzeugt Abhängigkeiten zwischen den Schritten. Bei rekurrenten Modellen mit Attention kann der Decoder Teile der Eingabe abfragen, die Rekurrenz bleibt jedoch bestehen. Der Transformer beseitigt diese Rekurrenz und ermöglicht während des Trainings mehr Parallelisierung. Dafür müssen Attention-Beziehungen berechnet werden, deren Kosten mit der Zahl der Positionen wachsen. In einem autoregressiven Modell bleibt die Erzeugung einer Sequenz auch mit einem Transformer Schritt für Schritt organisiert: Die Architektur parallelisiert Teile des Trainings, nicht die logische Abhängigkeit jedes erzeugten Tokens von den vorherigen.
Auch die Notwendigkeit, ein geeignetes Trainingsziel auszuwählen, bleibt bestehen. Ein Encoder-Decoder für Übersetzung und ein Modell, das das nächste Token vorhersagt, werden nicht zwingend auf dieselbe Aufgabe oder dieselbe Weise trainiert. Ebenso unterscheiden sich statistische und neuronale Übersetzung nicht bloß in Geschwindigkeit oder Qualität: Sie organisieren die Schätzungen und Repräsentationen, die zur Ausgabe führen, auf unterschiedliche Weise. Leistungswerte müssen im Zusammenhang mit Datensatz, Versuchsprotokoll und verwendeter Metrik betrachtet werden. Es ist nicht sachgerecht, eine einzelne Messung auf alle Anwendungen zu übertragen.
Die folgende Tabelle fasst allgemeine Kompromisse zusammen. Sie ersetzt weder die Prüfung eines Artikels noch die einer Implementierung: Verschiedene Varianten einer Modellfamilie können diese Kompromisse verändern, und die Evaluierungsbedingungen können das Ergebnis beeinflussen.
Orientierungshilfe für die Auswahl
Praktische Fragen für den Vergleich; keine Empfehlung für eine universell beste Architektur.
| Wenn die Priorität ist … | Zu prüfen ist … | Diese Grenze sollte nicht vergessen werden |
|---|---|---|
| Den Informationsfluss bei einer Übersetzung verstehen | Ob es einen Encoder-Decoder gibt, wie die Eingabe repräsentiert wird und ob der Decoder Attention verwendet. | Weder ein zusammenfassender Vektor noch ein Attention-Mechanismus garantieren für sich eine korrekte Übersetzung. |
| Berechnungen während des Trainings parallelisieren | Ob die Verarbeitung über Schichten hinweg rekurrente Abhängigkeiten zwischen Positionen vermeidet. | Die autoregressive Generierung behält sequenzielle Abhängigkeiten bei; die Kosten der Attention hängen mit der Sequenzlänge zusammen. |
| Vortraining für mehrere Aufgaben nutzen | Welches Ziel und welche Daten verwendet wurden und welches Anpassungsverfahren zum Einsatz kam. | Das Ziel, das nächste Token vorherzusagen, reicht nicht aus, um allgemeine Fähigkeiten oder Zuverlässigkeit zu belegen. |
| Veröffentlichte Ergebnisse vergleichen | Welche Aufgabe, Daten, Metrik und Bedingungen im ursprünglichen Artikel untersucht wurden. | Ein Ergebnis bei Übersetzung oder Sprachverständnis lässt sich nicht automatisch auf andere Aufgaben übertragen. |
Fazit: Die Architektur ist ein Teil der Erklärung
Der Weg von statistischen Übersetzungsmethoden zu autoregressiven Modellen vom Typ GPT ist kein zwangsläufiger Marsch zu einer einzigen Form der Sprachverarbeitung. Der rekurrente Encoder-Decoder lernte eine Transformation zwischen Sequenzen, fasste die Eingabe jedoch in einem Vektor fester Länge zusammen. Attention führte den selektiven Zugriff auf Teile dieser Eingabe ein und behielt die Rekurrenz bei. Der Transformer beseitigte die rekurrente Abhängigkeit bei der Verarbeitung der Positionen und erleichterte die Parallelisierung des Trainings, behielt aber die Kosten der Attention und die schrittweise Generierung einzelner Tokens bei. GPT verband eine autoregressive Architektur mit generativem Vortraining und anschließender Anpassung. Doch weder das Ziel noch die Architektur allein erklären sämtliche beobachteten Fähigkeiten.
Die Entwicklungsgeschichte hilft dabei, konkrete Fragen zu einem heutigen Modell zu stellen: Auf welchen Kontext kann es zugreifen? Welche Teile der Berechnung lassen sich parallelisieren? Wie entsteht die Ausgabe? Welches Ziel wurde trainiert? Sie beantwortet nicht automatisch, ob das Modell genau, sicher oder für einen bestimmten Einsatzzweck geeignet ist. Dafür braucht es Evidenz zum konkreten System und zur konkreten Aufgabe. Wer Architektur, Training und Evaluation auseinanderhält, vermeidet sowohl eine vereinfachende Erzählung von Ablösungen als auch die Zuschreibung sämtlicher Fähigkeiten an eine einzige Innovation.
Wer den Themenkomplex weiter erkunden möchte, kann diesen Überblick mit Grundlagen zu Sprachmodellen, einem Vergleich unterschiedlicher Ansätze und einem Überblick über KI-Verfahren verknüpfen. In jedem Fall ist dieselbe Frage entscheidend: Welche Evidenz beschreibt das Verhalten des Systems, und welcher Teil ist eine Interpretation seines Designs?
Offene Fragen
- Die angeführten Arbeiten sind relevante grundlegende Beispiele, aber keine vollständige Geschichte aller statistischen, rekurrenten oder neuronalen Varianten, die entwickelt wurden.
- Die Aussagen zu Parallelisierung und Leistung des Transformers beruhen auf den Aufgaben und Bedingungen des ursprünglichen Artikels. Sie lassen sich nicht automatisch auf jede Sequenz oder Implementierung übertragen.
- Die Darstellung fasst das Ziel und das Verfahren der ursprünglichen GPT-Arbeit zusammen. Daraus lässt sich weder das Verhalten späterer Modelle noch ihre Zuverlässigkeit in konkreten Anwendungsfällen ableiten.
- Die qualitativen Architekturvergleiche beschreiben allgemeine Kompromisse. Welche Wahl am besten geeignet ist, hängt von Aufgabe, Daten, Ressourcen und Implementierung ab.
Weiter entdecken
Verwendete Quellen
Korrekturen und Transparenz
Wenn du falsche oder veraltete Angaben findest, sende uns die Seite und die zu prüfende Quelle.
Korrektur vorschlagen