Wissensdestillation im maschinellen Lernen: Wie ein Schülermodell von einem Lehrermodell lernt – und was das nicht garantiert
01

Definition in einem Satz

Técnica para entrenar un modelo menor usando señales, distribuciones o ejemplos producidos por otro modelo más capaz.

02

Definition: Signale von einem Lehrermodell auf ein Schülermodell übertragen

Wissensdestillation ist eine Familie von Verfahren des maschinellen Lernens, bei denen ein Schülermodell darauf trainiert wird, Signale eines Lehrermodells zu nutzen. In der üblichen Konstellation ist das Lehrermodell größer und das Schülermodell kleiner. Das Ziel ist, dass das Schülermodell für eine bestimmte Aufgabe lernt – nicht, dass es die Parameter oder den internen Prozess des Lehrermodells wörtlich kopiert.

Der Begriff „Wissen“ kann den Eindruck erwecken, es werde eine vollständige und klar abgegrenzte Vorstellung davon übertragen, was das Lehrermodell weiß. Präziser ist es, von Trainingssignalen zu sprechen: von Informationen, die sich aus Antworten, Repräsentationen oder Beispielen ableiten und zum Anleiten des Schülermodells verwendet werden. Welche Signale geteilt und wie sie genutzt werden, hängt vom jeweiligen Verfahren ab.

Wissensdestillation ist kein einzelner Algorithmus mit einem allgemeingültigen Rezept. Die wissenschaftliche Literatur fasst unterschiedliche Konzepte und Techniken unter diesem Begriff zusammen; Übersichtsarbeiten ordnen sie aus verschiedenen Blickwinkeln. Wenn ein Modell als „destilliert“ bezeichnet wird, sollte man deshalb nachfragen, welches Lehrermodell, welche Signale, welche Daten und welches Trainingsziel konkret gemeint sind.

03

Wie das allgemeine Verfahren funktioniert

Am Anfang eines Destillationsverfahrens stehen die Abgrenzung der Aufgabe und die Festlegung des gewünschten Ergebnisses. Anschließend wählt man ein Lehrermodell aus oder trainiert eines und bestimmt, welche Signale das Schülermodell anleiten sollen. Je nach Verfahren wird das Schülermodell mit diesen Signalen, mit den ursprünglichen Labels oder mit einer Kombination aus beidem trainiert. Zum Schluss prüft man, ob das Ergebnis die für den Einsatz relevanten Anforderungen erfüllt.

Diese Abfolge ist eine allgemeine Beschreibung und keine vollständige Spezifikation sämtlicher Verfahren. Bei manchen Ansätzen steht das Lehrermodell bereits fest und seine Signale werden vorab vorbereitet; bei anderen ist die Interaktion zwischen Lehrer- und Schülermodell Teil des Trainings. Auch die verfügbaren Daten, die Architektur des Schülermodells und die Funktion zur Messung des Lernerfolgs können sich unterscheiden. Ein Tutorial, das eine konkrete Variante implementiert, sollte daher nicht als Beispiel für jede Form der Destillation verstanden werden.

Entscheidend ist, dass das Schülermodell anhand von Informationen lernt, die mit dem Lehrermodell verknüpft sind. Das bedeutet weder, dass seine Antworten stets mit denen des Lehrermodells übereinstimmen müssen, noch, dass die übertragenen Signale alles umfassen, was das Lehrermodell leisten könnte. Die Evaluation muss sich auf die Aufgabe und die Einsatzbedingungen beziehen – nicht nur darauf, ob das Training einem Verfahren mit der Bezeichnung „Destillation“ folgte.

Konzeptioneller Ablauf

  1. 01Aufgabe und Einschränkungen des Schülermodells festlegen.
  2. 02Lehrermodell auswählen und bestimmen, welche Signale verfügbar sein werden.
  3. 03Schülermodell mit den gewählten Signalen und gegebenenfalls mit Labels oder weiteren Daten trainieren.
  4. 04Leistung und Einschränkungen des Schülermodells unter den vorgesehenen Bedingungen messen.
04

Welche Signale übertragen werden können

Eine Möglichkeit ist, das Schülermodell mit Ausgaben des Lehrermodells zu trainieren. Bei einer Klassifikationsaufgabe kann eine Ausgabe beispielsweise abgestufte Kompatibilitätswerte für mehrere Klassen enthalten, statt nur die wahrscheinlichste Klasse auszugeben. Das ist eine andere Form der Aufsicht als ein einzelnes Label. Ob dieser Unterschied nützlich ist, hängt von der Aufgabe, der Erzeugung der Ausgaben und ihrer Verwendung im Training ab.

Andere Verfahren können Zwischenrepräsentationen des Lehrermodells nutzen, also interne Werte, die mit bestimmten Verarbeitungsschritten zusammenhängen. Auch Beispiele, die das Lehrermodell auswählt oder erzeugt, können verwendet werden. Diese Kategorien sind nicht austauschbar: Sie bezeichnen unterschiedliche Signalquellen und können unterschiedliche Trainingsverfahren erfordern. Wird eine davon genannt, lässt sich daraus nicht ableiten, dass auch die anderen zum Einsatz kommen.

In der Beschreibung eines konkreten Verfahrens sollte stehen, welches Signal verwendet wird. Wird lediglich berichtet, dass eine Destillation stattgefunden hat, lässt sich nicht erschließen, ob das Schülermodell Ausgaben, Repräsentationen, Beispiele oder eine Kombination daraus erhalten hat. Übersichtsarbeiten belegen, dass es unterschiedliche Ansätze gibt; die Einzelheiten der jeweiligen Implementierung müssen jedoch anhand der Beschreibung des Verfahrens überprüft werden.

Signale: was sie beitragen können – und was sie allein nicht belegen

SignaltypMöglicher Beitrag zum TrainingWas sich daraus nicht automatisch ableiten lässt
Ausgaben des LehrermodellsAntworten oder abgestufte Kompatibilitätswerte, die das Schülermodell anleiten.Dass das Schülermodell sämtliche Antworten oder Fähigkeiten des Lehrermodells reproduziert.
ZwischenrepräsentationenAusgewählte interne Informationen, die zum Lernziel gemacht werden.Dass das Schülermodell dieselbe Architektur oder denselben internen Prozess hat.
Ausgewählte oder generierte BeispieleEingaben und, je nach Verfahren, Antworten, die zum Training genutzt werden.Dass die Beispiele die gesamte Einsatzverteilung abbilden oder für eine Verallgemeinerung ausreichen.
05

Drei anschauliche Beispiele – keine dokumentierten Anwendungsfälle

Die folgenden Szenarien veranschaulichen das Prinzip. Es handelt sich um hypothetische Beispiele zur Erklärung des Konzepts, nicht um Behauptungen über veröffentlichte Ergebnisse oder um Garantien dafür, dass eine konkrete Destillation auf diese Weise funktioniert.

In jedem Fall müssen die übertragenen Signale und die Messung des Ergebnisses genau festgelegt werden. Die Bezeichnung einer Technik ersetzt diese Informationen nicht.

06

Was Wissensdestillation nicht ist: Fine-Tuning, Quantisierung und synthetische Daten

Fine-Tuning bezeichnet häufig das Fortsetzen des Trainings eines Modells mit Daten aus einer bestimmten Aufgabe oder Domäne. Dafür ist nicht zwingend ein Lehrermodell erforderlich: Ein Modell kann anhand verfügbarer Beispiele und Labels angepasst werden, ohne Signale eines anderen Modells nachzuahmen. Die Lehrer-Schüler-Beziehung ist dagegen kennzeichnend für die Destillation, auch wenn ein konkretes Verfahren sie mit gelabelten Daten oder anderen Trainingsformen kombiniert.

Bei der Quantisierung wird die numerische Darstellung von Modellparametern oder Aktivierungen verändert, sodass Werte mit geringerer Präzision dargestellt werden. Das ist eine andere Technik als das Training durch die Übertragung von Signalen eines Lehrer- auf ein Schülermodell. Beides kann in einem System kombiniert werden, aber das eine impliziert nicht das andere: Ein Modell zu quantisieren bedeutet nicht allein deshalb, es zu destillieren.

Bei der Erzeugung synthetischer Daten werden künstliche Beispiele erstellt. Ein Lehrermodell kann an der Erzeugung oder Auswahl von Beispielen beteiligt sein, die anschließend zum Training des Schülermodells dienen. Das Erzeugen von Beispielen reicht jedoch nicht aus, um ein Verfahren als Destillation zu beschreiben. Entscheidend ist, welche Rolle das Lehrermodell spielt und welches Signal übertragen wird. Ein synthetischer Datensatz könnte auch ohne ein Training verwendet werden, bei dem ein Schülermodell Signale des erzeugenden Modells nutzt.

Praktische Abgrenzungen

BegriffWelche Frage hilft er zu beantworten?Bezug zur Wissensdestillation
Fine-TuningMit welchen Daten wird das Modell weitertrainiert?Kann mit Destillation kombiniert werden, erfordert aber definitionsgemäß kein Lehrermodell.
QuantisierungMit welcher Präzision werden bestimmte Modellwerte dargestellt?Ist eine andere Transformation; sie kann zusammen mit einem destillierten Schülermodell eingesetzt werden.
Erzeugung synthetischer DatenWie wurden die Trainingsbeispiele erzeugt?Kann Beispiele liefern, definiert für sich allein aber keine Lehrer-Schüler-Beziehung.
07

Grenzen und häufige Missverständnisse

Ein häufiges Missverständnis ist die Annahme, Destillation übertrage das gesamte Wissen des Lehrermodells. Das Schülermodell wird nur mit den ausgewählten Signalen und Daten sowie für die festgelegten Ziele trainiert. Es kann für eine bestimmte Aufgabe nützliche Antworten lernen, ohne andere Fähigkeiten des Lehrermodells zu erwerben. „Destilliert“ sollte deshalb nicht als Synonym für „gleichwertig“ verstanden werden.

Ein weiterer Fehlschluss ist, aus dem Begriff auf Effizienz zu schließen. Dass ein Lehrermodell üblicherweise größer als ein Schülermodell ist, erklärt, warum Destillation gemeinsam mit Modellkompression untersucht wird. Die relative Größe allein bestimmt aber nicht die Kosten des Gesamtsystems im Produktivbetrieb. Architektur, Hardware, Implementierung, Nutzungsvolumen und Qualitätsanforderungen können die Messwerte beeinflussen. Diese müssen in der vorgesehenen Umgebung erhoben werden.

Ebenso wenig sollte man annehmen, dass es nur eine Art von Signal gibt oder dass alle Varianten nach denselben Kriterien verglichen werden. Fachliteratur beschreibt das Gebiet als vielfältig; technische Tutorials veranschaulichen jeweils bestimmte Verfahren. Um ein Ergebnis einzuordnen, braucht man mindestens Angaben zur Aufgabe, zum Lehrer- und Schülermodell, zu den verwendeten Signalen und zur Evaluationsmethode.

Schließlich kann „Modelldestillation“ im weiteren Sinn auch den Transfer von Fähigkeiten durch Abfragen eines Systems bezeichnen. Diese allgemeine Beschreibung reicht nicht aus, um die verwendete Trainingsmethode zu bestimmen, und erlaubt keine Rückschlüsse darauf, welche internen Signale verfügbar waren. Es ist sinnvoll, eine weit gefasste Beschreibung des Phänomens von der technischen Spezifikation eines konkreten Trainingsverfahrens zu unterscheiden.

08

Verwandte Begriffe und praktische Prüffragen

Dieser Glossareintrag behandelt Wissensdestillation als allgemeinen Begriff. Er ist nicht mit dem gesonderten Beitrag zur Destillation mit privilegierten Informationen zu verwechseln, der ein bestimmtes Risiko beim Training von Agenten behandelt und einen anderen Schwerpunkt hat. Dass beide Beiträge das Wort „Destillation“ verwenden, bedeutet nicht, dass sie dasselbe Problem beschreiben.

Wer eine Forschungsarbeit oder ein technisches Angebot prüft, sollte fragen: Welche Aufgabe wird destilliert? Was sind Lehrer- und Schülermodell? Welche konkreten Signale erhält das Schülermodell? Mit welchen Daten wird es trainiert und womit wird es verglichen? Wurden Qualität und Einschränkungen in der vorgesehenen Umgebung gemessen? Außerdem sollte klar sein, ob „Destillation“ eine detailliert beschriebene Technik bezeichnet oder nur eine allgemeine Beschreibung des Transfers durch Abfragen ist.

Als Orientierung für die weitere Lektüre hilft eine wissenschaftliche Übersichtsarbeit dabei, die Vielfalt der Methoden einzuordnen. Ein PyTorch-Tutorial wiederum ist nützlich, um die dort implementierte Variante zu verstehen, nicht aber, um das gesamte Forschungsfeld abzubilden. Weiterführende Informationen finden sich im Glossarindex, im Eintrag zur Destillation und im Vergleichsindex, sofern diese in der internen Navigation verfügbar sind. Die praktische Schlussfolgerung ist einfach: Der Begriff bezeichnet eine Familie von Strategien; Aussagen zu Wirksamkeit, Fähigkeiten oder Effizienz müssen dagegen für jede evaluierte Implementierung gesondert belegt werden.

Kurze Checkliste zur Bewertung einer Destillationsbehauptung

  1. 01Aufgabe und vorgesehenen Einsatz bestimmen.
  2. 02Lehrer, Schülermodell, Daten und übertragene Signale genau benennen.
  3. 03Gemessene Ergebnisse von Erwartungen unterscheiden, die mit der Methode verbunden sind.
  4. 04Qualität, Kosten und Einschränkungen unter repräsentativen Einsatzbedingungen prüfen.
  5. 05Alle Einzelheiten, die in der technischen Quelle nicht spezifiziert sind, als Unsicherheit behandeln.
09

Kurze Beispiele

10

Verwandte Begriffe

11

Verwendete Quellen