Ilustración editorial para Cómo evaluar si Lyria 3.5 sigue instrucciones musicales
Imagen generada con gpt-image-2.5-sunburst para InferamaQuelle ↗
01

Was eine veröffentlichte Evaluation aussagen kann

Bei der Evaluation eines Musikgenerators müssen zwei Fragen auseinandergehalten werden, die oft vermischt werden: Klingt das Audio angenehm oder überzeugend? Und erfüllt der Song die Vorgaben? Eine positive Antwort auf die erste Frage belegt nicht die zweite. Eine Produktion kann ausgefeilt klingen und trotzdem die gewünschte Bridge auslassen, mitten in einem Abschnitt das Instrument wechseln oder eine Textvorgabe ignorieren. Umgekehrt kann ein Song mehrere Anforderungen erfüllen, ohne bei den Hörenden besonders beliebt zu sein.

Die offizielle Model Card von Lyria 3.5 ist ein Ausgangspunkt, um zu verstehen, welche Evaluationen der Anbieter angibt. Der verfügbaren Beschreibung zufolge umfasst sie menschliche und automatische Bewertungen, Tests innerhalb und außerhalb der Verteilung sowie Aspekte der Prompttreue und der Modellgrenzen. Das hilft dabei, Fragen dazu zu stellen, was gemessen wurde. Für sich genommen reicht es jedoch nicht, um ein Experiment vollständig nachzuvollziehen: Dazu müssen die aktuellen Einzelheiten des Verfahrens, die Bewertungsanweisungen, Größe und Zusammensetzung der Stichproben sowie die Generierungsbedingungen geprüft werden.

Auch Googles Ankündigung zu Lyria 3.5 beschreibt vom Anbieter angegebene Änderungen bei Musikalität, Texten, Gesang, Prompttreue sowie der Kontrolle von Tempo und Dauer. Das sind Aussagen des Anbieters über das System. Sie sind weder eine unabhängige Messung noch ein Beleg dafür, dass jede konkrete Anweisung mit einer bestimmten Rate befolgt wird. Für ihre Interpretation muss bekannt sein, wie die einzelnen Fähigkeiten operationalisiert wurden und ob die Ergebnisse für den Kanal und die Version gelten, die tatsächlich eingesetzt werden sollen.

Die Empfehlung BS.1534 der ITU kann die Gestaltung subjektiver Audioevaluationen unterstützen, hat aber nicht den Zweck, direkt zu messen, ob ein Modell einem musikalischen Prompt gefolgt ist. Ähnlich bieten Arbeiten wie MusicEval und MusicGen nützliche Anknüpfungspunkte für menschliche Bewertungen sowie für Fragen zu Qualität und Prompttreue. Sie sind jedoch keine direkten Belege für die Leistung von Lyria 3.5. Der in diesem Artikel beschriebene Ablauf ist ein methodischer Vorschlag: Er schreibt Lyria keine Ergebnisse zu, die von den verfügbaren Quellen nicht dokumentiert werden.

02

Vor der Generierung die Testeinheit festlegen

Die grundlegende Testeinheit sollte weder vage als „guter Song“ noch schlicht als „Prompt“ definiert werden. Sinnvoll ist es, eine Anweisung, eine unter einer konkreten Bedingung erzeugte Ausgabe und eine explizite Liste überprüfbarer Anforderungen zu erfassen. Werden mit derselben Anweisung mehrere Generationen erstellt, ist jedes Audio eine eigene Beobachtung. Zusammen erlauben sie eine Untersuchung der Variabilität, dürfen aber nicht zu einer Auswahl der besten Beispiele werden.

Damit die Befolgung überprüfbar ist, müssen allgemeine Formulierungen in beobachtbare Kriterien übersetzt werden. „Es soll filmisch klingen“ kann als subjektive Einschätzung erhalten bleiben, ist ohne gemeinsam festgelegte Definition aber kein binär prüfbarer Test. Dagegen lässt sich die Vorgabe „zwischen dem zweiten Refrain und dem Schluss eine instrumentale Bridge einfügen“ hinsichtlich Vorhandensein und Position bewerten – vorausgesetzt, die Struktur des Audios ist erkennbar. Ist sie mehrdeutig, müssen Bewertende jedoch „nicht bestimmbar“ angeben können, statt zu einer Entscheidung gezwungen zu werden.

Jeder Datensatz sollte den exakten Modellnamen und die Modellversion, den Zugangskanal, das Ausführungsdatum, den Wortlaut des Prompts und die verfügbaren Einstellungen festhalten. Wenn sich über den verwendeten Kanal Parameter festlegen oder protokollieren lassen, die die Generierung beeinflussen, müssen diese ebenfalls dokumentiert werden. Die Dokumentation für Google AI für Entwickler nennt das stabile Modell `lyria-3.5`. Diese Kennung ist ein Beispiel für die Angaben, die festgehalten werden sollten – keine Garantie dafür, dass alle Kanäle dieselben Einstellungen anbieten.

Außerdem sollte im Voraus feststehen, was als teilweise Erfüllung gilt. Wird ein Instrument „während des gesamten Songs“ verlangt, sollte ein kurzes Auftreten nicht als vollständige Erfüllung gewertet werden. Bei Strukturvorgaben ist es hilfreich, zwischen dem Vorhandensein eines Abschnitts, der Reihenfolge der Abschnitte und den Übergängen zwischen ihnen zu unterscheiden. Andernfalls können zwei Bewertende dasselbe Gesamturteil aus völlig unterschiedlichen Gründen vergeben.

Mindestangaben für einen Test

  1. 01Den genauen Wortlaut des Prompts aufbewahren und in einzelne Anforderungen aufteilen.
  2. 02Modell, Zugangskanal, sichtbare Version, Datum und verfügbare Parameter dokumentieren.
  3. 03Jede Generation speichern – auch Ausgaben, die Vorgaben verfehlen oder eine niedrige Qualität aufweisen.
  4. 04Jeder Audiodatei eine Kennung zuweisen und den Bewertenden die Versuchsbedingung nicht offenlegen.
  5. 05Erfüllung pro Anforderung, Entscheidungssicherheit und Grund für Uneinigkeit festhalten.
03

Einfache, kombinierte und widersprüchliche Prompts entwerfen

Mit einfachen Tests lässt sich herausfinden, ob ein einzelnes Merkmal zuverlässig beurteilt werden kann. Beispiele wären die Aufforderung, ein Instrumentalstück mit leichter Perkussion zu erzeugen, oder ein Lied mit einer Leadstimme und einer ruhigen Atmosphäre. Solche Prompts belegen keine allgemeine Kontrollierbarkeit, sondern prüfen nur eine konkrete Bedingung. Damit ein positives Ergebnis nicht auf einer zu weiten Auslegung beruht, sollte die Anweisung alles Nötige enthalten, aber keine zusätzlichen Adjektive, die später nicht bewertet werden.

Kombinierte Prompts prüfen, ob mehrere Anforderungen gleichzeitig erfüllt werden können. Eine Anweisung könnte einen Song mit Strophe, Refrain und Bridge verlangen, dazu eine Basslinie, die in allen drei Abschnitten erhalten bleibt, ein moderates Tempo und einen Text ohne Markennamen. Jedes Element wird separat bewertet. So lässt sich erkennen, ob das Modell zwar die Struktur erfüllt, aber an der Textvorgabe scheitert – anstatt den Gesamteindruck pauschal als „ziemlich prompttreu“ zu bezeichnen.

Tests außerhalb der Verteilung müssen operational definiert werden: etwa durch weniger verbreitete Anweisungen, ungewöhnliche Kombinationen oder eine Beschreibung eines Merkmals, die im Hauptdatensatz nicht vorkommt. Sie sollten nicht pauschal als „Generalisierungstests“ bezeichnet werden, ohne anzugeben, wodurch sie sich unterscheiden. Sie sind separat auszuweisen und als Belastungstest zu analysieren. Andernfalls könnten sie ohne Kontext mit dem regulären Test vermischt werden und einen Messwert scheinbar erhöhen oder senken.

Auch widersprüchliche Anweisungen verdienen eine eigene Kategorie. Wer gleichzeitig einen Song „ohne Gesang“ und einen gesungenen Text verlangt, stellt unvereinbare Anforderungen. Das Ergebnis sollte nicht so bewertet werden, als gäbe es genau eine richtige Antwort. Die Evaluation kann untersuchen, ob das System den Widerspruch erkennt, eine Vorgabe der anderen vorzieht oder eine mehrdeutige Ausgabe erzeugt. Die Bewertungsregel muss jedoch vor dem Anhören feststehen. Ohne eine solche Regel können Bewertende ihre Kriterien nachträglich an das Ergebnis anpassen.

04

Die Dimensionen in den Ergebnissen getrennt halten

Ein aussagekräftiger Bericht sollte mindestens vier Ergebnisbereiche getrennt ausweisen. Der erste ist die Befolgung der Anweisungen: ob eine einzelne Vorgabe vorkommt, in welchem Maß und mit welchen konkreten Hinweisen. Der zweite ist die wahrgenommene musikalische Qualität. Sie kann Einschätzungen zu Kohärenz, Komposition oder Gefallen umfassen, sofern diese ausdrücklich als subjektive Urteile und nicht als Überprüfungen des Prompts ausgewiesen werden. Der dritte Bereich betrifft die technische Audioqualität, etwa hörbare Aussetzer oder Verzerrungen. Der vierte ist die Stimmqualität, wenn Gesang vorkommt: Verständlichkeit, Stabilität und wahrgenommene Eignung sind andere Fragen als die, ob eine Stimme enthalten ist, wenn sie verlangt wurde.

Diese Bereiche sollten nicht zu einer einzigen Note zusammengeführt werden. Ein aggregierter Mittelwert kann den wichtigen Fall verbergen, in dem ein Song hohe Gefallenswerte erreicht, aber die Hälfte der strukturellen Anforderungen verfehlt. Ebenso kann er kaschieren, dass zwei Audios mit demselben Gesamtergebnis an unterschiedlichen Merkmalen scheitern. Verteilungen und Ergebnisse pro Anforderung machen solche Muster sichtbar, ohne den Eindruck zu erwecken, eine Dimension könne eine andere automatisch ausgleichen.

Eine verblindete Hörbewertung kann manche Verzerrungen reduzieren: Bewertende sollten nicht wissen, welcher Prompt zu welchem Audio geführt hat, welche Generation das Team bevorzugt oder welche Hypothese gerade geprüft wird. Die Reihenfolge der Hörbeispiele sollte variieren, während die Bewertungsanweisungen gleich bleiben. Sehen die Bewertenden den Text oder den Prompt, ist die Bewertung hinsichtlich dieser Informationen nicht mehr verblindet. Wenn diese Informationen für die Bewertung erforderlich sind, sollte genau angegeben werden, was verborgen blieb und was nicht.

Ein Bewertungsraster braucht konkrete Anker. Für das Vorhandensein eines Instruments könnte es beispielsweise zwischen „nicht vorhanden“, „nur kurz erkennbar“, „in einem Teil des Songs vorhanden“ und „in den angegebenen Abschnitten vorhanden“ unterscheiden. Bei der Struktur könnten die einzelnen Abschnitte samt Reihenfolge erfasst und zusätzlich eine Option für „nicht bestimmbar“ angeboten werden. Solche Anker müssen mit Bewertenden erprobt werden; sie sind kein universell validiertes Bewertungssystem für jede Art von Musik.

Was gemessen werden kann – und was daraus nicht folgt

DimensionMögliche BeobachtungWas allein keine ausreichende Schlussfolgerung ist
Befolgung von AnweisungenVorhandensein, Fehlen, Position oder Kontinuität jeder einzelnen AnforderungDass der Song angenehm klingt
Wahrgenommene musikalische QualitätMenschliche Einschätzungen zu Komposition, Kohärenz oder GefallenDass alle Anforderungen erfüllt wurden
Technische AudioqualitätHörbare Probleme wie Aussetzer oder VerzerrungenDass die Musik musikalisch überzeugend ist
Text und StimmeTextvorgaben, Verständlichkeit oder das verlangte Vorhandensein von GesangDass auch die übrige Struktur eingehalten wurde
05

Menschliches Bewertungsraster und Uneinigkeit zwischen Bewertenden

Eine verblindete Hörbewertung ist nicht automatisch zuverlässig. Vor dem Haupttest sollte eine Kalibrierung mit Übungsbeispielen erfolgen. Dabei lässt sich prüfen, ob die Definitionen ähnlich verstanden werden. So können Mehrdeutigkeiten sichtbar werden – etwa die Frage, was als „durchgängiges Instrument“ gilt. Ziel ist nicht, legitime Unterschiede im Musikgeschmack zu beseitigen. Kriterien für die Befolgung sollten sich auf beobachtbare Hinweise beziehen, nicht darauf, ob eine bewertende Person den Song gerne hört.

Jedes Merkmal sollte von mehr als einer Person unabhängig bewertet werden. Dabei sind die Einzelurteile aufzubewahren. Der Bericht sollte Übereinstimmung oder Uneinigkeit pro Dimension ausweisen und nicht nur eine Gesamtkennzahl. Er kann Anteile übereinstimmender Urteile sowie ein zur Art der Skala passendes Übereinstimmungsmaß angeben und dessen Definition erläutern. Ist der Datensatz klein oder treten manche Kategorien nur selten auf, sollte auch diese Einschränkung genannt werden, statt Schätzungen mit nur scheinbarer Präzision darzustellen.

Uneinigkeit ist selbst eine methodische Information. Wenn ein Teil der Hörenden die Bridge erkennt und ein anderer nicht, ist der Übergang möglicherweise schwer abzugrenzen oder das Bewertungsraster legt nicht genau fest, was als Bridge gilt. Gehen die Einschätzungen zur Atmosphäre auseinander, hängt das Merkmal vielleicht von Vorlieben oder kulturellen Bezugspunkten ab, die im Protokoll nicht definiert wurden. Abweichende Urteile sollten nicht automatisch per Mehrheitsentscheid aufgelöst und anschließend verschwiegen werden. Eine nachträgliche Schlichtung kann sinnvoll sein, muss aber getrennt von den ursprünglichen Bewertungen ausgewiesen werden.

Die Empfehlung BS.1534 der ITU behandelt die subjektive Bewertung der Audioqualität unter kontrollierten Bedingungen. Sie kann dazu anregen, die Vorbereitung und Präsentation von Hörbeispielen sorgfältig zu planen. Sie darf jedoch nicht als Validierung eines Bewertungsrasters zur Befolgung musikalischer Anweisungen dargestellt werden. Die Frage „Klingt das gut?“ und die Frage „Ist das Instrument in den angegebenen Abschnitten zu hören?“ erfordern unterschiedliche Fragen, Anker und Auswertungen.

06

Automatisierung: begrenzte Prüfungen statt Ersatz fürs Zuhören

Automatische Audioanalyse kann nützlich sein, wenn die Frage eng gefasst ist und die Methode dafür ausreichend valide ist. Die Dauer lässt sich etwa mit einem Zielwert vergleichen, wenn ein messbares Audiosignal und eine festgelegte Toleranz vorliegen. Auch das Vorhandensein einer Stimme oder die ungefähre Erkennung bestimmter Merkmale kann mit geeigneten Werkzeugen untersucht werden. Jedes dieser Werkzeuge kann jedoch falsch positive und falsch negative Ergebnisse liefern. Die Kennzeichnung eines Detektors beweist für sich genommen nicht, dass eine Person dasselbe Merkmal wahrnimmt.

Tempo, Instrumentierung und Struktur lassen sich schwieriger universell prüfen. Ein Schätzverfahren kann Schläge pro Minute ermitteln, ohne damit zu belegen, dass die Musik die gewünschte Wirkung hat. Eine Klangerkennung legt nicht zwangsläufig fest, welches Instrument eine hörende Person identifiziert. Und Intensitätswechsel kennzeichnen nicht automatisch Strophe, Refrain oder Bridge. Für eine verantwortungsvolle technische Evaluation müssen Methode, Gültigkeitsbereich, Unsicherheit und die gegenüber menschlichen Annotationen beobachteten Fehler beschrieben werden.

Textvorgaben lassen sich nur dann anhand einer Transkription und einer Suche überprüfen, wenn der Text mit ausreichender Genauigkeit erkannt wird. Dass ein Wort in der Transkription fehlt, beweist nicht, dass es im Audio nicht vorkommt. Schlägt ein Werkzeug eine Übereinstimmung vor, sollte die betreffende Stelle angehört und der Kontext geprüft werden, bevor die Vorgabe als erfüllt oder verletzt markiert wird. Insbesondere belegt eine automatische Analyse ohne Fehler nicht, dass keine Markennamen genannt wurden.

Es geht nicht darum, Automatisierung auszuschließen, sondern sie als ergänzenden Hinweis zu verwenden und klar anzugeben, was sie belegt. MusicEval untersucht die automatische Evaluation generierter Musik und deren Verhältnis zu Expertenbewertungen. Solche Forschung kann zu einer vorsichtigen Interpretation anregen, validiert aber nicht automatisch ein bestimmtes Werkzeug zur Messung von Lyria 3.5. Wurde eine Metrik nicht mit der konkreten Aufgabe abgeglichen, sollte sie als explorativer Hinweis und nicht als endgültiger Beweis ausgewiesen werden.

Validitätsprüfung für eine automatische Metrik

  1. 01Das genaue zu messende Merkmal und den Anwendungsbereich des Werkzeugs definieren.
  2. 02Die Ergebnisse des Werkzeugs in einer passenden Stichprobe mit unabhängigen menschlichen Annotationen vergleichen.
  3. 03Falsch positive und falsch negative Ergebnisse sowie Fälle ohne eindeutige Entscheidung erfassen.
  4. 04Automatische Ergebnisse als Unterstützung verwenden, wenn sie für die Aufgabe valide sind – nicht als Ersatz fürs Zuhören.
  5. 05Unsicherheit beschreiben und aus einer technischen Erkennung keine musikalische Qualität ableiten.
07

Variabilität, schwierige Fälle und Ergebnisdarstellung

Eine einzelne Generation reicht nicht aus, um die Konsistenz eines Modells einzuschätzen. Für jeden Prompt sollte das Team im Voraus festlegen, wie viele Generationen erstellt werden, und denselben Plan auf alle Bedingungen anwenden. Eine universelle Zahl lässt sich ohne Kenntnis der Kosten, der erwarteten Variabilität und des Studienzwecks nicht empfehlen. Die Entscheidung muss begründet und veröffentlicht werden. Nur die gelungensten Ausgaben auszuwählen, verzerrt das Ergebnis zugunsten einer Auswahlleistung statt der Wahrscheinlichkeit, mit der eine gewöhnliche Generation die Vorgaben erfüllt.

Die Analyse sollte die Erfüllung pro Anforderung und Prompt sowie die Variation zwischen Generationen ausweisen. Bei der Struktur kann sie beispielsweise zeigen, welcher Anteil der Audios die verlangten Abschnitte enthält und wie viele die vorgesehene Reihenfolge einhalten. Bei Instrumenten lässt sich zwischen anfänglichem Vorhandensein und Kontinuität über die angegebenen Abschnitte hinweg unterscheiden. Fehlende oder nicht bestimmbare Daten dürfen nicht stillschweigend als Erfolg oder Misserfolg gewertet werden.

Ergebnisse aus kombinierten Prompts sollten nur vorsichtig mit denen einfacher Prompts verglichen werden. Scheitert eine lange Anweisung häufiger, kann das auf Schwierigkeiten beim Zusammenspiel mehrerer Anforderungen hindeuten. Ebenso kann es jedoch an mehrdeutigeren Formulierungen, Wechselwirkungen zwischen Merkmalen oder strengeren Anforderungen im Testdatensatz liegen. Die Interpretation sollte sich auf die dokumentierten Beobachtungen stützen und keine Ursache behaupten, die das Studiendesign nicht unterscheiden kann.

Der Bericht sollte repräsentative Beispiele für Erfolge, Fehlschläge und Uneinigkeit enthalten und nicht nur die überraschendsten Fälle auswählen. Ein angenehmer Song, in dem die Bridge fehlt, veranschaulicht, warum Qualität und Befolgung getrennte Achsen sind. Eine automatische Erkennung eines Instruments, das die Hörenden nicht lokalisieren können, zeigt, warum das Werkzeug das Zuhören nicht ersetzt. Keines dieser Beispiele belegt für sich genommen die allgemeine Leistungsfähigkeit des Modells.

Diese Ergebnisse sollten veröffentlicht werden

ErgebnisEmpfohlene AufschlüsselungZu benennende Einschränkung
BefolgungPro Anforderung, Prompt und AnweisungstypWie teilweise Erfüllung definiert wurde
KonsistenzVariation zwischen Generationen mit demselben PromptAnzahl der Generationen und Auswahlregel
StrukturVorhandensein, Reihenfolge und Kontinuität der AbschnitteFälle, in denen die Struktur nicht erkennbar ist
Menschliche BewertungEinzelurteile und Uneinigkeit pro MerkmalSchulung, Verblindung und Schlichtungsverfahren
AutomatisierungVerwendete Methode und Vergleich mit menschlichen AnnotationenNicht validierte oder nicht messbare Merkmale
08

Reproduzierbarkeit und praktische Entscheidungskriterien

Ein Protokoll ist besonders nützlich, wenn andere die Bedingungen nachvollziehen können. Werden Prompts, Bewertungsraster, Anweisungen für Bewertende, Ein- und Ausschlussregeln, Modellversion und verwendeter Zugangskanal veröffentlicht, lässt sich prüfen, was tatsächlich evaluiert wurde. Wenn Zugang oder geltende Nutzungsbedingungen die Weitergabe der Audios verhindern, sollte diese Einschränkung erläutert und alles veröffentlicht werden, was geteilt werden darf. Vor der Veröffentlichung von Texten, Stimmen oder anderem Material muss außerdem geprüft werden, ob Veröffentlichung und Wiederverwendung mit den einschlägigen Rechten und Bedingungen vereinbar sind. Es darf nicht angenommen werden, dass jedes generierte Material ohne Einschränkungen weiterverbreitet werden kann.

Die genaue Modellidentifikation ist wichtig, weil eine Evaluation von Version und Kanal abhängt und nicht allein vom Produktnamen. Wird das stabile Modell `lyria-3.5` über die API ausgeführt, sollten dieser Kanal und die verfügbaren Einstellungen dokumentiert werden. Ein Ergebnis aus einem Zugangskanal darf nicht ohne entsprechende Vergleichsdaten als Garantie für ein identisches Verhalten über einen anderen Kanal dargestellt werden.

Für Produktionsteams sollte die praktische Entscheidung nicht auf einer allgemeinen Punktzahl beruhen. Ausgangspunkt sind die Anforderungen, die im konkreten Arbeitsablauf tatsächlich wichtig sind. Anschließend ist zu prüfen, welche Merkmale direkt gemessen wurden und wie stark die Ergebnisse zwischen Generationen schwanken. Ist die Kontinuität eines Instruments entscheidend, gleicht eine hohe subjektive Bewertung wiederholte Fehler bei dieser Kontinuität nicht aus. Unterliegt der Text strengen Einschränkungen, braucht es eine gezielte Prüfung statt des allgemeinen Eindrucks, der Song habe „den Prompt befolgt“.

Der wichtigste Beitrag eines Benchmarks zur Anweisungsbefolgung besteht nicht darin, ein Modell für gut oder schlecht zu erklären, sondern seine Erfolgsbedingungen und Fehlermuster sichtbar zu machen. Für Lyria 3.5 bedeutet das, die geprüften Anweisungen zu beschreiben, Befolgung und wahrgenommene Qualität getrennt auszuweisen, alle vorgesehenen Generationen aufzubewahren und Unsicherheit als Teil des Ergebnisses zu behandeln. Der Benchmark-Index kann als Kontext für solche Evaluationen dienen. Ein reproduzierbarer Test muss sich jedoch auf sein eigenes Protokoll, seine Daten und seine Grenzen stützen.

Offene Fragen

  • Die bereitgestellten Quellen nennen nicht alle Prompts, Stichprobengrößen, Metriken und Verfahren der offiziellen Evaluationen von Lyria 3.5 im Detail. Diese Angaben müssen anhand der jeweils aktuellen Model Card überprüft werden, bevor konkrete Ergebnisse zugeschrieben werden.
  • Es gibt keine universell passende Zahl von Generationen oder Bewertenden für alle Studien. Sie muss abhängig von Ziel, Aufwand und beobachteter Variabilität begründet werden.
  • Die Validität automatischer Werkzeuge zur Erkennung von Tempo, Instrumenten, Struktur oder Textvorgaben hängt vom jeweiligen Werkzeug und der konkreten Aufgabe ab und muss mit menschlichen Annotationen abgeglichen werden.
  • Zugangsbedingungen, verfügbare Parameter und Veröffentlichungsrechte können je nach Generierungskanal variieren und müssen für jede Ausführung geprüft werden.
09

Weiter entdecken

09

Verwendete Quellen

03

Korrekturen und Transparenz

Wenn du falsche oder veraltete Angaben findest, sende uns die Seite und die zu prüfende Quelle.

Korrektur vorschlagen