Synthetische Daten: Was sie sind, wie sie erzeugt werden und was sie nicht garantieren
01

Definition in einem Satz

Datos generados artificialmente para entrenar, probar o simular escenarios cuando se controla su procedencia y calidad.

02

Definition: künstlich erzeugte Daten für einen bestimmten Zweck

Synthetische Daten sind künstlich erzeugte Daten, die Merkmale oder Eigenschaften realer Daten mit unterschiedlicher Genauigkeit nachbilden, sofern diese für einen bestimmten Anwendungsfall relevant sind. Das Wort „synthetisch“ beschreibt, wie die Daten entstanden sind. Es bescheinigt weder ihre Qualität noch ihre Eignung für beliebige Aufgaben oder ihre Anonymität.

Entscheidend ist die Unterscheidung zwischen dem Ursprung und den Eigenschaften eines Datensatzes. Ein synthetischer Datensatz wird nicht unmittelbar als Beobachtung des realen Phänomens erhoben, sondern mithilfe eines Generierungsverfahrens erstellt. Damit er einem bestimmten Zweck dient, kann es wichtig sein, bestimmte Muster der Referenzdaten zu bewahren, etwa Zusammenhänge zwischen Variablen oder das Vorkommen relevanter Fälle. Was erhalten bleiben muss, hängt von der Aufgabe ab. Es gibt keine einzelne Eigenschaft, die jeden synthetischen Datensatz nützlich macht.

Die spanische Datenschutzaufsichtsbehörde Agencia Española de Protección de Datos (AEPD) beschreibt synthetische Daten als künstlich erzeugte Daten und weist darauf hin, dass für einen bestimmten Anwendungsfall Eigenschaften und Merkmale realer Daten erhalten bleiben müssen. Diese an den jeweiligen Nutzen gebundene Bedingung bedeutet nicht, dass das Ergebnis jeden Aspekt des ursprünglichen Datensatzes genau abbildet oder kein Datenschutzrisiko aufweist.

Die Aussage „Dieser Datensatz ist synthetisch“ beantwortet daher allenfalls eine Frage nach seinem Ursprung. Um beurteilen zu können, was sich damit tun lässt, muss man wissen, mit welchem Verfahren er erzeugt wurde, welche Aspekte der Referenzdaten erhalten bleiben sollten und welche Prüfungen für den vorgesehenen Einsatz vorgenommen wurden.

03

Wie Erzeugung und Validierung geplant werden

Ein Projekt mit synthetischen Daten beginnt mit dem Zweck, nicht mit der Wahl eines Werkzeugs. Ein Datensatz, der sich zum Testen einer Software eignet, muss nicht ebenso gut dafür geeignet sein, einen Trend zu schätzen, seltene Fälle zu untersuchen oder ein Wahrnehmungssystem zu trainieren. Bevor Daten erzeugt werden, sollte deshalb geklärt werden, welche Entscheidung, Prüfung oder Forschung unterstützt werden soll.

Als Nächstes wird festgelegt, welche Eigenschaften für diesen Zweck wichtig sind. Das können die Datenstruktur, Zusammenhänge zwischen Feldern oder Beispiele für bestimmte Situationen sein. Das allgemeine Kriterium „Die Daten sollen ähnlich sein“ reicht nicht aus: Es muss konkretisiert werden, welche Ähnlichkeit nützlich wäre und wie sie überprüft werden soll. Die verfügbaren Quellen nennen weder eine universelle Liste relevanter Eigenschaften noch eine für alle Anwendungen gültige Metrik.

Anschließend wird das Generierungsverfahren ausgewählt und dokumentiert. Die vorliegenden Quellen bestätigen, dass Daten künstlich erzeugt werden, und verweisen auf algorithmische Generierung. Sie reichen jedoch nicht aus, um eine umfassende technische Taxonomie aufzustellen oder konkrete Verfahren miteinander zu vergleichen. Bei der Prüfung eines Datensatzes ist es deshalb verlässlicher, nach einer Beschreibung des tatsächlich verwendeten Verfahrens zu fragen, als dieses allein aus der Bezeichnung „synthetisch“ abzuleiten.

Zum Schluss wird das Ergebnis im Hinblick auf den vorgesehenen Zweck bewertet und werden mögliche Folgen für den Datenschutz gesondert untersucht. Eine Messung statistischer Ähnlichkeit, sofern sie vorgenommen wurde, belegt für sich genommen nicht, dass der Datensatz für eine konkrete Aufgabe geeignet ist. Ebenso wenig beweist sie, dass keine Informationen aus dem Ursprungsdatensatz reproduziert werden. Bei der Bewertung sollte nachvollziehbar sein, was mit welcher Referenz geprüft wurde und welche Einschränkungen bestehen.

Ablauf der Bewertung

Diese Übersicht ordnet die Fragen. Sie schreibt kein einheitliches technisches Verfahren vor.

  1. 01Den vorgesehenen Einsatzzweck und die Personen oder Stellen festlegen, die den Datensatz nutzen werden.
  2. 02Bestimmen, welche Eigenschaften für die Aufgabe erhalten bleiben müssen und welche nicht relevant sind.
  3. 03Die Herkunft der Referenzdaten und das Generierungsverfahren dokumentieren.
  4. 04Den Nutzen anhand aufgabenspezifischer Kriterien prüfen, nicht nur anhand eines allgemeinen Ähnlichkeitsmaßes.
  5. 05Gesondert bewerten, ob Informationen aus dem Ursprungsdatensatz reproduziert oder offengelegt werden könnten.
  6. 06Die vorgenommenen Prüfungen, ihre Ergebnisse und bekannte Einschränkungen darlegen.
04

Drei Anwendungsbeispiele

Die folgenden Szenarien veranschaulichen Fragen, die sich einem Team stellen könnten. Sie behaupten nicht, dass ein bestimmter Datensatz auf diese Weise erzeugt, validiert oder eingesetzt wurde. In jedem Fall hängt der Nutzen von der konkreten Aufgabe und den verfügbaren Nachweisen ab. Einordnung und Validierung müssen sich auf den tatsächlich vorgesehenen Einsatz beziehen; aus der bloßen Möglichkeit, synthetische Daten in einem Bereich zu verwenden, folgt noch keine Aussage über ihre Eignung dort.

Bei der Prüfung der Beispiele sollte man daher zwischen einem plausiblen Anwendungsfall und einem empirisch dokumentierten Ergebnis unterscheiden. Die Beispiele zeigen, worauf die Bewertung gerichtet werden kann, ersetzen aber weder geeignete Tests noch Belege für die Leistung oder den Datenschutz eines konkreten Datensatzes.

05

Was zu prüfen ist: Nutzen, Abdeckung und Datenschutz

Der Nutzen eines Datensatzes ist keine universelle Eigenschaft, sondern bezieht sich auf eine bestimmte Aufgabe. Fragen Sie, welche Aktivität validiert wurde und ob sie mit dem geplanten Einsatz übereinstimmt. Ein Datensatz, mit dem sich testen lässt, ob eine Anwendung bestimmte Formate akzeptiert, belegt nicht zwangsläufig die Genauigkeit eines Modells. Ebenso sollte ein Bewertungsergebnis nicht auf Bevölkerungsgruppen, Umgebungen oder Entscheidungen übertragen werden, die nicht untersucht wurden.

Auch die Abdeckung ist wichtig. Das Generierungsverfahren erhält möglicherweise nicht alle relevanten Fälle; verschiedene Gruppen, Situationen oder Kombinationen von Variablen können unterschiedlich genau abgebildet sein. Ein großes Datenvolumen oder die Übereinstimmung einzelner zusammenfassender Kennzahlen reicht nicht aus. Das Team sollte erklären, welche Dimensionen verglichen und welche Fälle in der Bewertung nicht berücksichtigt wurden.

Der Datenschutz muss unabhängig davon untersucht werden. Dass Daten nicht unmittelbar als reale Datensätze erhoben wurden, beweist nicht, dass das Verfahren keine Informationen aus dem Material reproduziert oder Rückschlüsse darauf ermöglicht, mit dem die Daten erzeugt wurden. Die bereitgestellten Quellen enthalten weder Ergebnisse von Datenschutzprüfungen für einen bestimmten Datensatz noch eine allgemeine Garantie, die für alle Verfahren gilt. Aussagen zum Schutz müssen daher mit konkreten Prüfungen, Annahmen und dem jeweiligen Nutzungskontext verknüpft werden.

Darüber hinaus sollten Referenzdatensatz, Generierungszweck, Verfahren, Bewertungen und Einschränkungen dokumentiert werden. Fehlen diese Informationen, lässt sich eine evidenzgestützte Aussage nicht von einer allgemeinen Beschreibung unterscheiden. Eine Datenschutzbewertung ersetzt auch nicht die Prüfung der Pflichten und Risiken, die im jeweiligen Kontext relevant sind. Dieser Artikel ist keine Rechtsberatung.

Fragen zu den jeweiligen Aussagen

Die Bezeichnung allein beantwortet diese Fragen nicht.

AussageWas sollte erfragt werden?Was lässt sich daraus allein nicht schließen?
„Die Daten sind nützlich.“Welche Aufgabe wurde bewertet, welche Kriterien und Referenzdaten wurden verwendet und welche Ergebnisse erzielt?Dass die Daten auch für andere Aufgaben oder Bevölkerungsgruppen geeignet sind.
„Die Daten sind repräsentativ.“Welche Gruppen oder Eigenschaften wurden verglichen und wie wurde der Vergleich gemessen?Dass alle relevanten Fälle abgedeckt sind.
„Die Daten schützen die Privatsphäre.“Welches Risiko wurde mit welchen Prüfungen und unter welchen Annahmen bewertet?Dass „synthetisch“ gleichbedeutend mit anonym ist.
„Die Daten ähneln realen Daten.“Welche Ähnlichkeitsdimensionen wurden gemessen und weshalb sind sie relevant?Dass alle nützlichen Eigenschaften erhalten bleiben oder keine Informationen offengelegt werden.
06

Verwandte Begriffe, die nicht verwechselt werden sollten

Synthetische und anonymisierte Daten bezeichnen unterschiedliche Aspekte. „Synthetisch“ bezieht sich auf den künstlichen Ursprung. „Anonymisiert“ ist eine Aussage über die Datenverarbeitung und das Risiko, Personen in einem bestimmten Kontext zu identifizieren oder erneut zu identifizieren. Synthetische Daten können auf der Grundlage realer Daten erzeugt worden sein. Ihr künstlicher Ursprung allein lässt deshalb weder erkennen, welche Informationen erhalten bleiben, noch welche Risiken bestehen. Eine Anonymisierung sollte ohne entsprechende Nachweise nicht als gegeben vorausgesetzt werden.

Datenaugmentation, also die Erweiterung von Daten, bezeichnet häufig das Erzeugen von Varianten vorhandener Beispiele durch Transformationen. Damit soll das für eine Aufgabe verfügbare Material erweitert oder verändert werden. Das ist nicht automatisch dasselbe wie die Erzeugung eines synthetischen Datensatzes mit einem anderen Verfahren. Bei der Einordnung eines konkreten Falls kommt es darauf an, ob ursprüngliche Beispiele transformiert, Beobachtungen durch Regeln oder Simulation erzeugt oder Modelle eingesetzt wurden. Eine kommerzielle oder informelle Bezeichnung des Datensatzes beantwortet diese Frage nicht.

Bei einer Simulation entstehen Beobachtungen gemäß Regeln oder einer Darstellung eines Prozesses. Eine Simulation kann synthetische Daten erzeugen. Der Begriff beschreibt jedoch den Mechanismus oder die Erzeugungsumgebung, während „synthetisch“ den künstlichen Ursprung des Ergebnisses bezeichnet. Wie gut die Simulation ist, hängt von ihren Annahmen und vom Verhältnis zwischen dem simulierten Prozess und der realen Aufgabe ab.

Auch durch Modelle generierte Daten stellen eine mögliche Verfahrensfamilie dar. Man sollte jedoch nicht voraussetzen, dass alle synthetischen Daten aus einem Modell stammen, das mit realen Datensätzen trainiert wurde. Die hier verfügbaren institutionellen Quellen dokumentieren weder alle Verfahrensfamilien und ihre Voraussetzungen ausreichend noch erlauben sie einen Leistungsvergleich. Fragen Sie bei konkreten Aussagen nach einer Beschreibung des Verfahrens, statt aus einer technischen Möglichkeit eine allgemeingültige Definition zu machen.

Datenkontamination, Generalisierung und KI-Evaluation sind schließlich verwandte, aber unterschiedliche Konzepte. Kontamination bezeichnet den Einfluss ungeeigneter oder mit der Bewertung zusammenhängender Informationen auf die Daten oder den bewerteten Prozess. Generalisierung betrifft das Verhalten eines Systems außerhalb der Beispiele, die bei seiner Entwicklung verwendet wurden. Evaluation ist der Prozess, mit dem dieses Verhalten gemessen wird. Der Einsatz synthetischer Daten löst keine dieser Fragen von selbst.

Kurze Abgrenzung

Ordnen Sie einen Begriff danach ein, welche Frage er beantwortet, und nicht nach einer vermeintlichen gemeinsamen Garantie.

BegriffZentrale FrageUnterschied zu synthetischen Daten
Synthetische DatenWie sind die Daten entstanden?Sie wurden künstlich erzeugt; daraus folgen nicht automatisch Nutzen oder Datenschutz.
Anonymisierte DatenWelches Identifizierungsrisiko wurde bewertet?Das ist eine Datenschutzfrage, keine hinreichende Beschreibung des Ursprungs.
DatenaugmentationWurden Beispiele transformiert, um das Material zu erweitern oder zu variieren?Der Begriff beschreibt eine Bearbeitung von Beispielen; das entspricht nicht zwangsläufig einer unabhängigen Generierung.
SimulationWelche Regeln oder Prozessdarstellungen erzeugen die Beobachtungen?Sie kann ein Verfahren zur Erzeugung synthetischer Daten sein, definiert aber nicht alle Verfahren.
07

Grenzen und häufige Irrtümer

Ein häufiger Fehler ist, statistische Ähnlichkeit als umfassende Garantie zu behandeln. Ein Datensatz kann bestimmte Eigenschaften des Referenzmaterials annähern und sich in anderen unterscheiden. Ohne Kenntnis der verglichenen Merkmale lässt sich nicht behaupten, dass er „die Daten“ insgesamt bewahrt. Welche Genauigkeit relevant ist, hängt von der Frage ab, die beantwortet werden soll.

Ein weiterer Fehler ist, das Ergebnis einer Prüfung auf einen breiteren Einsatz zu übertragen. Eignen sich Daten zum Testen einer Softwarefunktion, beweist das nicht, dass sie für statistische Schlussfolgerungen, Forschung oder Entscheidungen über Menschen geeignet sind. Vor einer Wiederverwendung sollte geprüft werden, ob sich der Zweck geändert hat und ob die Kriterien für die Gültigkeit erneut begründet wurden.

Ebenso riskant ist die Annahme, „enthält keine realen Daten“ bedeute „kann keine Informationen offenlegen“. Dafür muss untersucht werden, wie der Datensatz erzeugt wurde und welche Prüfungen die Aussage stützen. Aus den vorliegenden Quellen lässt sich weder ableiten, dass ein bestimmtes Verfahren gegen die Reproduktion von Informationen immun ist, noch lässt sich ein allgemeines Risiko beziffern.

Schließlich sollte man nicht annehmen, dass synthetische Daten reale Daten immer ersetzen oder sämtliche Einschränkungen beim Datenzugang, mögliche Verzerrungen oder Qualitätsprobleme vermeiden. Sie können bestimmte Arbeitsabläufe unterstützen; Eignung und Risiken müssen jedoch im Einzelfall bewertet werden. Fehlen Dokumentation, Metriken oder Prüfungen, ist die angemessene Schlussfolgerung, dass die Evidenz nicht ausreicht – nicht, dass der Datensatz zwingend nutzlos oder zwangsläufig sicher ist.

08

Praktische Kriterien zur Bewertung einer Aussage

Wenn Sie einen Datensatz oder ein Versprechen über synthetische Daten erhalten, bitten Sie zunächst um eine überprüfbare Beschreibung: Wer hat die Daten erzeugt? Auf welchem Material oder welcher Referenz beruhen sie? Welches Verfahren wurde verwendet und für welche Aufgabe wurden sie entwickelt? Sind diese Antworten nicht verfügbar, lassen sich weder der Umfang des Nutzens noch die Bedeutung einer Datenschutzaussage genau beurteilen.

Prüfen Sie anschließend, ob die Bewertung zum Zweck passt. Fragen Sie, welche Eigenschaften gemessen wurden, welche relevanten Fälle berücksichtigt waren, welcher Vergleich herangezogen wurde und welche Einschränkungen eingeräumt werden. Eine einzelne Metrik hat keine universelle Bedeutung: Man muss wissen, was sie messen soll und weshalb sie für die jeweilige Anwendung geeignet ist.

Bitten Sie beim Thema Datenschutz um eine Erläuterung der durchgeführten Prüfungen und der untersuchten Risiken. Akzeptieren Sie nicht, dass „synthetisch“ als Synonym für „anonym“ verwendet wird. Fragen Sie bei der Leistung, welcher Einsatz validiert wurde und welche Anwendungen nicht abgedeckt sind. Halten Sie beide Bewertungen auseinander: Ein positives Ergebnis in einem Bereich löst die Fragen des anderen nicht automatisch.

Kurz gesagt: Definieren Sie den Zweck, prüfen Sie das Verfahren, verlangen Sie eine auf die Aufgabe bezogene Validierung und behandeln Sie Datenschutz als eigenständige Frage. Sind Referenzen, Prüfungen oder Annahmen unbekannt, sollte diese Unsicherheit festgehalten werden. So lässt sich eine dokumentierte Eigenschaft von einer bloßen Erwartung unterscheiden, ohne dem Begriff mehr zuzuschreiben, als er bedeutet.

Kurze Prüfliste

Nutzen Sie diese Fragen, um Dokumentation zu prüfen oder mit den Anbietenden des Datensatzes zu sprechen.

  1. 01Was ist der konkrete Einsatzzweck und welche Entscheidung oder Prüfung soll unterstützt werden?
  2. 02Welche Eigenschaften sollten erhalten bleiben und welche wurden tatsächlich bewertet?
  3. 03Wie wurde der Datensatz erzeugt und in welchem Verhältnis steht er zu den Referenzdaten?
  4. 04Welche Nachweise belegen den Nutzen für diese Aufgabe und welche Grenzen wurden genannt?
  5. 05Welche gesonderten Prüfungen wurden zur Bewertung des Datenschutzes vorgenommen?
  6. 06Beschränkt sich die Schlussfolgerung auf das, was tatsächlich überprüft wurde?
09

Kurze Beispiele

10

Verwandte Begriffe

11

Verwendete Quellen