# Synthetische Daten einfach erklärt | KI-Lexikon

> Synthetische Daten sind künstlich erzeugte Daten, die Eigenschaften echter Daten nachbilden. Wie man sie erzeugt, wofür sie im KI-Training und in der Marktforschung taugen und was die DSGVO dazu sagt.

Quelle: https://gerlinger.ai/lexikon/synthetische-daten
Stand: 2026-10-09

## Synthetische Daten

Synthetische Daten sind künstlich erzeugte Daten, die Struktur und statistische Eigenschaften echter Daten nachbilden, ohne selbst aus einer echten Erhebung zu stammen.

### Was synthetische Daten genau sind

Synthetische Daten sind Datensätze, die ein Programm oder ein KI-Modell erzeugt, statt dass sie bei echten Kunden, Maschinen oder Befragten gemessen werden. Der Europäische Datenschutzbeauftragte beschreibt sie als künstliche Daten, die aus Originaldaten und einem Modell entstehen, das darauf trainiert ist, Merkmale und Struktur der Originaldaten nachzubilden ([EDPS, TechSonar: Synthetic Data, November 2022](https://www.edps.europa.eu/press-publications/publications/techsonar/synthetic-data_en)). Der internationale Kodex der Marktforschung fasst es knapper: Informationen, die erzeugt wurden, um die Eigenschaften realer Daten nachzubilden ([ICC/Esomar, International Code on Market, Opinion and Social Research and Data Analytics, Stand Juli 2025](https://standards.esomar.org/assets/documents/icc-esomar-code-2025.pdf)).

Der Nutzen liegt darin, dass eine Auswertung mit den künstlichen Daten ähnliche Ergebnisse liefern soll wie mit den echten. Eine Kundentabelle mit erfundenen Namen, aber realistischer Verteilung von Postleitzahlen, Bestellwerten und Zahlungszielen reicht zum Beispiel, um eine neue Software zu testen, ohne dass echte Kundendaten das Haus verlassen.

### So erzeugst du synthetische Daten

Es gibt drei gängige Wege, synthetische Daten zu erzeugen. Sie unterscheiden sich darin, ob echte Daten als Vorlage dienen.

- Nach Regeln: Ein Skript würfelt Werte innerhalb festgelegter Grenzen aus, etwa Rechnungsbeträge zwischen 50 und 5.000 Euro. Echte Daten werden dafür nicht gebraucht.
- Mit statistischen Modellen: Ein Modell lernt die Verteilungen und Zusammenhänge eines echten Datensatzes und erzeugt daraus neue Zeilen mit ähnlichem Muster.
- Mit generativer KI: Ein Sprachmodell schreibt Beispieltexte, Musteranfragen oder ganze Dialoge nach einer Vorgabe im Prompt.

Die Bundesbeauftragte für den Datenschutz und die Informationsfreiheit (BfDI) unterscheidet in ihrer Kurzposition zu Testdaten „voll synthetische“ Daten, die ohne jeden Personenbezug nach Regeln oder statistischen Mustern entstehen, von Daten, die aus vorhandenen personenbezogenen Daten abgeleitet werden ([BfDI, Kurzposition: Personenbezogene Daten bei Software-Entwicklung und -Tests, Juni 2025](https://www.bfdi.bund.de/DE/Fachthemen/Inhalte/Technik/Kurzposition_Testdaten.html)). Diese Unterscheidung entscheidet später über die datenschutzrechtliche Einordnung.

### Synthetische Daten im KI-Training

Synthetische Daten füllen Lücken, wenn echte Trainingsdaten fehlen, zu teuer sind oder nicht verwendet werden dürfen. Ein bekanntes Beispiel ist das kleine Sprachmodell phi-1 von Microsoft Research: Es wurde unter anderem mit rund einer Milliarde Token an Lehrbuchtexten und Übungen trainiert, die GPT-3.5 erzeugt hatte ([Gunasekar et al., Textbooks Are All You Need, arXiv, Juni 2023](https://arxiv.org/abs/2306.11644)).

Die Methode hat eine bekannte Grenze. Werden Modelle wiederholt mit Daten trainiert, die andere Modelle erzeugt haben, verschwinden seltene Fälle aus den Ergebnissen, und die Qualität sinkt. Die Forscher nennen das Modellkollaps ([Shumailov et al., AI models collapse when trained on recursively generated data, Nature, Juli 2024](https://www.nature.com/articles/s41586-024-07566-y)). Synthetische Daten ergänzen echte Daten deshalb meist, statt sie ganz zu ersetzen.

Auch die KI-Verordnung der EU nennt synthetische Daten. Anbieter von Hochrisiko-KI-Systemen dürfen besondere Kategorien personenbezogener Daten zur Erkennung von Verzerrungen nur verarbeiten, wenn das mit anderen Daten, einschließlich synthetischer oder anonymisierter Daten, nicht wirksam gelingt ([Verordnung (EU) 2024/1689, Art. 10 Abs. 5 lit. a, Juni 2024](https://eur-lex.europa.eu/legal-content/DE/TXT/?uri=CELEX:32024R1689)).

### Synthetische Daten und die DSGVO

Ob synthetische Daten unter die DSGVO fallen, hängt davon ab, ob sich aus ihnen noch echte Personen erkennen lassen. Informationen, die sich nicht auf eine identifizierbare Person beziehen, sind nach der DSGVO anonym und nicht von ihr erfasst ([Verordnung (EU) 2016/679, Erwägungsgrund 26, April 2016](https://eur-lex.europa.eu/legal-content/DE/TXT/?uri=CELEX:32016R0679)). Voll synthetische Testdaten ohne Vorlage aus Echtdaten können laut BfDI ohne Einschränkungen für Entwicklung und Tests genutzt werden. Fälle, in denen Testdaten per KI aus personenbezogenen Daten abgeleitet werden, behandelt die Kurzposition ausdrücklich nicht ([BfDI, Juni 2025](https://www.bfdi.bund.de/DE/Fachthemen/Inhalte/Technik/Kurzposition_Testdaten.html)).

Zwei Punkte solltest du kennen, bevor du echte Kundendaten als Vorlage nimmst. Erstens gilt schon das Auslesen und Verwenden personenbezogener Daten als Verarbeitung im Sinne der DSGVO ([Verordnung (EU) 2016/679, Art. 4 Nr. 2, April 2016](https://eur-lex.europa.eu/legal-content/DE/TXT/?uri=CELEX:32016R0679)), also auch das Training eines Generators mit diesen Daten. Zweitens sind aus Echtdaten erzeugte synthetische Daten nicht automatisch anonym: Eine Forschungsarbeit kam zu dem Ergebnis, dass generative Modelle entweder Rückschlüsse auf die Originaldaten nicht verhindern oder so viel Nutzen verlieren, dass die Daten kaum noch taugen ([Stadler, Oprisanu, Troncoso, Synthetic Data: Anonymisation Groundhog Day, arXiv, Januar 2022](https://arxiv.org/abs/2011.07018)). Ob dein konkretes Vorgehen zulässig ist, klärt dein Datenschutzbeauftragter oder dein Anwalt. Wann eine Datenschutz-Folgenabschätzung nötig ist, steht im Artikel [Datenschutz-Folgenabschätzung für KI](https://gerlinger.ai/blog/dsfa-ki-pflicht).

### Synthetische Daten in der Marktforschung

In der Marktforschung stehen synthetische Daten meist für künstlich erzeugte Antworten oder für synthetische Personas: digitale Abbilder einer Person, die Verhalten, Vorlieben und Merkmale echter Menschen oder Gruppen nachahmen sollen. Der ICC/Esomar-Kodex verlangt, dass Auftraggeber informiert werden, wenn synthetische Daten oder synthetische Personas in eine Studie einfließen, und dass dabei angegeben wird, wie viel menschliche Kontrolle stattfand ([ICC/Esomar International Code, Stand Juli 2025](https://standards.esomar.org/assets/documents/icc-esomar-code-2025.pdf)). Für ein kleines Unternehmen heißt das: Eine Umfrage unter synthetischen Befragten kann Hypothesen liefern, bevor du Geld in eine echte Befragung steckst. Die Antworten echter Kunden ersetzt sie nicht.

### Was das für dein Unternehmen bedeutet

Für kleine und mittlere Unternehmen sind synthetische Daten vor allem dort nützlich, wo echte Daten zu heikel sind, um sie weiterzugeben. Typisch sind Testdaten für eine neue Software, Beispieldaten für eine Schulung oder eine Demo, die einem Dienstleister die Datenstruktur zeigt, ohne echte Kunden offenzulegen. Wenn wir bei gerlinger.ai eine [Web-App](https://gerlinger.ai/leistungen/web-apps) oder eine [Automation](https://gerlinger.ai/leistungen/automationen) bauen, arbeiten wir in der Entwicklung bevorzugt mit Beispieldaten und nehmen Echtdaten erst im abgestimmten Betrieb dazu.

### Beispiele aus der Praxis

- Eine Kundentabelle mit erfundenen Namen und realistischen Bestellwerten, um eine Schnittstelle zum ERP zu testen
- Künstlich erzeugte E-Mail-Anfragen, an denen ein KI-Assistent das Sortieren von Postfach-Nachrichten üben kann
- Beispielrechnungen in verschiedenen Layouts, um eine Belegerkennung vor dem Start zu prüfen
- Seltene Fehlerfälle aus der Produktion, die künstlich ergänzt werden, weil echte Beispiele zu selten vorkommen
- Synthetische Personas, um Fragen für eine spätere Kundenbefragung vorab zu schärfen

### Vorteile und Grenzen

#### Das spricht dafür

- Software und KI-Abläufe lassen sich testen, bevor echte Kundendaten ins Spiel kommen
- Seltene Fälle können gezielt ergänzt werden, die im echten Bestand kaum vorkommen
- Dienstleister sehen die Struktur deiner Daten, ohne echte Inhalte zu bekommen
- Beispieldaten in beliebiger Menge, etwa für Schulungen und Demos

#### Das solltest du einplanen

- Aus Echtdaten erzeugte synthetische Daten sind nicht automatisch anonym
- Das Erzeugen aus Kundendaten ist selbst eine Verarbeitung personenbezogener Daten
- Die künstlichen Daten übernehmen Verzerrungen der Vorlage, wenn niemand gegenprüft
- Ergebnisse aus synthetischen Daten sollten vor wichtigen Entscheidungen an echten Daten geprüft werden

### Quellen

- [Kurzposition: Personenbezogene Daten bei Software-Entwicklung und -Tests, Juni 2025BfDI](https://www.bfdi.bund.de/DE/Fachthemen/Inhalte/Technik/Kurzposition_Testdaten.html)
- [TechSonar: Synthetic Data, November 2022Europäischer Datenschutzbeauftragter (EDPS)](https://www.edps.europa.eu/press-publications/publications/techsonar/synthetic-data_en)
- [International Code on Market, Opinion and Social Research and Data Analytics, Stand Juli 2025ICC/Esomar](https://standards.esomar.org/assets/documents/icc-esomar-code-2025.pdf)
- [Datenschutz-Grundverordnung, Art. 4 und Erwägungsgrund 26EUR-Lex](https://eur-lex.europa.eu/legal-content/DE/TXT/?uri=CELEX:32016R0679)
- [KI-Verordnung (EU) 2024/1689, Art. 10EUR-Lex](https://eur-lex.europa.eu/legal-content/DE/TXT/?uri=CELEX:32024R1689)
- [Synthetic Data: Anonymisation Groundhog Day, Januar 2022Stadler, Oprisanu, Troncoso](https://arxiv.org/abs/2011.07018)
- [AI models collapse when trained on recursively generated data, Juli 2024Nature](https://www.nature.com/articles/s41586-024-07566-y)
- [Textbooks Are All You Need, Juni 2023Microsoft Research](https://arxiv.org/abs/2306.11644)

### Auf einen Blick

Das Wichtigste in fünf Sätzen

- Synthetische Daten bilden echte Daten nach, stammen aber nicht aus einer echten Erhebung
- Sie entstehen nach Regeln, mit statistischen Modellen oder mit generativer KI
- Voll synthetische Testdaten ohne Vorlage aus Echtdaten sind datenschutzrechtlich am einfachsten
- Aus Kundendaten abgeleitete synthetische Daten gelten nicht automatisch als anonym
- Im KI-Training und in der Marktforschung ergänzen sie echte Daten, ersetzen sie aber nicht

### Verwandte Begriffe.

Diese Einträge gehören technisch zum selben Thema und erklären die Bausteine dahinter.

#### DSGVO

Die EU-Datenschutzverordnung, die den Umgang mit personenbezogenen Daten regelt.

#### Machine Learning

Algorithmen, die aus Daten lernen und sich selbst verbessern.

#### Fine-Tuning

Nachtraining eines KI-Modells mit eigenen, spezifischen Daten.

#### KI-Bias (Verzerrung)

Systematische Verzerrung in KI-Systemen, die zu unfairen Ergebnissen führt.

[Alle 101 Begriffe ansehen](https://gerlinger.ai/lexikon)

### Häufige Fragen zu synthetischen Daten.

Deine Frage fehlt? [Schreib uns](mailto:hallo@gerlinger.ai), wir antworten innerhalb eines Werktags.

#### Was sind synthetische Daten?

Synthetische Daten sind künstlich erzeugte Daten, die Struktur und statistische Eigenschaften echter Daten nachbilden, ohne selbst aus einer echten Erhebung zu stammen. Sie dienen zum Beispiel als Testdaten für Software, als Trainingsdaten für KI oder als Beispieldaten für Schulungen.

#### Sind synthetische Daten automatisch anonym und damit DSGVO-frei?

Nein. Die DSGVO gilt nicht für anonyme Informationen, also für Daten ohne Bezug zu einer identifizierbaren Person. Ob synthetische Daten diese Schwelle erreichen, hängt davon ab, wie sie erzeugt wurden. Voll synthetische Daten ohne Vorlage aus Echtdaten können laut BfDI (Kurzposition Testdaten, Juni 2025) ohne Einschränkungen für Tests genutzt werden. Bei Daten, die aus Kundendaten abgeleitet sind, zeigt die Forschung, dass Rückschlüsse auf echte Personen möglich bleiben können. Die Einordnung im Einzelfall trifft dein Datenschutzbeauftragter oder dein Anwalt.

#### Wie erzeuge ich synthetische Daten?

Für einfache Testdaten reicht ein Skript, das Werte nach festen Regeln erzeugt, etwa erfundene Namen und Beträge in realistischen Spannen. Sollen die Daten die Muster eines echten Bestands nachbilden, lernt ein statistisches Modell diese Muster und erzeugt neue Datensätze. Beispieltexte wie Anfragen oder Dialoge lassen sich mit einem Sprachmodell per Prompt erzeugen.

#### Kann man eine KI nur mit synthetischen Daten trainieren?

Teilweise. Microsoft Research hat das Sprachmodell phi-1 unter anderem mit Lehrbuchtexten trainiert, die GPT-3.5 erzeugt hatte (Juni 2023). Eine in Nature veröffentlichte Studie (Juli 2024) zeigt aber, dass Modelle schlechter werden, wenn sie wiederholt mit Daten anderer Modelle trainiert werden. In der Praxis ergänzen synthetische Daten echte Daten, statt sie ganz zu ersetzen.

#### Ersetzen synthetische Befragte eine echte Marktforschung?

Nein. Synthetische Befragte und Personas können Hypothesen liefern und einen Fragebogen vorab schärfen. Der ICC/Esomar-Kodex (Stand Juli 2025) verlangt, dass Auftraggeber über den Einsatz synthetischer Daten und Personas informiert werden. Entscheidungen mit Tragweite sollten sich weiter auf Antworten echter Kunden stützen.

### Wie relevant sind synthetische Daten für dich?

Im Analysegespräch schauen wir gemeinsam auf deine Abläufe und finden heraus, wo KI bei dir wirklich Zeit spart. 45 Minuten, kostenlos, ohne Folien.
