Synthetic Data
Synthetic Data bezeichnet künstlich generierte Daten, die echte Trainingsdaten ergänzen oder ersetzen – ohne Datenschutzprobleme und in beliebiger Menge produzierbar.
Was ist Synthetic Data?
Synthetic Data (synthetische Daten) sind maschinell erzeugte Datensätze, die reale Daten imitieren, ohne echte Personen oder Ereignisse direkt abzubilden. Statt echte Nutzerdaten zu sammeln, generiert man Daten algorithmisch oder mit Hilfe von KI-Modellen – mit kontrollierten Eigenschaften und in beliebiger Menge.
Warum ist das relevant?
In der KI-Entwicklung stößt man schnell an Grenzen:
- Datenschutz: Echte Kundendaten dürfen oft nicht für das Training verwendet werden (DSGVO).
- Datenmangel: Für seltene Ereignisse (z. B. Fehler in Produktionsanlagen) gibt es kaum Beispiele.
- Kosten: Manuelles Labeln großer Datensätze ist teuer und zeitaufwändig.
Synthetic Data löst alle drei Probleme.
Typische Erzeugungsmethoden
| Methode | Beschreibung |
|---|---|
| LLM-basiert | GPT-4 o. ä. generiert Texte, Q&A-Paare, Konversationen |
| GAN | Generative Adversarial Network erzeugt realistische Bilder/Tabellen |
| Regelbasiert | Templates + Zufallswerte erzeugen strukturierte Datensätze |
| Simulation | 3D-Engines rendern synthetische Kamerabilder |
Praxisbeispiel: Synthetic Data mit einem LLM erzeugen
import openai
client = openai.OpenAI()
def generate_synthetic_support_tickets(n: int) -> list[str]:
prompt = f"""
Generiere {n} realistische Kunden-Support-Tickets für einen Online-Shop.
Jedes Ticket soll ein anderes Problem beschreiben (Lieferung, Zahlung, Retoure, etc.).
Format: Eine Zeile pro Ticket.
"""
response = client.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": prompt}]
)
tickets = response.choices[0].message.content.strip().split("\n")
return tickets
tickets = generate_synthetic_support_tickets(10)
for t in tickets:
print(t)
Diese Tickets können dann genutzt werden, um einen Klassifikator zu trainieren – ganz ohne echte Nutzerdaten.
Risiken und Grenzen
- Distribution Shift: Synthetische Daten können die Realität verzerren oder wichtige Edge Cases verpassen.
- Model Collapse: Wird ein Modell nur auf synthetischen Daten trainiert, kann die Qualität über Iterationen abnehmen.
- Bias-Verstärkung: Das erzeugende Modell trägt seine eigenen Biases in die Trainingsdaten ein.
Wann einsetzen?
✅ Fine-Tuning von LLMs ohne verfügbare Trainingsdaten
✅ Datenschutzkritische Bereiche (Gesundheit, Finanzen)
✅ Testen von ML-Pipelines mit realistischen Dummy-Daten
❌ Nicht als vollständiger Ersatz für echte Validierungsdaten
Verwandte Begriffe
Inhouse statt Nachschlagewerk
Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.