Zum Hauptinhalt

Synthetic Data

Synthetic Data bezeichnet künstlich generierte Daten, die echte Trainingsdaten ergänzen oder ersetzen – ohne Datenschutzprobleme und in beliebiger Menge produzierbar.

AIAnfängersynthetic-datatraining-datafine-tuning

Was ist Synthetic Data?

Synthetic Data (synthetische Daten) sind maschinell erzeugte Datensätze, die reale Daten imitieren, ohne echte Personen oder Ereignisse direkt abzubilden. Statt echte Nutzerdaten zu sammeln, generiert man Daten algorithmisch oder mit Hilfe von KI-Modellen – mit kontrollierten Eigenschaften und in beliebiger Menge.

Warum ist das relevant?

In der KI-Entwicklung stößt man schnell an Grenzen:

  • Datenschutz: Echte Kundendaten dürfen oft nicht für das Training verwendet werden (DSGVO).
  • Datenmangel: Für seltene Ereignisse (z. B. Fehler in Produktionsanlagen) gibt es kaum Beispiele.
  • Kosten: Manuelles Labeln großer Datensätze ist teuer und zeitaufwändig.

Synthetic Data löst alle drei Probleme.

Typische Erzeugungsmethoden

MethodeBeschreibung
LLM-basiertGPT-4 o. ä. generiert Texte, Q&A-Paare, Konversationen
GANGenerative Adversarial Network erzeugt realistische Bilder/Tabellen
RegelbasiertTemplates + Zufallswerte erzeugen strukturierte Datensätze
Simulation3D-Engines rendern synthetische Kamerabilder

Praxisbeispiel: Synthetic Data mit einem LLM erzeugen

import openai

client = openai.OpenAI()

def generate_synthetic_support_tickets(n: int) -> list[str]:
    prompt = f"""
    Generiere {n} realistische Kunden-Support-Tickets für einen Online-Shop.
    Jedes Ticket soll ein anderes Problem beschreiben (Lieferung, Zahlung, Retoure, etc.).
    Format: Eine Zeile pro Ticket.
    """
    response = client.chat.completions.create(
        model="gpt-4o-mini",
        messages=[{"role": "user", "content": prompt}]
    )
    tickets = response.choices[0].message.content.strip().split("\n")
    return tickets

tickets = generate_synthetic_support_tickets(10)
for t in tickets:
    print(t)

Diese Tickets können dann genutzt werden, um einen Klassifikator zu trainieren – ganz ohne echte Nutzerdaten.

Risiken und Grenzen

  • Distribution Shift: Synthetische Daten können die Realität verzerren oder wichtige Edge Cases verpassen.
  • Model Collapse: Wird ein Modell nur auf synthetischen Daten trainiert, kann die Qualität über Iterationen abnehmen.
  • Bias-Verstärkung: Das erzeugende Modell trägt seine eigenen Biases in die Trainingsdaten ein.

Wann einsetzen?

✅ Fine-Tuning von LLMs ohne verfügbare Trainingsdaten
✅ Datenschutzkritische Bereiche (Gesundheit, Finanzen)
✅ Testen von ML-Pipelines mit realistischen Dummy-Daten
❌ Nicht als vollständiger Ersatz für echte Validierungsdaten

Inhouse statt Nachschlagewerk

Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.