Model Collapse
Model Collapse beschreibt den Qualitätsverlust eines KI-Modells, wenn es auf synthetisch generierten Daten trainiert wird, die von früheren KI-Modellen stammen – ein sich selbst verstärkender Degradierungsprozess über Trainingsgenerationen hinweg.
Was ist Model Collapse?
Model Collapse tritt auf, wenn ein Sprachmodell oder ein anderes generatives KI-Modell auf Daten trainiert wird, die von einem anderen (oder demselben) KI-Modell erzeugt wurden. Über mehrere Generationen hinweg verliert das Modell dabei zunehmend die Fähigkeit, seltene, diverse oder komplexe Muster der realen Welt abzubilden – es "kollabiert" auf einen eingeschränkten Output-Raum.
Warum passiert das?
Das Problem liegt in der Verteilungsverschiebung (Distribution Shift):
- Generation 0: Modell wird auf echten menschlichen Daten trainiert → lernt die volle Datenverteilung.
- Generation 1: Modell generiert synthetische Daten → seltene Randphänomene werden unterrepräsentiert.
- Generation n: Jede weitere Trainingsiteration verstärkt die Verzerrung – das Modell lernt nur noch den "Mainstream" der vorherigen Modellausgaben.
Das Ergebnis: Homogenisierung, Verlust von Diversität, repetitive oder banale Antworten.
Praxisbeispiel: Simulation über Generationen
import numpy as np
# Reale Datenverteilung: breit gestreut (Normalverteilung)
real_data = np.random.normal(loc=0, scale=1.0, size=10000)
# Simulation: Jede Generation sampelt aus dem Output der vorherigen
def simulate_collapse(data, generations=5):
for gen in range(generations):
# Modell lernt nur den "mittleren" Bereich gut
# Randwerte werden bei der Datengenerierung geclipt
data = np.clip(data, -0.8, 0.8) # vereinfachtes Modell des Verlusts
data = np.random.choice(data, size=len(data), replace=True)
std = np.std(data)
print(f"Generation {gen+1}: Std={std:.4f} (je kleiner, desto kollabierter)")
return data
collapsed_data = simulate_collapse(real_data)
# Generation 1: Std=0.4621
# Generation 5: Std=0.1893 ← Diversität stark reduziert
Relevanz für Entwickler
- Fine-Tuning-Pipelines: Wenn du Modelle mit KI-generierten Beispieldaten feinjustierst, riskierst du Model Collapse – besonders bei iterativen RLHF-Loops.
- Synthetic Data: Synthetische Daten sind kein vollwertiger Ersatz für echte, diverse Trainingsdaten.
- RAG als Gegenmaßnahme: Retrieval-Augmented Generation kann helfen, indem externe, reale Fakten die Ausgaben erden.
Gegenmaßnahmen
| Strategie | Beschreibung |
|---|---|
| Daten-Mixing | Echte und synthetische Daten im Verhältnis mischen (z.B. 80/20) |
| Qualitätsfiltierung | Synthetische Daten rigoros filtern und validieren |
| Grounding | Modellausgaben an externe Wissensquellen koppeln |
| Diversitäts-Metriken | Diversity-Scores im Datensatz aktiv monitoren |
Fazit
Model Collapse ist kein theoretisches Problem – mit dem wachsenden Anteil KI-generierter Inhalte im Web wird es für zukünftige Trainingsdatensätze zunehmend praktisch relevant. Als Entwickler solltest du bei Custom-Training und Fine-Tuning stets die Herkunft und Diversität deiner Daten im Blick behalten.
Verwandte Begriffe
Inhouse statt Nachschlagewerk
Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.