Zum Hauptinhalt

Model Collapse

Model Collapse beschreibt den Qualitätsverlust eines KI-Modells, wenn es auf synthetisch generierten Daten trainiert wird, die von früheren KI-Modellen stammen – ein sich selbst verstärkender Degradierungsprozess über Trainingsgenerationen hinweg.

AIExpertemodel-collapsesynthetic-datafine-tuning

Was ist Model Collapse?

Model Collapse tritt auf, wenn ein Sprachmodell oder ein anderes generatives KI-Modell auf Daten trainiert wird, die von einem anderen (oder demselben) KI-Modell erzeugt wurden. Über mehrere Generationen hinweg verliert das Modell dabei zunehmend die Fähigkeit, seltene, diverse oder komplexe Muster der realen Welt abzubilden – es "kollabiert" auf einen eingeschränkten Output-Raum.

Warum passiert das?

Das Problem liegt in der Verteilungsverschiebung (Distribution Shift):

  1. Generation 0: Modell wird auf echten menschlichen Daten trainiert → lernt die volle Datenverteilung.
  2. Generation 1: Modell generiert synthetische Daten → seltene Randphänomene werden unterrepräsentiert.
  3. Generation n: Jede weitere Trainingsiteration verstärkt die Verzerrung – das Modell lernt nur noch den "Mainstream" der vorherigen Modellausgaben.

Das Ergebnis: Homogenisierung, Verlust von Diversität, repetitive oder banale Antworten.

Praxisbeispiel: Simulation über Generationen

import numpy as np

# Reale Datenverteilung: breit gestreut (Normalverteilung)
real_data = np.random.normal(loc=0, scale=1.0, size=10000)

# Simulation: Jede Generation sampelt aus dem Output der vorherigen
def simulate_collapse(data, generations=5):
    for gen in range(generations):
        # Modell lernt nur den "mittleren" Bereich gut
        # Randwerte werden bei der Datengenerierung geclipt
        data = np.clip(data, -0.8, 0.8)  # vereinfachtes Modell des Verlusts
        data = np.random.choice(data, size=len(data), replace=True)
        std = np.std(data)
        print(f"Generation {gen+1}: Std={std:.4f} (je kleiner, desto kollabierter)")
    return data

collapsed_data = simulate_collapse(real_data)
# Generation 1: Std=0.4621
# Generation 5: Std=0.1893  ← Diversität stark reduziert

Relevanz für Entwickler

  • Fine-Tuning-Pipelines: Wenn du Modelle mit KI-generierten Beispieldaten feinjustierst, riskierst du Model Collapse – besonders bei iterativen RLHF-Loops.
  • Synthetic Data: Synthetische Daten sind kein vollwertiger Ersatz für echte, diverse Trainingsdaten.
  • RAG als Gegenmaßnahme: Retrieval-Augmented Generation kann helfen, indem externe, reale Fakten die Ausgaben erden.

Gegenmaßnahmen

StrategieBeschreibung
Daten-MixingEchte und synthetische Daten im Verhältnis mischen (z.B. 80/20)
QualitätsfiltierungSynthetische Daten rigoros filtern und validieren
GroundingModellausgaben an externe Wissensquellen koppeln
Diversitäts-MetrikenDiversity-Scores im Datensatz aktiv monitoren

Fazit

Model Collapse ist kein theoretisches Problem – mit dem wachsenden Anteil KI-generierter Inhalte im Web wird es für zukünftige Trainingsdatensätze zunehmend praktisch relevant. Als Entwickler solltest du bei Custom-Training und Fine-Tuning stets die Herkunft und Diversität deiner Daten im Blick behalten.

Inhouse statt Nachschlagewerk

Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.