Loss Function
Die Loss Function (Verlustfunktion) misst, wie stark die Vorhersagen eines Modells von den tatsächlichen Zielwerten abweichen – sie ist das zentrale Optimierungsziel beim Training neuronaler Netze.
Loss Function (Verlustfunktion)
Die Loss Function ist das Herzstück des Trainings: Sie quantifiziert den Fehler eines Modells und gibt dem Optimierungsalgorithmus (z. B. Gradient Descent) eine klare Richtung, in welche die Gewichte angepasst werden müssen. Ziel ist immer, den Loss zu minimieren.
Wie funktioniert sie?
Nach jedem Forward Pass vergleicht die Loss Function die Modellausgabe mit dem erwarteten Ergebnis (Label). Der berechnete Skalarwert fließt dann per Backpropagation zurück durch das Netz und aktualisiert die Gewichte.
Vorhersage → Loss berechnen → Gradient → Gewichte anpassen
Gängige Loss Functions
| Typ | Funktion | Anwendung |
|---|---|---|
| Regression | Mean Squared Error (MSE) | Zahlenwerte vorhersagen |
| Klassifikation | Cross-Entropy Loss | Kategorien zuordnen |
| LLM-Training | Negative Log-Likelihood | Nächstes Token vorhersagen |
| RLHF | Reward-basierter Loss | Menschliches Feedback einbeziehen |
Praxisbeispiel (PyTorch)
import torch
import torch.nn as nn
# Cross-Entropy für Klassifikation
criterion = nn.CrossEntropyLoss()
vorhersage = torch.tensor([[2.0, 0.5, 0.1]]) # Logits für 3 Klassen
label = torch.tensor([0]) # Korrekte Klasse: 0
loss = criterion(vorhersage, label)
print(f"Loss: {loss.item():.4f}") # Loss: 0.4076
# Backpropagation
loss.backward()
Loss bei Large Language Models
Bei LLMs wie GPT wird typischerweise Cross-Entropy auf Token-Ebene verwendet: Das Modell soll das nächste Token korrekt vorhersagen. Ein sinkender Training-Loss zeigt, dass das Modell die Sprachstruktur besser lernt.
Eingabe: "Der Hund bellt"
Ziel: "Hund bellt laut"
Loss: Abweichung zwischen vorhergesagter und echter Token-Verteilung
Wichtige Zusammenhänge
- Overfitting: Training-Loss sinkt, Validation-Loss steigt → Modell memorisiert statt zu generalisieren
- Learning Rate: Beeinflusst, wie stark Gewichte pro Schritt angepasst werden
- Epochen: Loss sollte über Epochen hinweg abnehmen – stagniert er, ist Tuning nötig
- Fine-Tuning: Beim Fine-Tuning wird der Loss auf domänenspezifischen Daten minimiert, nicht auf dem Pretraining-Korpus
Typische Probleme
- Loss explodiert (NaN/Inf): Learning Rate zu hoch, Gradient Clipping fehlt
- Loss stagniert: Schlechte Initialisierung, zu kleine Lernrate oder falsche Loss-Funktion für den Task
- Loss divergiert bei RLHF: Reward-Hacking – das Modell optimiert die Metrik, nicht das eigentliche Ziel
Verwandte Begriffe
Inhouse statt Nachschlagewerk
Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.