Zum Hauptinhalt

Loss Function

Die Loss Function (Verlustfunktion) misst, wie stark die Vorhersagen eines Modells von den tatsächlichen Zielwerten abweichen – sie ist das zentrale Optimierungsziel beim Training neuronaler Netze.

AIExperteloss-functiondeep-learningmodel-training

Loss Function (Verlustfunktion)

Die Loss Function ist das Herzstück des Trainings: Sie quantifiziert den Fehler eines Modells und gibt dem Optimierungsalgorithmus (z. B. Gradient Descent) eine klare Richtung, in welche die Gewichte angepasst werden müssen. Ziel ist immer, den Loss zu minimieren.

Wie funktioniert sie?

Nach jedem Forward Pass vergleicht die Loss Function die Modellausgabe mit dem erwarteten Ergebnis (Label). Der berechnete Skalarwert fließt dann per Backpropagation zurück durch das Netz und aktualisiert die Gewichte.

Vorhersage → Loss berechnen → Gradient → Gewichte anpassen

Gängige Loss Functions

TypFunktionAnwendung
RegressionMean Squared Error (MSE)Zahlenwerte vorhersagen
KlassifikationCross-Entropy LossKategorien zuordnen
LLM-TrainingNegative Log-LikelihoodNächstes Token vorhersagen
RLHFReward-basierter LossMenschliches Feedback einbeziehen

Praxisbeispiel (PyTorch)

import torch
import torch.nn as nn

# Cross-Entropy für Klassifikation
criterion = nn.CrossEntropyLoss()

vorhersage = torch.tensor([[2.0, 0.5, 0.1]])  # Logits für 3 Klassen
label = torch.tensor([0])                      # Korrekte Klasse: 0

loss = criterion(vorhersage, label)
print(f"Loss: {loss.item():.4f}")  # Loss: 0.4076

# Backpropagation
loss.backward()

Loss bei Large Language Models

Bei LLMs wie GPT wird typischerweise Cross-Entropy auf Token-Ebene verwendet: Das Modell soll das nächste Token korrekt vorhersagen. Ein sinkender Training-Loss zeigt, dass das Modell die Sprachstruktur besser lernt.

Eingabe:  "Der Hund bellt"
Ziel:     "Hund bellt laut"
Loss:     Abweichung zwischen vorhergesagter und echter Token-Verteilung

Wichtige Zusammenhänge

  • Overfitting: Training-Loss sinkt, Validation-Loss steigt → Modell memorisiert statt zu generalisieren
  • Learning Rate: Beeinflusst, wie stark Gewichte pro Schritt angepasst werden
  • Epochen: Loss sollte über Epochen hinweg abnehmen – stagniert er, ist Tuning nötig
  • Fine-Tuning: Beim Fine-Tuning wird der Loss auf domänenspezifischen Daten minimiert, nicht auf dem Pretraining-Korpus

Typische Probleme

  • Loss explodiert (NaN/Inf): Learning Rate zu hoch, Gradient Clipping fehlt
  • Loss stagniert: Schlechte Initialisierung, zu kleine Lernrate oder falsche Loss-Funktion für den Task
  • Loss divergiert bei RLHF: Reward-Hacking – das Modell optimiert die Metrik, nicht das eigentliche Ziel

Inhouse statt Nachschlagewerk

Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.