RLHF (Reinforcement Learning from Human Feedback)
RLHF (Reinforcement Learning from Human Feedback) ist eine Trainingstechnik, bei der ein Sprachmodell durch menschliches Feedback gezielt auf nützliche, harmlose und ehrliche Antworten ausgerichtet wird.
RLHF – Reinforcement Learning from Human Feedback
RLHF ist die Methode, mit der moderne LLMs wie GPT-4 oder Claude von rohen Sprachmodellen zu hilfreichen Assistenten werden. Das Modell lernt nicht mehr nur, den nächsten Token vorherzusagen, sondern antwortet so, wie es menschliche Bewerter bevorzugen würden.
Wie funktioniert RLHF?
Der Prozess besteht aus drei Phasen:
1. Supervised Fine-Tuning (SFT)
Zuerst wird das Basismodell auf hochwertigen, von Menschen erstellten Beispiel-Dialogen feinabgestimmt.
2. Reward Model Training
Menschliche Bewerter vergleichen mehrere Modellantworten und ranken sie. Ein separates Reward Model lernt, diese Präferenzen vorherzusagen.
Prompt: "Erkläre Quantencomputing einfach."
Antwort A: "Qubits nutzen Superposition..." → Rang 1 (klar, verständlich)
Antwort B: "Das ist kompliziert..." → Rang 2 (ausweichend)
Antwort C: "42" → Rang 3 (nutzlos)
Reward Model lernt: Score(A) > Score(B) > Score(C)
3. RL-Optimierung mit PPO
Das Sprachmodell wird mit dem Reinforcement-Learning-Algorithmus PPO (Proximal Policy Optimization) trainiert. Das Reward Model gibt dabei den Reward-Signal zurück – das Sprachmodell maximiert diesen Score.
# Vereinfachtes Konzept (pseudocode)
for prompt in training_prompts:
response = language_model.generate(prompt)
reward = reward_model.score(prompt, response)
# PPO aktualisiert LM-Gewichte, um reward zu maximieren
ppo_trainer.step(prompt, response, reward)
Warum ist RLHF wichtig?
| Ohne RLHF | Mit RLHF |
|---|---|
| Kann schädliche Inhalte generieren | Lehnt schädliche Anfragen ab |
| Antwortet oft inkohärent | Bleibt beim Thema |
| Halluziniert häufiger | Gibt Unsicherheiten eher zu |
| Ignoriert Anweisungen | Folgt Instruktionen besser |
Varianten und Weiterentwicklungen
- RLAIF (RL from AI Feedback): Statt menschlicher Bewerter übernimmt ein anderes LLM das Ranking – skaliert besser, aber mit eigenen Biases
- DPO (Direct Preference Optimization): Vereinfacht RLHF, indem das Reward Model wegfällt und Präferenzen direkt ins Training einfließen
- Constitutional AI (Anthropic): Ergänzt RLHF durch explizite Regeln ("Constitution"), nach denen das Modell sich selbst bewertet
Praktische Relevanz für Entwickler
Wenn du mit RLHF-trainierten Modellen über eine API arbeitest, profitierst du direkt:
- System-Prompts werden respektiert
- Das Modell folgt dem Instruction-Format
- Guardrails greifen bei problematischen Prompts
Bei eigenem Fine-Tuning mit Libraries wie trl (Transformers Reinforcement Learning) kannst du RLHF auch auf eigene Use-Cases anwenden:
from trl import PPOTrainer, PPOConfig, AutoModelForCausalLMWithValueHead
config = PPOConfig(model_name="gpt2", learning_rate=1.41e-5)
model = AutoModelForCausalLMWithValueHead.from_pretrained(config.model_name)
ppo_trainer = PPOTrainer(config, model, ref_model, tokenizer)
# Training-Loop mit eigenem Reward Model
Grenzen von RLHF
- Reward Hacking: Das Modell optimiert auf den Reward-Score, nicht auf echte Qualität
- Human Bias: Bewerter-Präferenzen spiegeln kulturelle und persönliche Vorurteile wider
- Teuer: Menschliches Feedback ist zeitaufwändig und kostspielig zu sammeln
- Alignment-Gap: RLHF reduziert Probleme, löst sie aber nicht vollständig
Verwandte Begriffe
Inhouse statt Nachschlagewerk
Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.