Zum Hauptinhalt

RLHF (Reinforcement Learning from Human Feedback)

RLHF (Reinforcement Learning from Human Feedback) ist eine Trainingstechnik, bei der ein Sprachmodell durch menschliches Feedback gezielt auf nützliche, harmlose und ehrliche Antworten ausgerichtet wird.

AIFortgeschrittenalignmentreinforcement-learningfine-tuning

RLHF – Reinforcement Learning from Human Feedback

RLHF ist die Methode, mit der moderne LLMs wie GPT-4 oder Claude von rohen Sprachmodellen zu hilfreichen Assistenten werden. Das Modell lernt nicht mehr nur, den nächsten Token vorherzusagen, sondern antwortet so, wie es menschliche Bewerter bevorzugen würden.

Wie funktioniert RLHF?

Der Prozess besteht aus drei Phasen:

1. Supervised Fine-Tuning (SFT)
Zuerst wird das Basismodell auf hochwertigen, von Menschen erstellten Beispiel-Dialogen feinabgestimmt.

2. Reward Model Training
Menschliche Bewerter vergleichen mehrere Modellantworten und ranken sie. Ein separates Reward Model lernt, diese Präferenzen vorherzusagen.

Prompt: "Erkläre Quantencomputing einfach."

Antwort A: "Qubits nutzen Superposition..." → Rang 1 (klar, verständlich)
Antwort B: "Das ist kompliziert..."          → Rang 2 (ausweichend)
Antwort C: "42"                              → Rang 3 (nutzlos)

Reward Model lernt: Score(A) > Score(B) > Score(C)

3. RL-Optimierung mit PPO
Das Sprachmodell wird mit dem Reinforcement-Learning-Algorithmus PPO (Proximal Policy Optimization) trainiert. Das Reward Model gibt dabei den Reward-Signal zurück – das Sprachmodell maximiert diesen Score.

# Vereinfachtes Konzept (pseudocode)
for prompt in training_prompts:
    response = language_model.generate(prompt)
    reward = reward_model.score(prompt, response)
    # PPO aktualisiert LM-Gewichte, um reward zu maximieren
    ppo_trainer.step(prompt, response, reward)

Warum ist RLHF wichtig?

Ohne RLHFMit RLHF
Kann schädliche Inhalte generierenLehnt schädliche Anfragen ab
Antwortet oft inkohärentBleibt beim Thema
Halluziniert häufigerGibt Unsicherheiten eher zu
Ignoriert AnweisungenFolgt Instruktionen besser

Varianten und Weiterentwicklungen

  • RLAIF (RL from AI Feedback): Statt menschlicher Bewerter übernimmt ein anderes LLM das Ranking – skaliert besser, aber mit eigenen Biases
  • DPO (Direct Preference Optimization): Vereinfacht RLHF, indem das Reward Model wegfällt und Präferenzen direkt ins Training einfließen
  • Constitutional AI (Anthropic): Ergänzt RLHF durch explizite Regeln ("Constitution"), nach denen das Modell sich selbst bewertet

Praktische Relevanz für Entwickler

Wenn du mit RLHF-trainierten Modellen über eine API arbeitest, profitierst du direkt:

  • System-Prompts werden respektiert
  • Das Modell folgt dem Instruction-Format
  • Guardrails greifen bei problematischen Prompts

Bei eigenem Fine-Tuning mit Libraries wie trl (Transformers Reinforcement Learning) kannst du RLHF auch auf eigene Use-Cases anwenden:

from trl import PPOTrainer, PPOConfig, AutoModelForCausalLMWithValueHead

config = PPOConfig(model_name="gpt2", learning_rate=1.41e-5)
model = AutoModelForCausalLMWithValueHead.from_pretrained(config.model_name)

ppo_trainer = PPOTrainer(config, model, ref_model, tokenizer)
# Training-Loop mit eigenem Reward Model

Grenzen von RLHF

  • Reward Hacking: Das Modell optimiert auf den Reward-Score, nicht auf echte Qualität
  • Human Bias: Bewerter-Präferenzen spiegeln kulturelle und persönliche Vorurteile wider
  • Teuer: Menschliches Feedback ist zeitaufwändig und kostspielig zu sammeln
  • Alignment-Gap: RLHF reduziert Probleme, löst sie aber nicht vollständig

Inhouse statt Nachschlagewerk

Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.