Zum Hauptinhalt

RAG (Retrieval Augmented Generation)

Eine Technik, die LLMs mit externem Wissen anreichert, indem relevante Dokumente vor der Antwort abgerufen werden.

AIFortgeschrittenembeddingsvektordatenbankllm

Was ist RAG?

Retrieval Augmented Generation (RAG) ist ein Architektur-Pattern, das ein LLM mit externem Wissen verbindet. Statt sich nur auf das Trainingswissen zu verlassen, werden relevante Dokumente vor der Antwortgenerierung abgerufen und als Kontext mitgegeben.

Warum RAG?

LLMs haben zwei grosse Limitierungen:

  1. Wissens-Cutoff: Das Training endet zu einem bestimmten Zeitpunkt
  2. Halluzinationen: Das Modell erfindet plausibel klingende aber falsche Antworten

RAG loest beide Probleme, indem es aktuelle, verifizierte Daten als Grundlage nutzt.

Wie funktioniert RAG?

Frage → Embedding → Vektordatenbank → Relevante Dokumente → LLM + Kontext → Antwort
  1. Indexierung: Dokumente werden in Chunks aufgeteilt und als Vektoren gespeichert
  2. Retrieval: Bei einer Frage wird der aehnlichste Chunk gefunden (Semantic Search)
  3. Generation: Das LLM erhaelt die Frage + die gefundenen Chunks als Kontext

Code-Beispiel

// Vereinfachtes RAG-Pattern
const embedding = await embed(userQuestion);
const relevantDocs = await vectorDb.search(embedding, { topK: 5 });

const response = await generateText({
  model: anthropic("claude-sonnet-4-6"),
  system: "Beantworte die Frage basierend auf dem Kontext.",
  prompt: `Kontext:\n${relevantDocs.join("\n")}\n\nFrage: ${userQuestion}`,
});

Typische Use Cases

  • Dokumentations-Chatbots: Beantworte Fragen zu deiner Codebasis
  • Wissensmanagement: Durchsuche interne Dokumente mit natuerlicher Sprache
  • Kundenservice: FAQ-Bot mit aktuellem Produktwissen

Inhouse statt Nachschlagewerk

Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.