Zum Hauptinhalt

Context Window

Das Context Window definiert, wie viel Text (in Tokens gemessen) ein KI-Modell gleichzeitig 'sehen' und verarbeiten kann – also die maximale Länge von Eingabe und Ausgabe zusammen.

AIAnfängercontext-windowllmtoken

Was ist ein Context Window?

Das Context Window (auch: Kontextfenster) ist das 'Arbeitsgedächtnis' eines Large Language Models. Es legt fest, wie viele Tokens das Modell bei einer Anfrage insgesamt berücksichtigen kann – inklusive System-Prompt, Chatverlauf, Nutzereingabe und generierter Antwort.

Alles, was außerhalb dieses Fensters liegt, ist für das Modell schlicht nicht vorhanden – es kann nicht darauf zugreifen oder sich daran 'erinnern'.

Wie groß sind typische Context Windows?

ModellContext Window
GPT-3.5 Turbo16.385 Tokens (~12.000 Wörter)
GPT-4o128.000 Tokens (~96.000 Wörter)
Claude 3.5 Sonnet200.000 Tokens (~150.000 Wörter)
Gemini 1.5 Pro1.000.000 Tokens

Praktisches Beispiel

Beim Aufbau eines Chatbots muss der gesamte Gesprächsverlauf im Context Window Platz finden:

client = OpenAI()

# Alles zusammen muss ins Context Window passen:
messages = [
    {"role": "system", "content": "Du bist ein hilfreicher Assistent."},  # System-Prompt
    {"role": "user", "content": "Erkläre mir Python."},                    # Frühere Nachrichten
    {"role": "assistant", "content": "Python ist eine Programmiersprache..."},
    {"role": "user", "content": "Wie funktionieren Listen?"}              # Aktuelle Frage
]

response = client.chat.completions.create(
    model="gpt-4o",
    messages=messages,
    max_tokens=500  # Platz für die Antwort muss ebenfalls einkalkuliert werden
)

Was passiert, wenn das Context Window voll ist?

Wenn der Verlauf zu lang wird, gibt es drei typische Strategien:

  1. Truncation: Ältere Nachrichten werden einfach abgeschnitten (Informationsverlust)
  2. Summarization: Der bisherige Verlauf wird zusammengefasst und komprimiert
  3. RAG: Relevante Informationen werden dynamisch aus einer externen Datenbank geladen

Warum ist das für Entwickler wichtig?

  • Kosten: Mehr Tokens im Context = höhere API-Kosten pro Request
  • Latenz: Größere Context Windows erhöhen die Antwortzeit
  • Architektur: Langfristige Konversations-Apps brauchen eine Strategie zum Context-Management
  • Qualität: Zu volle Kontextfenster können die Antwortqualität verschlechtern ('Lost in the Middle'-Problem)

Faustregel: Zähle Tokens vor dem API-Call mit Libraries wie tiktoken (OpenAI) und plane immer ausreichend Puffer für die Ausgabe ein.

Inhouse statt Nachschlagewerk

Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.