Context Window
Das Context Window definiert, wie viel Text (in Tokens gemessen) ein KI-Modell gleichzeitig 'sehen' und verarbeiten kann – also die maximale Länge von Eingabe und Ausgabe zusammen.
Was ist ein Context Window?
Das Context Window (auch: Kontextfenster) ist das 'Arbeitsgedächtnis' eines Large Language Models. Es legt fest, wie viele Tokens das Modell bei einer Anfrage insgesamt berücksichtigen kann – inklusive System-Prompt, Chatverlauf, Nutzereingabe und generierter Antwort.
Alles, was außerhalb dieses Fensters liegt, ist für das Modell schlicht nicht vorhanden – es kann nicht darauf zugreifen oder sich daran 'erinnern'.
Wie groß sind typische Context Windows?
| Modell | Context Window |
|---|---|
| GPT-3.5 Turbo | 16.385 Tokens (~12.000 Wörter) |
| GPT-4o | 128.000 Tokens (~96.000 Wörter) |
| Claude 3.5 Sonnet | 200.000 Tokens (~150.000 Wörter) |
| Gemini 1.5 Pro | 1.000.000 Tokens |
Praktisches Beispiel
Beim Aufbau eines Chatbots muss der gesamte Gesprächsverlauf im Context Window Platz finden:
client = OpenAI()
# Alles zusammen muss ins Context Window passen:
messages = [
{"role": "system", "content": "Du bist ein hilfreicher Assistent."}, # System-Prompt
{"role": "user", "content": "Erkläre mir Python."}, # Frühere Nachrichten
{"role": "assistant", "content": "Python ist eine Programmiersprache..."},
{"role": "user", "content": "Wie funktionieren Listen?"} # Aktuelle Frage
]
response = client.chat.completions.create(
model="gpt-4o",
messages=messages,
max_tokens=500 # Platz für die Antwort muss ebenfalls einkalkuliert werden
)
Was passiert, wenn das Context Window voll ist?
Wenn der Verlauf zu lang wird, gibt es drei typische Strategien:
- Truncation: Ältere Nachrichten werden einfach abgeschnitten (Informationsverlust)
- Summarization: Der bisherige Verlauf wird zusammengefasst und komprimiert
- RAG: Relevante Informationen werden dynamisch aus einer externen Datenbank geladen
Warum ist das für Entwickler wichtig?
- Kosten: Mehr Tokens im Context = höhere API-Kosten pro Request
- Latenz: Größere Context Windows erhöhen die Antwortzeit
- Architektur: Langfristige Konversations-Apps brauchen eine Strategie zum Context-Management
- Qualität: Zu volle Kontextfenster können die Antwortqualität verschlechtern ('Lost in the Middle'-Problem)
Faustregel: Zähle Tokens vor dem API-Call mit Libraries wie
tiktoken(OpenAI) und plane immer ausreichend Puffer für die Ausgabe ein.
Verwandte Begriffe
Inhouse statt Nachschlagewerk
Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.