Tokenizer
Ein Tokenizer zerlegt Text in kleinere Einheiten (Tokens), bevor ein Sprachmodell ihn verarbeiten kann – er ist die unsichtbare Schnittstelle zwischen menschlicher Sprache und maschinell verarbeitbaren Zahlen.
Was ist ein Tokenizer?
Bevor ein Large Language Model (LLM) Text verarbeiten kann, muss dieser in eine numerische Form gebracht werden. Genau das übernimmt der Tokenizer: Er zerlegt einen Eingabetext in sogenannte Tokens – das können Wörter, Wortteile, einzelne Zeichen oder auch Sonderzeichen sein – und weist jedem Token eine eindeutige Ganzzahl (Token-ID) zu.
Wie funktioniert das in der Praxis?
Moderne LLMs nutzen häufig Algorithmen wie Byte Pair Encoding (BPE) oder WordPiece. Dabei werden häufige Zeichenkombinationen zu einem einzigen Token zusammengefasst.
Ein Beispiel mit der tiktoken-Bibliothek von OpenAI:
import tiktoken
enc = tiktoken.encoding_for_model("gpt-4")
text = "Tokenizer sind wichtig!"
tokens = enc.encode(text)
print(tokens) # [6029, 17180, 12278, 1124, 14574, 0]
print(len(tokens)) # 6
# Zurück zu Text
print(enc.decode(tokens)) # "Tokenizer sind wichtig!"
Warum ist das für Entwickler relevant?
- Kosten: API-Anbieter wie OpenAI rechnen nach Token-Verbrauch ab – nicht nach Zeichen oder Wörtern.
- Context Window: Jedes Modell hat ein maximales Token-Limit. Wer lange Texte verarbeitet, muss die Token-Anzahl im Blick behalten.
- Sprachunterschiede: Nicht-englische Sprachen wie Deutsch benötigen oft mehr Tokens für denselben Inhalt, da die Tokenizer primär auf Englisch trainiert wurden.
- Debugging: Unerwartetes Modellverhalten lässt sich manchmal auf eine ungewöhnliche Tokenisierung zurückführen (z.B. bei Zahlen oder Sonderzeichen).
Tipp
Mit Tools wie dem OpenAI Tokenizer Playground kannst du direkt visualisieren, wie dein Text aufgeteilt wird – sehr hilfreich beim Optimieren von Prompts.
Verwandte Begriffe
Inhouse statt Nachschlagewerk
Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.