Transformer
Der Transformer ist eine neuronale Netzwerkarchitektur, die seit ihrer Einführung 2017 die Grundlage nahezu aller modernen Sprachmodelle (LLMs) bildet – von GPT über BERT bis hin zu aktuellen Multimodal-Modellen.
Was ist ein Transformer?
Der Transformer ist eine Modellarchitektur, die 2017 im Paper "Attention Is All You Need" (Vaswani et al.) vorgestellt wurde. Statt sequenziell wie RNNs oder LSTMs arbeitet ein Transformer parallel über alle Token einer Eingabe – das macht ihn deutlich effizienter und skalierbarer.
Das Herzstück ist der Self-Attention-Mechanismus: Er erlaubt dem Modell, für jedes Token zu berechnen, wie relevant alle anderen Token im Kontext sind.
Architektur auf einen Blick
Eingabe-Token
↓
[Embedding + Positional Encoding]
↓
[Multi-Head Self-Attention]
↓
[Feed-Forward Layer]
↓
(N × wiederholt)
↓
Ausgabe (Logits über Vokabular)
Moderne LLMs wie GPT-4 oder LLaMA nutzen ausschließlich den Decoder-Teil (autoregressive Textgenerierung), während Modelle wie BERT den Encoder verwenden (Klassifikation, Embeddings). T5 und ähnliche Modelle nutzen Encoder + Decoder.
Warum ist das für Entwickler relevant?
- Context Window: Die maximale Sequenzlänge, die ein Transformer verarbeiten kann, ist architekturbedingt begrenzt – Attention skaliert quadratisch mit der Token-Anzahl.
- Token-basierte Verarbeitung: Alles läuft über Token, nicht über Wörter oder Zeichen.
- Fine-Tuning & LoRA: Beim Anpassen von Transformern werden gezielt Gewichte (Weights) modifiziert.
# Transformer-Modell mit Hugging Face laden
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "meta-llama/Llama-3-8B"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name)
inputs = tokenizer("Erkläre Transformer in einem Satz:", return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=100)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
Wichtige Konzepte im Überblick
| Konzept | Bedeutung |
|---|---|
| Self-Attention | Beziehungen zwischen Token berechnen |
| Multi-Head Attention | Mehrere Attention-Perspektiven parallel |
| Positional Encoding | Position der Token im Satz kodieren |
| Layer Normalization | Stabilisierung des Trainings |
| Feed-Forward Layer | Nichtlineare Transformation pro Token |
Praxistipp
Für die meisten Entwickler ist die interne Transformer-Architektur abstrahiert – relevant wird sie, wenn du Fine-Tuning betreibst, das Context Window ausreizst oder Inferenz-Performance mit Quantisierung optimieren willst.
Verwandte Begriffe
Inhouse statt Nachschlagewerk
Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.