Zum Hauptinhalt

Transformer

Der Transformer ist eine neuronale Netzwerkarchitektur, die seit ihrer Einführung 2017 die Grundlage nahezu aller modernen Sprachmodelle (LLMs) bildet – von GPT über BERT bis hin zu aktuellen Multimodal-Modellen.

AIFortgeschrittentransformerdeep-learningllm-architektur

Was ist ein Transformer?

Der Transformer ist eine Modellarchitektur, die 2017 im Paper "Attention Is All You Need" (Vaswani et al.) vorgestellt wurde. Statt sequenziell wie RNNs oder LSTMs arbeitet ein Transformer parallel über alle Token einer Eingabe – das macht ihn deutlich effizienter und skalierbarer.

Das Herzstück ist der Self-Attention-Mechanismus: Er erlaubt dem Modell, für jedes Token zu berechnen, wie relevant alle anderen Token im Kontext sind.

Architektur auf einen Blick

Eingabe-Token
    ↓
[Embedding + Positional Encoding]
    ↓
[Multi-Head Self-Attention]
    ↓
[Feed-Forward Layer]
    ↓
(N × wiederholt)
    ↓
Ausgabe (Logits über Vokabular)

Moderne LLMs wie GPT-4 oder LLaMA nutzen ausschließlich den Decoder-Teil (autoregressive Textgenerierung), während Modelle wie BERT den Encoder verwenden (Klassifikation, Embeddings). T5 und ähnliche Modelle nutzen Encoder + Decoder.

Warum ist das für Entwickler relevant?

  • Context Window: Die maximale Sequenzlänge, die ein Transformer verarbeiten kann, ist architekturbedingt begrenzt – Attention skaliert quadratisch mit der Token-Anzahl.
  • Token-basierte Verarbeitung: Alles läuft über Token, nicht über Wörter oder Zeichen.
  • Fine-Tuning & LoRA: Beim Anpassen von Transformern werden gezielt Gewichte (Weights) modifiziert.
# Transformer-Modell mit Hugging Face laden
from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "meta-llama/Llama-3-8B"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name)

inputs = tokenizer("Erkläre Transformer in einem Satz:", return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=100)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

Wichtige Konzepte im Überblick

KonzeptBedeutung
Self-AttentionBeziehungen zwischen Token berechnen
Multi-Head AttentionMehrere Attention-Perspektiven parallel
Positional EncodingPosition der Token im Satz kodieren
Layer NormalizationStabilisierung des Trainings
Feed-Forward LayerNichtlineare Transformation pro Token

Praxistipp

Für die meisten Entwickler ist die interne Transformer-Architektur abstrahiert – relevant wird sie, wenn du Fine-Tuning betreibst, das Context Window ausreizst oder Inferenz-Performance mit Quantisierung optimieren willst.

Inhouse statt Nachschlagewerk

Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.