Quantisierung
Quantisierung reduziert die numerische Präzision von Modellgewichten (z.B. von 32-Bit auf 4-Bit), um Speicherbedarf und Inferenzgeschwindigkeit drastisch zu verbessern – oft mit minimalem Qualitätsverlust.
Quantisierung
Quantisierung ist eine Technik zur Modellkomprimierung, bei der die Gewichte und Aktivierungen eines neuronalen Netzes in niedrigere Bit-Formate konvertiert werden. Ein GPT-ähnliches Modell mit 7 Milliarden Parametern belegt in voller float32-Präzision etwa 28 GB VRAM – nach 4-Bit-Quantisierung nur noch ~4 GB.
Wie funktioniert es?
Statt jeden Gewichtswert als 32-Bit- oder 16-Bit-Gleitkommazahl zu speichern, werden Werte auf einen kleineren Wertebereich abgebildet:
| Format | Bits | Speicher (7B Modell) | Qualitätsverlust |
|---|---|---|---|
| float32 | 32 | ~28 GB | Referenz |
| float16/bfloat16 | 16 | ~14 GB | minimal |
| int8 | 8 | ~7 GB | gering |
| int4 / GGUF Q4 | 4 | ~3.5–4 GB | moderat |
Quantisierungsarten
Post-Training Quantization (PTQ): Das bereits trainierte Modell wird nachträglich quantisiert – einfach und weit verbreitet.
Quantization-Aware Training (QAT): Quantisierungseffekte werden bereits beim Training simuliert, was bessere Ergebnisse liefert, aber teurer ist.
GGUF/GGML (llama.cpp): Populäres Format für CPU-Inferenz mit verschiedenen Quantisierungsstufen (Q2_K bis Q8_0).
Praxisbeispiel mit llama.cpp / Ollama
# Modell in verschiedenen Quantisierungsstufen pullen
ollama pull llama3:8b-instruct-q4_0 # 4-Bit, ~4.7 GB
ollama pull llama3:8b-instruct-q8_0 # 8-Bit, ~8.5 GB
# Mit Hugging Face Transformers + bitsandbytes (8-Bit)
from transformers import AutoModelForCausalLM, BitsAndBytesConfig
import torch
quant_config = BitsAndBytesConfig(
load_in_4bit=True,
bnb_4bit_compute_dtype=torch.bfloat16,
bnb_4bit_use_double_quant=True, # QLoRA-Stil
bnb_4bit_quant_type="nf4" # NormalFloat4
)
model = AutoModelForCausalLM.from_pretrained(
"meta-llama/Meta-Llama-3-8B",
quantization_config=quant_config,
device_map="auto"
)
# Spart ~75% VRAM gegenüber float32
Wann lohnt sich Quantisierung?
- Lokale Inferenz auf Consumer-Hardware (keine High-End-GPU)
- Deployment in ressourcenbeschränkten Umgebungen (Edge, Mobile)
- Kostenreduktion bei Cloud-Inferenz durch kleinere Instanzen
- Schnelleres Prototyping mit großen Modellen
Trade-offs beachten
Stark quantisierte Modelle (Q2, Q3) können bei komplexen Reasoning-Aufgaben spürbar schwächer sein. Für Produktion ist Q4_K_M oder Q5_K_M oft der beste Kompromiss zwischen Größe und Qualität. Quantisierung ersetzt kein Fine-Tuning und kann Halluzinationen leicht verstärken.
Verwandte Begriffe
Inhouse statt Nachschlagewerk
Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.