Inference
Inference bezeichnet den Prozess, bei dem ein trainiertes KI-Modell auf neue Eingaben angewendet wird, um Vorhersagen oder Ausgaben zu generieren – also der produktive Einsatz des Modells nach dem Training.
Inference
Inference (dt. Inferenz oder Schlussfolgerung) ist der Moment, in dem ein bereits trainiertes Modell tatsächlich "arbeitet": Es empfängt einen Input (z. B. einen Prompt, ein Bild oder Audio), verarbeitet ihn durch seine gelernten Gewichte und liefert einen Output zurück.
Training vs. Inference
Der Unterschied ist grundlegend:
| Phase | Ziel | Rechenaufwand |
|---|---|---|
| Training | Gewichte lernen | Sehr hoch (Wochen, viele GPUs) |
| Inference | Gewichte anwenden | Geringer, aber latenzabhängig |
Während das Training einmalig (oder periodisch) stattfindet, läuft Inference bei jeder einzelnen Nutzeranfrage.
Wie Inference in der Praxis aussieht
Bei der Nutzung eines LLMs über eine API ist jeder API-Call ein Inference-Vorgang:
import openai
client = openai.OpenAI()
# Dieser API-Call triggert genau einen Inference-Durchlauf
response = client.chat.completions.create(
model="gpt-4o",
messages=[
{"role": "user", "content": "Was ist Inference?"}
],
temperature=0.7,
max_tokens=256
)
print(response.choices[0].message.content)
Wichtige Kennzahlen bei Inference
- Latenz: Zeit vom Request bis zur ersten Antwort (Time to First Token, TTFT)
- Throughput: Wie viele Tokens pro Sekunde generiert werden
- Kosten: Werden meist pro Token (Input + Output) berechnet
- Batch-Inference: Mehrere Anfragen gleichzeitig verarbeiten, um GPU-Auslastung zu maximieren
Inference-Optimierung
Für produktive Systeme gibt es mehrere Strategien:
- Quantisierung: Modellgewichte in kleinere Datentypen (z. B. INT8 statt FP32) konvertieren → schneller, weniger RAM
- Streaming: Tokens werden sofort ausgegeben, sobald sie generiert werden, statt auf die komplette Antwort zu warten
- Caching: Wiederholte Prompts (z. B. System-Prompts) werden zwischengespeichert
- LoRA/Adapter: Kleinere Zusatzgewichte ermöglichen spezialisierte Inference ohne volles Fine-Tuning
Self-Hosted vs. API-Inference
Entwickler haben zwei grundlegende Optionen:
# Option 1: Lokale Inference mit Ollama
ollama run llama3.2
# Option 2: Cloud-API (z. B. via OpenAI SDK)
pip install openai
Bei Self-Hosting trägt man die Hardware-Kosten selbst, gewinnt aber Kontrolle über Datenschutz und Latenz. Cloud-APIs bieten einfache Skalierung, aber abhängige Kosten- und Latenzstrukturen.
Verwandte Begriffe
Inhouse statt Nachschlagewerk
Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.