Zum Hauptinhalt

Inference

Inference bezeichnet den Prozess, bei dem ein trainiertes KI-Modell auf neue Eingaben angewendet wird, um Vorhersagen oder Ausgaben zu generieren – also der produktive Einsatz des Modells nach dem Training.

AIFortgeschritteninferencellmdeployment

Inference

Inference (dt. Inferenz oder Schlussfolgerung) ist der Moment, in dem ein bereits trainiertes Modell tatsächlich "arbeitet": Es empfängt einen Input (z. B. einen Prompt, ein Bild oder Audio), verarbeitet ihn durch seine gelernten Gewichte und liefert einen Output zurück.

Training vs. Inference

Der Unterschied ist grundlegend:

PhaseZielRechenaufwand
TrainingGewichte lernenSehr hoch (Wochen, viele GPUs)
InferenceGewichte anwendenGeringer, aber latenzabhängig

Während das Training einmalig (oder periodisch) stattfindet, läuft Inference bei jeder einzelnen Nutzeranfrage.

Wie Inference in der Praxis aussieht

Bei der Nutzung eines LLMs über eine API ist jeder API-Call ein Inference-Vorgang:

import openai

client = openai.OpenAI()

# Dieser API-Call triggert genau einen Inference-Durchlauf
response = client.chat.completions.create(
    model="gpt-4o",
    messages=[
        {"role": "user", "content": "Was ist Inference?"}
    ],
    temperature=0.7,
    max_tokens=256
)

print(response.choices[0].message.content)

Wichtige Kennzahlen bei Inference

  • Latenz: Zeit vom Request bis zur ersten Antwort (Time to First Token, TTFT)
  • Throughput: Wie viele Tokens pro Sekunde generiert werden
  • Kosten: Werden meist pro Token (Input + Output) berechnet
  • Batch-Inference: Mehrere Anfragen gleichzeitig verarbeiten, um GPU-Auslastung zu maximieren

Inference-Optimierung

Für produktive Systeme gibt es mehrere Strategien:

  • Quantisierung: Modellgewichte in kleinere Datentypen (z. B. INT8 statt FP32) konvertieren → schneller, weniger RAM
  • Streaming: Tokens werden sofort ausgegeben, sobald sie generiert werden, statt auf die komplette Antwort zu warten
  • Caching: Wiederholte Prompts (z. B. System-Prompts) werden zwischengespeichert
  • LoRA/Adapter: Kleinere Zusatzgewichte ermöglichen spezialisierte Inference ohne volles Fine-Tuning

Self-Hosted vs. API-Inference

Entwickler haben zwei grundlegende Optionen:

# Option 1: Lokale Inference mit Ollama
ollama run llama3.2

# Option 2: Cloud-API (z. B. via OpenAI SDK)
pip install openai

Bei Self-Hosting trägt man die Hardware-Kosten selbst, gewinnt aber Kontrolle über Datenschutz und Latenz. Cloud-APIs bieten einfache Skalierung, aber abhängige Kosten- und Latenzstrukturen.

Inhouse statt Nachschlagewerk

Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.