Zum Hauptinhalt

GPU-Offloading

GPU-Offloading verteilt die Berechnung eines KI-Modells zwischen CPU und GPU. Layer, die auf die GPU passen, werden dort schneller verarbeitet — der Rest läuft auf der CPU.

CodingFortgeschrittenhardwareperformanceinferenz

GPU-Offloading

GPU-Offloading ist eine Technik, bei der Teile eines KI-Modells auf die Grafikkarte (GPU) ausgelagert werden, während der Rest auf der CPU läuft.

Warum GPU-Offloading?

Große Sprachmodelle benötigen oft mehr VRAM als verfügbar ist:

  • Ein 7B-Modell in Q4: ~4 GB VRAM
  • Ein 27B-Modell in Q4: ~16 GB VRAM
  • Ein 70B-Modell in Q4: ~40 GB VRAM

Mit GPU-Offloading kannst du z.B. 20 von 32 Layern auf eine 8GB-GPU laden und den Rest auf der CPU berechnen.

Performance-Impact

  • Volle GPU: Schnellste Inferenz
  • Teilweises Offloading: Deutlich schneller als nur CPU
  • Nur CPU: Funktioniert, aber langsam

Tools mit GPU-Offloading

  • LM Studio (automatisch)
  • Ollama (automatisch)
  • llama.cpp (manuell konfigurierbar)

Inhouse statt Nachschlagewerk

Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.