GPU-Offloading
GPU-Offloading verteilt die Berechnung eines KI-Modells zwischen CPU und GPU. Layer, die auf die GPU passen, werden dort schneller verarbeitet — der Rest läuft auf der CPU.
CodingFortgeschrittenhardwareperformanceinferenz
GPU-Offloading
GPU-Offloading ist eine Technik, bei der Teile eines KI-Modells auf die Grafikkarte (GPU) ausgelagert werden, während der Rest auf der CPU läuft.
Warum GPU-Offloading?
Große Sprachmodelle benötigen oft mehr VRAM als verfügbar ist:
- Ein 7B-Modell in Q4: ~4 GB VRAM
- Ein 27B-Modell in Q4: ~16 GB VRAM
- Ein 70B-Modell in Q4: ~40 GB VRAM
Mit GPU-Offloading kannst du z.B. 20 von 32 Layern auf eine 8GB-GPU laden und den Rest auf der CPU berechnen.
Performance-Impact
- Volle GPU: Schnellste Inferenz
- Teilweises Offloading: Deutlich schneller als nur CPU
- Nur CPU: Funktioniert, aber langsam
Tools mit GPU-Offloading
- LM Studio (automatisch)
- Ollama (automatisch)
- llama.cpp (manuell konfigurierbar)
Verwandte Begriffe
Inhouse statt Nachschlagewerk
Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.