GGUF
GGUF (GPT-Generated Unified Format) ist das Standardformat für lokale LLM-Inferenz mit llama.cpp. Es ermöglicht das Ausführen großer Sprachmodelle auf normalen PCs.
ToolsFortgeschrittenllmquantisierunglokal
GGUF
GGUF (GPT-Generated Unified Format) ist ein Dateiformat für Large Language Models, das speziell für die lokale Ausführung auf Consumer-Hardware optimiert ist.
Warum GGUF?
- Quantisierung: Reduziert die Modellgröße drastisch (z.B. von 30GB auf 5GB)
- CPU-kompatibel: Läuft auch ohne teure GPU
- GPU-Offloading: Kann Teile des Modells auf die GPU auslagern
- Einheitlich: Ein Format für alle llama.cpp-kompatiblen Tools
Quantisierungsstufen
| Stufe | Größe | Qualität |
|---|---|---|
| Q2_K | Sehr klein | Spürbar schlechter |
| Q4_K_M | Mittel | Guter Kompromiss |
| Q6_K | Groß | Nahe am Original |
| Q8_0 | Sehr groß | Kaum Unterschied |
Tools für GGUF
- LM Studio: Grafische Oberfläche zum Herunterladen und Ausführen
- Ollama: CLI-Tool für lokale LLMs
- llama.cpp: Die zugrundeliegende C++-Bibliothek
Verwandte Begriffe
Inhouse statt Nachschlagewerk
Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.