Zum Hauptinhalt

GGUF

GGUF (GPT-Generated Unified Format) ist das Standardformat für lokale LLM-Inferenz mit llama.cpp. Es ermöglicht das Ausführen großer Sprachmodelle auf normalen PCs.

ToolsFortgeschrittenllmquantisierunglokal

GGUF

GGUF (GPT-Generated Unified Format) ist ein Dateiformat für Large Language Models, das speziell für die lokale Ausführung auf Consumer-Hardware optimiert ist.

Warum GGUF?

  • Quantisierung: Reduziert die Modellgröße drastisch (z.B. von 30GB auf 5GB)
  • CPU-kompatibel: Läuft auch ohne teure GPU
  • GPU-Offloading: Kann Teile des Modells auf die GPU auslagern
  • Einheitlich: Ein Format für alle llama.cpp-kompatiblen Tools

Quantisierungsstufen

StufeGrößeQualität
Q2_KSehr kleinSpürbar schlechter
Q4_K_MMittelGuter Kompromiss
Q6_KGroßNahe am Original
Q8_0Sehr großKaum Unterschied

Tools für GGUF

  • LM Studio: Grafische Oberfläche zum Herunterladen und Ausführen
  • Ollama: CLI-Tool für lokale LLMs
  • llama.cpp: Die zugrundeliegende C++-Bibliothek

Inhouse statt Nachschlagewerk

Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.