Zum Hauptinhalt

llama.cpp

llama.cpp ist eine Open-Source C++-Implementierung für LLM-Inferenz, die es ermöglicht, große Sprachmodelle auf normalen CPUs und GPUs auszuführen — ohne teure Cloud-Infrastruktur.

ToolsExpertellminferenzopen-source

llama.cpp

llama.cpp ist eine in C/C++ geschriebene Bibliothek für die lokale Ausführung von Large Language Models. Sie ist die technische Grundlage für Tools wie Ollama und LM Studio.

Warum llama.cpp?

  • Reine CPU-Inferenz: Kein GPU zwingend nötig
  • Quantisierung: Unterstützt GGUF-Format für komprimierte Modelle
  • Plattformübergreifend: Linux, macOS, Windows
  • Optimiert: SIMD, Metal (Apple), CUDA (NVIDIA), Vulkan

Wer nutzt es?

  • Ollama: Wrapper um llama.cpp mit einfacher CLI
  • LM Studio: GUI-Wrapper für Desktop
  • Entwickler: Direkte Integration in C/C++/Python-Projekte

Für wen?

llama.cpp direkt zu nutzen ist für fortgeschrittene Entwickler. Die meisten Nutzer greifen besser zu Ollama oder LM Studio.

Inhouse statt Nachschlagewerk

Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.