llama.cpp
llama.cpp ist eine Open-Source C++-Implementierung für LLM-Inferenz, die es ermöglicht, große Sprachmodelle auf normalen CPUs und GPUs auszuführen — ohne teure Cloud-Infrastruktur.
ToolsExpertellminferenzopen-source
llama.cpp
llama.cpp ist eine in C/C++ geschriebene Bibliothek für die lokale Ausführung von Large Language Models. Sie ist die technische Grundlage für Tools wie Ollama und LM Studio.
Warum llama.cpp?
- Reine CPU-Inferenz: Kein GPU zwingend nötig
- Quantisierung: Unterstützt GGUF-Format für komprimierte Modelle
- Plattformübergreifend: Linux, macOS, Windows
- Optimiert: SIMD, Metal (Apple), CUDA (NVIDIA), Vulkan
Wer nutzt es?
- Ollama: Wrapper um llama.cpp mit einfacher CLI
- LM Studio: GUI-Wrapper für Desktop
- Entwickler: Direkte Integration in C/C++/Python-Projekte
Für wen?
llama.cpp direkt zu nutzen ist für fortgeschrittene Entwickler. Die meisten Nutzer greifen besser zu Ollama oder LM Studio.
Verwandte Begriffe
Inhouse statt Nachschlagewerk
Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.