Ollama
Ollama ist ein Open-Source-Tool, das es Entwicklern ermöglicht, Large Language Models wie LLaMA, Mistral oder Gemma direkt auf dem eigenen Rechner auszuführen – ohne Cloud-Anbindung oder API-Kosten.
Was ist Ollama?
Ollama ist ein lokales Laufzeit-Tool für Open-Source-LLMs. Es abstrahiert die komplexe Installation und Konfiguration von Modellen und stellt eine einfache CLI sowie eine REST-API bereit. Entwickler können damit Modelle wie LLaMA 3, Mistral, Gemma oder Code Llama mit wenigen Befehlen herunterladen und ausführen.
Wofür nutzt man Ollama?
- Lokale Entwicklung und Prototyping ohne Cloud-Abhängigkeit
- Datenschutzsensible Anwendungen, bei denen keine Daten das eigene Netzwerk verlassen dürfen
- Kostenreduktion bei häufigen oder umfangreichen Inferenz-Anfragen
- Offline-Szenarien ohne Internetverbindung
- Integration in eigene Anwendungen über die lokale REST-API oder SDKs
Installation und erste Schritte
# Installation (macOS/Linux)
curl -fsSL https://ollama.com/install.sh | sh
# Modell herunterladen und starten
ollama run llama3
# Modell im Hintergrund starten (API-Server)
ollama serve
# Verfügbare Modelle auflisten
ollama list
REST-API nutzen
Ollama startet automatisch einen lokalen API-Server auf http://localhost:11434, der weitgehend kompatibel mit der OpenAI-API ist:
curl http://localhost:11434/api/generate \
-d '{
"model": "mistral",
"prompt": "Erkläre REST-APIs in zwei Sätzen.",
"stream": false
}'
Oder via Python mit dem offiziellen SDK:
import ollama
response = ollama.chat(
model='llama3',
messages=[{'role': 'user', 'content': 'Was ist ein Transformer?'}]
)
print(response['message']['content'])
Vorteile
| Vorteil | Beschreibung |
|---|---|
| Datenschutz | Alle Daten bleiben lokal, kein Drittanbieter-Zugriff |
| Kostenlos | Keine API-Kosten pro Token |
| Einfache Installation | Ein Befehl, läuft auf macOS, Linux und Windows |
| OpenAI-kompatible API | Bestehende Tooling-Integrationen funktionieren oft direkt |
| Modellvielfalt | Hunderte Modelle im öffentlichen Registry verfügbar |
Nachteile
- Hardware-Anforderungen: Größere Modelle (≥ 13B Parameter) benötigen leistungsfähige GPUs oder viel RAM
- Modellqualität: Open-Source-Modelle erreichen teilweise nicht die Qualität proprietärer Modelle wie GPT-4
- Kein Managed Service: Updates, Skalierung und Betrieb liegen beim Entwickler selbst
- Langsame Inferenz auf reiner CPU ohne dedizierte GPU
Tipp: Quantisierung
Ollama lädt standardmäßig quantisierte Modellversionen (z. B. 4-Bit), die deutlich weniger RAM benötigen und auf Consumer-Hardware lauffähig sind – bei akzeptablem Qualitätsverlust.
Verwandte Begriffe
Inhouse statt Nachschlagewerk
Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.