Zum Hauptinhalt

Ollama

Ollama ist ein Open-Source-Tool, das es Entwicklern ermöglicht, Large Language Models wie LLaMA, Mistral oder Gemma direkt auf dem eigenen Rechner auszuführen – ohne Cloud-Anbindung oder API-Kosten.

ToolsAnfängerllmlocal-aiopen-source

Was ist Ollama?

Ollama ist ein lokales Laufzeit-Tool für Open-Source-LLMs. Es abstrahiert die komplexe Installation und Konfiguration von Modellen und stellt eine einfache CLI sowie eine REST-API bereit. Entwickler können damit Modelle wie LLaMA 3, Mistral, Gemma oder Code Llama mit wenigen Befehlen herunterladen und ausführen.

Wofür nutzt man Ollama?

  • Lokale Entwicklung und Prototyping ohne Cloud-Abhängigkeit
  • Datenschutzsensible Anwendungen, bei denen keine Daten das eigene Netzwerk verlassen dürfen
  • Kostenreduktion bei häufigen oder umfangreichen Inferenz-Anfragen
  • Offline-Szenarien ohne Internetverbindung
  • Integration in eigene Anwendungen über die lokale REST-API oder SDKs

Installation und erste Schritte

# Installation (macOS/Linux)
curl -fsSL https://ollama.com/install.sh | sh

# Modell herunterladen und starten
ollama run llama3

# Modell im Hintergrund starten (API-Server)
ollama serve

# Verfügbare Modelle auflisten
ollama list

REST-API nutzen

Ollama startet automatisch einen lokalen API-Server auf http://localhost:11434, der weitgehend kompatibel mit der OpenAI-API ist:

curl http://localhost:11434/api/generate \
  -d '{
    "model": "mistral",
    "prompt": "Erkläre REST-APIs in zwei Sätzen.",
    "stream": false
  }'

Oder via Python mit dem offiziellen SDK:

import ollama

response = ollama.chat(
    model='llama3',
    messages=[{'role': 'user', 'content': 'Was ist ein Transformer?'}]
)
print(response['message']['content'])

Vorteile

VorteilBeschreibung
DatenschutzAlle Daten bleiben lokal, kein Drittanbieter-Zugriff
KostenlosKeine API-Kosten pro Token
Einfache InstallationEin Befehl, läuft auf macOS, Linux und Windows
OpenAI-kompatible APIBestehende Tooling-Integrationen funktionieren oft direkt
ModellvielfaltHunderte Modelle im öffentlichen Registry verfügbar

Nachteile

  • Hardware-Anforderungen: Größere Modelle (≥ 13B Parameter) benötigen leistungsfähige GPUs oder viel RAM
  • Modellqualität: Open-Source-Modelle erreichen teilweise nicht die Qualität proprietärer Modelle wie GPT-4
  • Kein Managed Service: Updates, Skalierung und Betrieb liegen beim Entwickler selbst
  • Langsame Inferenz auf reiner CPU ohne dedizierte GPU

Tipp: Quantisierung

Ollama lädt standardmäßig quantisierte Modellversionen (z. B. 4-Bit), die deutlich weniger RAM benötigen und auf Consumer-Hardware lauffähig sind – bei akzeptablem Qualitätsverlust.

Inhouse statt Nachschlagewerk

Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.