Lokale KI
Lokaler RAG-Assistent auf eigener Infrastruktur
Referenz für einen lokalen Assistenten mit eigenem Modell, internen Dokumenten, Quellenangaben und kontrollierten Zugriffsrechten.
Kurzantwort: Ein lokaler RAG-Assistent kombiniert eine interne Suche mit einem auf eigener Infrastruktur betriebenen Sprachmodell. Er kann sinnvoll sein, wenn Datenübertragung, Offline-Betrieb oder planbare Nutzung wichtiger sind als maximale Modellqualität und elastische Cloud-Skalierung.
Abgrenzung
RAG steht für Retrieval-Augmented Generation. Das Modell wird nicht mit allen Unternehmensdaten neu trainiert. Stattdessen sucht die Anwendung passende Textstellen und stellt sie dem Modell für eine konkrete Antwort bereit.
„Lokal“ kann dabei zwei unterschiedliche Dinge bedeuten:
- On-device: Modell und Daten laufen auf einer einzelnen Workstation.
- On-Premises: Ein zentraler Server bedient mehrere autorisierte Nutzer.
Eine Private Cloud ist kontrolliert, aber nicht lokal. Diese Begriffe sollten in Architektur und Angebot getrennt bleiben.
Kernkomponenten
Benutzer -> Anmeldung -> berechtigte Suche -> Kontextauswahl
-> lokales Sprachmodell -> Antwort -> Quellen und Feedback
Benötigt werden Dokumentimport, Embeddings, Suchindex, Inferenzserver, Anwendungsoberfläche, Identitätsanbindung und Monitoring. Ollama kann einen Piloten vereinfachen; für größere Nutzerzahlen müssen Parallelität, Modellverwaltung und Betriebsanforderungen gesondert bewertet werden.
Hardware nicht nach Modellnamen kaufen
Der Hardwarebedarf ergibt sich aus Modellgröße, Quantisierung, Kontextlänge, gleichzeitigen Nutzern und gewünschter Geschwindigkeit. Ein Benchmark aus dem Internet ersetzt keinen Test mit dem eigenen Prompt, den eigenen Dokumenten und der geplanten Parallelität.
Der Pilot sollte deshalb mindestens messen:
- Zeit bis zum ersten Token
- Antwortdauer und Tokens pro Sekunde
- Speicherbedarf bei realer Kontextlänge
- Verhalten bei parallelen Anfragen
- Qualität gegen einen definierten Fragensatz
- Energie- und Betriebsaufwand
Sicherheitsanforderungen
Ein lokaler Server verhindert nicht automatisch unberechtigten Zugriff. Die Anwendung benötigt Rollen, Mandantentrennung, Protokollierung, verschlüsselte Übertragung, Patch-Prozess und Regeln für gespeicherte Chats.
Besonders wichtig: Die Vektorsuche darf keine Abschnitte aus Dokumenten liefern, die der fragende Nutzer nicht öffnen dürfte.
Wann Cloud besser sein kann
Cloud-Modelle sind häufig sinnvoller, wenn höchste Modellqualität, schwankende Last, schnelle Verfügbarkeit oder geringer interner Betriebsaufwand entscheidend sind. Auch eine hybride Lösung ist möglich: lokale Suche und Datenfilterung, anschließend ein freigegebener Cloud-Aufruf mit minimiertem Kontext.
Ergebnis eines Readiness-Workshops
Ein Readiness-Workshop sollte keine pauschale Produktempfehlung liefern. Erwartbar sind eine Datenklassifikation, Qualitätsziele, Modell- und Hardwaretests, eine Architekturvariante sowie ein realistischer Plan für Pilot und Betrieb.
Passender nächster Schritt
Diesen Anwendungsfall für Ihr Unternehmen bewerten.
Wir klären mit Ihnen Daten, Qualitätsziel, Betriebsmodell und einen realistischen Pilotumfang und passen die Referenzarchitektur an Ihre tatsächliche Umgebung an.