Dokumenten-KI
Dokumente lokal mit Docling und Ollama verarbeiten
Referenzarchitektur für die lokale Extraktion, Strukturierung und Suche in PDFs, Office-Dokumenten und gescannten Unterlagen.
Kurzantwort: Docling kann Dokumente in eine strukturierte Repräsentation überführen, bevor ein lokales Sprachmodell oder eine RAG-Anwendung damit arbeitet. Die Referenzarchitektur hält Originaldateien, extrahierte Inhalte, Embeddings und Modellinferenz in einer kontrollierten Umgebung. Sie ist ein Ausgangspunkt für einen Piloten, kein behauptetes Kundenprojekt und kein allgemeiner Qualitätsnachweis.
Für wen ist dieser Use Case geeignet?
Der Ansatz ist interessant für Unternehmen, die viele PDFs, Office-Dateien oder gescannte Unterlagen verarbeiten und Inhalte nicht ohne Prüfung an öffentliche KI-Dienste übertragen möchten. Typische Quellen sind technische Dokumentationen, Verträge, Handbücher, Qualitätsunterlagen, Angebote oder interne Richtlinien.
Er eignet sich besonders, wenn Struktur wichtig ist: Überschriften, Tabellen, Seitenbezüge und Textblöcke sollen nicht zu einem unkontrollierten Textstrom werden.
Ausgangssituation
Dokumente liegen häufig in Dateiablagen, SharePoint, E-Mail-Anhängen oder Fachsystemen. Die Suche kennt zwar Dateinamen und einzelne Wörter, beantwortet aber keine fachlichen Fragen. Manuelle Übertragung kostet Zeit und verliert Tabellen, Seitenbezüge oder Dokumentstruktur.
Ein belastbarer Prozess muss deshalb mehr leisten als „PDF hochladen und Chat starten“:
- Dateityp und Berechtigung prüfen.
- Inhalt und Struktur extrahieren.
- Qualität und problematische Seiten sichtbar machen.
- Inhalte in sinnvolle Abschnitte teilen.
- Nur erlaubte Inhalte für Suche oder Zusammenfassung bereitstellen.
- Antworten mit nachvollziehbaren Quellen ausgeben.
Referenzarchitektur
Dokumentquelle
-> Upload und Dateiprüfung
-> Docling: Parsing, OCR und Struktur
-> normalisiertes Dokumentformat
-> Qualitätskontrolle
-> Chunking und Metadaten
-> Embedding-Modell
-> Vektorsuche
-> lokales Modell über Ollama
-> Antwort mit Dokument- und Seitenbezug
| Baustein | Aufgabe |
|---|---|
| Docling | Dokumentstruktur, Text, Tabellen und Seiteninformationen extrahieren |
| Objektspeicher | Originale und verarbeitete Artefakte getrennt ablegen |
| Metadatenbank | Quelle, Version, Berechtigung und Verarbeitungsstatus speichern |
| Embedding-Modell | Suchbare Repräsentationen der Abschnitte erzeugen |
| Vektorsuche | Relevante Abschnitte für eine Frage ermitteln |
| Ollama | Ein lokales Sprachmodell kontrolliert bereitstellen |
| Anwendung | Quellen, Rollen, Feedback und Freigaben abbilden |
Was muss im Pilot getestet werden?
Ein Pilot sollte keine erfundenen Erfolgswerte übernehmen. Er benötigt einen repräsentativen Testsatz und vorab definierte Kriterien:
- Werden Text-PDFs, Scans und gemischte Dokumente korrekt erkannt?
- Bleiben Tabellenzeilen und Spalten semantisch nutzbar?
- Lassen sich Antworten auf die richtige Seite und Dokumentversion zurückführen?
- Werden unlesbare oder passwortgeschützte Dateien sauber abgewiesen?
- Bleiben Zugriffsrechte auch in Suchindex und Cache erhalten?
- Wie lange dauern Import und Antwort auf der vorhandenen Hardware?
- Welche Fragen darf das System ausdrücklich nicht beantworten?
Sicherheit und Betrieb
Lokaler Betrieb ist kein automatischer Datenschutzbeleg. Benötigt werden mindestens Rollen, Protokollierung, Löschregeln, Backup, Update-Prozess und eine klare Trennung zwischen Originaldatei und abgeleiteten Daten. Embeddings und extrahierter Text können ebenfalls vertraulich sein.
Bei mehreren Abteilungen sollte die Berechtigung vor der Suche greifen. Ein nachträgliches Ausblenden in der Benutzeroberfläche reicht nicht aus.
Grenzen
Komplexe Tabellen, handschriftliche Notizen, schlechte Scans und ungewöhnliche Layouts können zusätzliche OCR- oder Validierungsschritte erfordern. Ein lokales Modell kann außerdem qualitativ schwächer sein als ein großes Cloud-Modell. Eine hybride Lösung kann deshalb sinnvoller sein als ein pauschales „alles lokal“.
Sinnvoller Projektumfang
Ein erster Pilot verwendet wenige, repräsentative Dokumentklassen statt der gesamten Ablage. Das Ergebnis sollte eine dokumentierte Qualitätsbewertung, eine Architekturentscheidung und eine belastbare Schätzung für Hardware, Betrieb und Rollout sein.
Passender nächster Schritt
Diesen Anwendungsfall für Ihr Unternehmen bewerten.
Wir klären mit Ihnen Daten, Qualitätsziel, Betriebsmodell und einen realistischen Pilotumfang und passen die Referenzarchitektur an Ihre tatsächliche Umgebung an.