Named Entity Recognition (NER)
Named Entity Recognition (NER) ist eine NLP-Aufgabe, bei der Algorithmen automatisch benannte Entitäten wie Personen, Orte, Organisationen oder Datumsangaben in einem Text identifizieren und klassifizieren.
Was ist Named Entity Recognition (NER)?
NER ist ein klassisches Natural Language Processing (NLP)-Verfahren, das strukturierte Informationen aus unstrukturiertem Text extrahiert. Ein NER-Modell scannt einen Satz und markiert Wörter oder Phrasen mit vordefinierten Kategorien wie:
- PER – Personen (
Angela Merkel) - ORG – Organisationen (
Deutsche Bank) - LOC – Orte (
Berlin,Bayern) - DATE – Zeitangaben (
12. März 2024) - MISC – Sonstiges (
iPhone 15)
Wie funktioniert NER?
Moderne NER-Systeme basieren auf Transformer-Architekturen (z. B. BERT, spaCy-Modelle). Das Modell gibt jedem Token ein Label in einem sogenannten BIO-Schema:
- B (Beginning) – Beginn einer Entität
- I (Inside) – Fortsetzung einer Entität
- O (Outside) – kein Teil einer Entität
Praxisbeispiel mit spaCy
import spacy
nlp = spacy.load("de_core_news_sm")
text = "Elon Musk gründete SpaceX im Jahr 2002 in Hawthorne."
doc = nlp(text)
for ent in doc.ents:
print(f"{ent.text:20} → {ent.label_}")
# Ausgabe:
# Elon Musk → PER
# SpaceX → ORG
# 2002 → DATE
# Hawthorne → LOC
NER mit LLMs
Moderne LLMs können NER auch ohne spezialisiertes Modell durchführen – per Zero-Shot- oder Few-Shot-Prompting:
prompt = """
Extrahiere alle Entitäten aus dem folgenden Text und gib sie als JSON zurück.
Kategorien: PER, ORG, LOC, DATE
Text: "Olaf Scholz traf sich am Montag mit Vertretern der Siemens AG in München."
"""
# LLM-Antwort:
# {"PER": ["Olaf Scholz"], "ORG": ["Siemens AG"], "LOC": ["München"], "DATE": ["Montag"]}
Typische Anwendungsfälle
- Dokumentenverarbeitung: Rechnungen, Verträge automatisch auslesen
- RAG-Pipelines: Entitäten als Metadaten für besseres Retrieval speichern
- Compliance: Automatische Erkennung personenbezogener Daten (DSGVO)
- Wissensgraphen: Beziehungen zwischen Entitäten extrahieren
Wichtige Hinweise
- Spezialisierte NER-Modelle (spaCy, Flair) sind oft schneller und kostengünstiger als LLMs
- LLMs bieten mehr Flexibilität für unbekannte Entitätstypen (Zero-Shot)
- Für Produktionssysteme mit hohem Durchsatz empfiehlt sich Batch Processing mit spezialisierten Modellen
Verwandte Begriffe
Inhouse statt Nachschlagewerk
Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.