Zum Hauptinhalt

Named Entity Recognition (NER)

Named Entity Recognition (NER) ist eine NLP-Aufgabe, bei der Algorithmen automatisch benannte Entitäten wie Personen, Orte, Organisationen oder Datumsangaben in einem Text identifizieren und klassifizieren.

AIFortgeschrittennlpinformation-extractiontext-mining

Was ist Named Entity Recognition (NER)?

NER ist ein klassisches Natural Language Processing (NLP)-Verfahren, das strukturierte Informationen aus unstrukturiertem Text extrahiert. Ein NER-Modell scannt einen Satz und markiert Wörter oder Phrasen mit vordefinierten Kategorien wie:

  • PER – Personen (Angela Merkel)
  • ORG – Organisationen (Deutsche Bank)
  • LOC – Orte (Berlin, Bayern)
  • DATE – Zeitangaben (12. März 2024)
  • MISC – Sonstiges (iPhone 15)

Wie funktioniert NER?

Moderne NER-Systeme basieren auf Transformer-Architekturen (z. B. BERT, spaCy-Modelle). Das Modell gibt jedem Token ein Label in einem sogenannten BIO-Schema:

  • B (Beginning) – Beginn einer Entität
  • I (Inside) – Fortsetzung einer Entität
  • O (Outside) – kein Teil einer Entität

Praxisbeispiel mit spaCy

import spacy

nlp = spacy.load("de_core_news_sm")

text = "Elon Musk gründete SpaceX im Jahr 2002 in Hawthorne."
doc = nlp(text)

for ent in doc.ents:
    print(f"{ent.text:20} → {ent.label_}")

# Ausgabe:
# Elon Musk            → PER
# SpaceX               → ORG
# 2002                 → DATE
# Hawthorne            → LOC

NER mit LLMs

Moderne LLMs können NER auch ohne spezialisiertes Modell durchführen – per Zero-Shot- oder Few-Shot-Prompting:

prompt = """
Extrahiere alle Entitäten aus dem folgenden Text und gib sie als JSON zurück.
Kategorien: PER, ORG, LOC, DATE

Text: "Olaf Scholz traf sich am Montag mit Vertretern der Siemens AG in München."
"""
# LLM-Antwort:
# {"PER": ["Olaf Scholz"], "ORG": ["Siemens AG"], "LOC": ["München"], "DATE": ["Montag"]}

Typische Anwendungsfälle

  • Dokumentenverarbeitung: Rechnungen, Verträge automatisch auslesen
  • RAG-Pipelines: Entitäten als Metadaten für besseres Retrieval speichern
  • Compliance: Automatische Erkennung personenbezogener Daten (DSGVO)
  • Wissensgraphen: Beziehungen zwischen Entitäten extrahieren

Wichtige Hinweise

  • Spezialisierte NER-Modelle (spaCy, Flair) sind oft schneller und kostengünstiger als LLMs
  • LLMs bieten mehr Flexibilität für unbekannte Entitätstypen (Zero-Shot)
  • Für Produktionssysteme mit hohem Durchsatz empfiehlt sich Batch Processing mit spezialisierten Modellen

Inhouse statt Nachschlagewerk

Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.