Classification
Classification (Klassifikation) ist eine der grundlegendsten KI-Aufgaben: Ein Modell ordnet eine Eingabe einer von mehreren vordefinierten Kategorien zu – zum Beispiel, ob eine E-Mail Spam ist oder nicht.
AIAnfängerclassificationmachine-learningnlp
Was ist Classification?
Classification beschreibt die Aufgabe, Eingabedaten (Text, Bild, Audio usw.) automatisch einer oder mehreren vordefinierten Klassen zuzuordnen. Das Modell lernt dabei aus Trainingsdaten, welche Merkmale zu welcher Kategorie gehören.
Arten der Klassifikation
- Binäre Klassifikation: Zwei mögliche Ausgaben (z. B. Spam / kein Spam, positiv / negativ)
- Multiclass-Klassifikation: Mehrere Klassen, aber jede Eingabe bekommt genau eine (z. B. Nachrichtenkategorie: Sport, Politik, Wirtschaft)
- Multilabel-Klassifikation: Eine Eingabe kann mehrere Klassen gleichzeitig haben (z. B. ein Artikel ist gleichzeitig "Tech" und "Politik")
Praxisbeispiel mit der OpenAI API
from openai import OpenAI
client = OpenAI()
def classify_sentiment(text: str) -> str:
response = client.chat.completions.create(
model="gpt-4o-mini",
messages=[
{
"role": "system",
"content": "Du bist ein Klassifikationsmodell. Antworte NUR mit: positiv, negativ oder neutral."
},
{
"role": "user",
"content": f"Klassifiziere diesen Text: {text}"
}
],
temperature=0 # Deterministisch fuer konsistente Klassifikation
)
return response.choices[0].message.content.strip()
result = classify_sentiment("Das Produkt hat meine Erwartungen übertroffen!")
print(result) # -> positiv
Klassifikation mit Fine-tuned Modellen
Für produktive Anwendungen lohnt sich oft ein speziell trainiertes Modell (z. B. via Fine-Tuning), das schneller und günstiger als große LLMs ist:
from transformers import pipeline
classifier = pipeline("text-classification", model="distilbert-base-uncased-finetuned-sst-2-english")
result = classifier("This movie was absolutely fantastic!")
print(result) # [{'label': 'POSITIVE', 'score': 0.9998}]
Wichtige Metriken
| Metrik | Wann relevant? |
|---|---|
| Accuracy | Ausgeglichene Klassen |
| Precision / Recall | Ungleiche Klassenverteilung |
| F1-Score | Balance zwischen Precision und Recall |
| ROC-AUC | Binäre Klassifikation |
Typische Anwendungsfälle
- Spam-Erkennung – E-Mails filtern
- Sentiment-Analyse – Kundenfeedback auswerten
- Content Moderation – Unerwünschte Inhalte erkennen
- Named Entity Recognition – Tokens klassifizieren (Person, Ort, Organisation)
- Bildklassifikation – Objekte in Fotos erkennen (Computer Vision)
Tipps für Entwickler
- Temperature auf 0 setzen, wenn du LLMs zur Klassifikation nutzt – so werden die Ausgaben deterministischer
- Klassen klar definieren: Je eindeutiger die Kategorien, desto besser die Performance
- Unbalanced Data beachten: Wenn eine Klasse viel häufiger vorkommt, kann das Modell "lazy" werden und immer die häufige Klasse vorhersagen
Verwandte Begriffe
Inhouse statt Nachschlagewerk
Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.