Computer Vision
Computer Vision ist ein Teilgebiet der KI, das Computern ermöglicht, visuelle Informationen aus Bildern und Videos zu verstehen und zu interpretieren.
Was ist Computer Vision?
Computer Vision (CV) befähigt Maschinen dazu, digitale Bilder und Videos ähnlich wie das menschliche Sehsystem zu verarbeiten. Statt Pixel nur als Zahlenwerte zu speichern, lernen CV-Modelle, darin bedeutungsvolle Strukturen zu erkennen – Objekte, Gesichter, Texte oder Bewegungen.
Typische Anwendungsfälle
- Bildklassifikation: Ist auf dem Foto eine Katze oder ein Hund?
- Objekterkennung: Wo befinden sich alle Autos in diesem Bild? (Bounding Boxes)
- Segmentierung: Welche Pixel gehören zum Vordergrund?
- OCR: Text in Bildern oder Scans lesbar machen
- Qualitätskontrolle: Defekte in der Produktion automatisch erkennen
Schnellstart mit Python
from transformers import pipeline
# Vortrainiertes Bildklassifikations-Modell laden
classifier = pipeline("image-classification", model="google/vit-base-patch16-224")
# Bild analysieren (URL oder lokaler Pfad)
result = classifier("https://example.com/katze.jpg")
for item in result:
print(f"{item['label']}: {item['score']:.2%}")
# Ausgabe: tabby cat: 92.4%
Wichtige Konzepte für Entwickler
| Begriff | Bedeutung |
|---|---|
| CNN | Convolutional Neural Network – klassische CV-Architektur |
| ViT | Vision Transformer – moderner Ansatz mit Attention |
| Bounding Box | Rechteck, das ein erkanntes Objekt umschließt |
| IoU | Intersection over Union – Qualitätsmaß für Erkennungen |
Praxistipp
Für die meisten Projekte lohnt es sich, vortrainierte Modelle von Hugging Face oder APIs wie Google Vision, AWS Rekognition oder Azure Computer Vision zu nutzen, anstatt Modelle von Grund auf zu trainieren. Fine-Tuning auf eigenen Daten ist erst dann sinnvoll, wenn die generischen Modelle nicht ausreichen.
Verwandte Begriffe
Inhouse statt Nachschlagewerk
Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.