Zum Hauptinhalt

Computer Vision

Computer Vision ist ein Teilgebiet der KI, das Computern ermöglicht, visuelle Informationen aus Bildern und Videos zu verstehen und zu interpretieren.

AIAnfängercomputer-visionbildverarbeitungdeep-learning

Was ist Computer Vision?

Computer Vision (CV) befähigt Maschinen dazu, digitale Bilder und Videos ähnlich wie das menschliche Sehsystem zu verarbeiten. Statt Pixel nur als Zahlenwerte zu speichern, lernen CV-Modelle, darin bedeutungsvolle Strukturen zu erkennen – Objekte, Gesichter, Texte oder Bewegungen.

Typische Anwendungsfälle

  • Bildklassifikation: Ist auf dem Foto eine Katze oder ein Hund?
  • Objekterkennung: Wo befinden sich alle Autos in diesem Bild? (Bounding Boxes)
  • Segmentierung: Welche Pixel gehören zum Vordergrund?
  • OCR: Text in Bildern oder Scans lesbar machen
  • Qualitätskontrolle: Defekte in der Produktion automatisch erkennen

Schnellstart mit Python

from transformers import pipeline

# Vortrainiertes Bildklassifikations-Modell laden
classifier = pipeline("image-classification", model="google/vit-base-patch16-224")

# Bild analysieren (URL oder lokaler Pfad)
result = classifier("https://example.com/katze.jpg")

for item in result:
    print(f"{item['label']}: {item['score']:.2%}")
# Ausgabe: tabby cat: 92.4%

Wichtige Konzepte für Entwickler

BegriffBedeutung
CNNConvolutional Neural Network – klassische CV-Architektur
ViTVision Transformer – moderner Ansatz mit Attention
Bounding BoxRechteck, das ein erkanntes Objekt umschließt
IoUIntersection over Union – Qualitätsmaß für Erkennungen

Praxistipp

Für die meisten Projekte lohnt es sich, vortrainierte Modelle von Hugging Face oder APIs wie Google Vision, AWS Rekognition oder Azure Computer Vision zu nutzen, anstatt Modelle von Grund auf zu trainieren. Fine-Tuning auf eigenen Daten ist erst dann sinnvoll, wenn die generischen Modelle nicht ausreichen.

Inhouse statt Nachschlagewerk

Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.