Multimodal
Multimodal bezeichnet KI-Modelle, die mehrere Eingabetypen wie Text, Bilder, Audio oder Video gleichzeitig verarbeiten und kombinieren können.
AIAnfängermultimodalcomputer-visionllm
Was ist Multimodal?
Ein multimodales KI-Modell verarbeitet nicht nur Text, sondern kombiniert verschiedene Datentypen (sogenannte Modalitäten) wie Bilder, Audio, Video oder Dokumente in einem einzigen Modell. Statt separate Systeme für Bild- und Texterkennung zu verwenden, kann ein multimodales Modell beides gleichzeitig verstehen und daraus Schlüsse ziehen.
Typische Modalitäten
| Modalität | Beispiel |
|---|---|
| Text | Fragen, Anweisungen, Dokumente |
| Bild | Fotos, Screenshots, Diagramme |
| Audio | Sprachaufnahmen, Musik |
| Video | Clips, Screencasts |
| Dokumente | PDFs mit gemischtem Inhalt |
Praxisbeispiel: Bild + Text mit der OpenAI API
import openai
client = openai.OpenAI()
response = client.chat.completions.create(
model="gpt-4o",
messages=[
{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {"url": "https://example.com/screenshot.png"}
},
{
"type": "text",
"text": "Was zeigt dieser Screenshot? Erkläre mögliche Fehler."
}
]
}
]
)
print(response.choices[0].message.content)
Typische Anwendungsfälle
- Dokument-Analyse: Ein PDF mit Tabellen und Text wird als Ganzes verstanden
- Code-Debugging via Screenshot: Fehlermeldung als Bild einreichen
- Barrierefreiheit: Bilder automatisch beschreiben lassen
- Medizin: Röntgenbilder + Patientenakte gemeinsam auswerten
Wichtig für Entwickler
- Multimodale Inputs sind in der Regel teurer in Tokens als reiner Text
- Nicht alle Modelle unterstützen alle Modalitäten – prüfe die API-Dokumentation
- Die Qualität der Bildverarbeitung hängt stark von der Auflösung und Komprimierung ab
- Für Sprache/Audio gibt es oft separate Endpunkte (z. B. Whisper für Transkription)
Verwandte Begriffe
Inhouse statt Nachschlagewerk
Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.