Multimodales Modell – was bedeutet das?
Ein multimodales Modell ist ein künstliches Intelligenzsystem (KI), das verschiedene Arten von Daten gleichzeitig verarbeiten und verstehen kann – zum Beispiel Text, Bilder, Audio oder Video.
Im Gegensatz zu einem klassischen Sprachmodell, das nur Text versteht, kann ein multimodales Modell Informationen aus mehreren Quellen kombinieren, um komplexere und natürlichere Antworten zu geben. Dadurch kommt es menschlicher Kommunikation sehr nahe.
Beispiel:
Ein multimodales KI-Modell kann gleichzeitig ein Foto analysieren und eine Beschreibung dazu schreiben – etwa: „Auf dem Bild ist ein rotes Auto vor einem Haus zu sehen.“
Ein System wie GPT-4 oder Gemini kann sogar Fragen zu einem hochgeladenen Bild beantworten – das ist echte Multimodalität.
Multimodales Modell gehört zum Themenfeld Künstliche Intelligenz
und wird häufig im Zusammenhang mit Generativer KI und Machine Learning genannt.
Mehr Definitionen diesbzgl. finden Sie im
AZ-COM Glossar zur KI & Generative AI.
Für interessante Anregungen, themenbezogene Beiträge und Aktuelles lesen Sie hier auf: AZ-COM Blog.
