Zum Inhalt springen

Grundlagen · Begriff · absofort: KI-Weiterbildung mit verifizierbarem Lernnachweis

Was bedeutet multimodale KI?

Stand 10.10.2026 · 2 Min. Lesezeit

Kurz gesagt

Multimodale KI kann mehrere Arten von Inhalten zugleich verarbeiten, etwa Text, Bilder, Ton und teils Video. Sie können ihr zum Beispiel ein Foto zeigen und dazu eine Frage stellen. Das erweitert die Möglichkeiten, bringt aber eigene Fehlerquellen mit sich, etwa beim Ablesen von Zahlen oder Namen auf Bildern.

Einfach erklärt

Ein Modus (Fachwort: Modalität) ist eine Art von Information: Text, Bild, Ton oder Video. Frühere KI-Programme beherrschten meist nur einen Modus. Ein Chatprogramm las und schrieb Text, eine Bilderkennung verstand Fotos.

Multimodale KI kombiniert mehrere Modi in einem System. Sie fotografieren eine Tafel, stellen die Frage «Was steht hier?», und die KI antwortet in Text. Oder Sie sprechen eine Frage ein und bekommen Antwort in Sprache. Das gelingt, weil das System Bilder und Töne in dieselbe «Zahlensprache» übersetzt wie Wörter.

EingabeAusgabeBeispiel aus dem Büro
TextTextMailentwurf schreiben
FotoTextFoto einer Visitenkarte abtippen lassen
TonTextSitzungsnotizen aus einer Aufnahme
TextBildIllustration für einen Aushang
Foto und FrageText«Was ist auf diesem Bauplan unklar?»

Ein Beispiel aus der Praxis

Ein Beispiel: Frau Meier arbeitet in einer Garage in Aarau. Sie fotografiert einen handschriftlichen Arbeitsrapport und bittet die KI, die Materialliste in eine Tabelle zu schreiben. Die Tabelle ist schnell da, aber eine Teilenummer ist falsch gelesen. Sie vergleicht die Tabelle mit dem Foto, korrigiert die Nummer und überträgt das Ergebnis erst dann in die Verwaltung. Das Foto enthielt keine Kundendaten.

Vorlage zum Kopieren

Hier ist ein Foto von [Gegenstand, z. B. einem handschriftlichen Rapport].
Lies den Inhalt ab und erstelle eine Tabelle mit den Spalten [Spalten].
Markiere Stellen, die du nicht sicher lesen kannst, mit [unklar]. Erfinde nichts.

Hängen Sie das Foto an. Passen Sie Gegenstand und Spalten an.

Worauf Sie achten müssen

  • Datenschutz: Auf Fotos und in Aufnahmen sind oft Personen, Namen oder Adressen zu sehen. Verwenden Sie nur Material, das Sie zeigen dürfen.
  • Lesefehler: Verwechslungen bei Ziffern, Handschrift und Dialekt sind häufig. Siehe Warum erkennt KI Dinge auf Fotos falsch?.
  • Nicht jede KI kann alles: Ob ein Programm Bilder oder Ton versteht, hängt vom Angebot ab. Prüfen Sie die Funktionen.

So hilft Ihnen Alpasana

Wer die Grundbegriffe sicher verstehen möchte, findet bei absofort die KI-Weiterbildung mit verifizierbarem Lernnachweis. Beschrieben sind Foundation-Angebote ohne Vorkenntnisse mit Praxisaufgaben, Modul-Quizzen, KI-Lerncoach und überprüfbarem Zertifikat.

Häufige Fragen

Ist ein Bild-Generator multimodale KI?

Teilweise. Er verbindet Text (Ihre Beschreibung) mit Bildern (das Ergebnis). Meist spricht man von multimodal, wenn ein System mehrere Modi verstehen und kombinieren kann.

Kann multimodale KI Videos verstehen?

Manche Angebote können Videos auswerten oder erzeugen. Der Umfang unterscheidet sich stark und ändert sich schnell. Prüfen Sie die Beschreibung des Anbieters.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie