Sternenstaub – Glossar · Begriff · absofort: KI-Weiterbildung mit verifizierbarem Lernnachweis
Multimodale KI
Kurz gesagt
Multimodale KI kann mehrere Arten von Eingaben verarbeiten, zum Beispiel Text, Bilder, Ton oder Dokumente, und diese miteinander verbinden. So können Sie etwa ein Foto hochladen und dazu Fragen stellen. Die Ergebnisse müssen Sie trotzdem prüfen, denn auch multimodale Modelle können Dinge falsch erkennen oder erfinden.
Definition
Multimodal bedeutet, dass etwas mehrere «Modi» oder Arten von Informationen verarbeitet. Eine multimodale KI kann mit verschiedenen Datenarten umgehen, etwa mit Text, Bildern, Tönen, Sprache oder Dokumenten. Manche Modelle können mehrere davon auch gleichzeitig verknüpfen und beantworten zum Beispiel Fragen zu einem hochgeladenen Bild.
Früher waren KI-Modelle meist auf eine Art spezialisiert: eines für Text, eines für Bilder, eines für Sprache. Multimodale Modelle kombinieren diese Fähigkeiten in einem System.
Einfach erklärt
Stellen Sie sich eine Kollegin vor, die nicht nur Ihre E-Mails liest, sondern auch auf das Foto schaut, das Sie mitschicken, und Ihrer Sprachnachricht zuhört. Sie versteht alles zusammen und kann sich dazu äussern. Eine multimodale KI arbeitet ähnlich: Sie nimmt mehrere Eingaben auf und bezieht sie aufeinander.
Das heisst aber nicht, dass sie wirklich «sieht» oder «hört» wie ein Mensch. Sie wandelt Bilder und Töne in Zahlen um und erkennt Muster darin. Dabei kann sie sich irren, besonders bei schlechter Bildqualität, handgeschriebenem Text oder seltenen Objekten.
Beispiel
Ein Beispiel: Ein Schreiner in Lenzburg fotografiert eine beschädigte Tür und lädt das Bild in ein multimodales KI-Programm hoch. Er fragt: «Beschreibe den Schaden und schlage einen Text für den Kunden vor.» Die KI liefert einen Entwurf, den er prüft und anpasst. Kundennamen und Adressen auf dem Foto hat er vorher entfernt.
Weitere Beispiele sind das Zusammenfassen eines gescannten Dokuments, das Beschreiben einer Grafik oder das Verstehen gesprochener Anweisungen.
Nicht verwechseln
Multimodale KI ist nicht dasselbe wie Text-zu-Bild-KI, die aus Text neue Bilder erzeugt. Sie ist auch nicht automatisch ein Sprachmodell, auch wenn viele multimodale Modelle auf einem solchen aufbauen. Wer Bilder, Dokumente oder Tonaufnahmen hochlädt, gibt oft mehr preis als gedacht, etwa Gesichter, Namen oder Standorte. Prüfen Sie deshalb vorab, was Ihr Betrieb erlaubt.
So hilft Ihnen Alpasana
Für einen geordneten Einstieg bietet absofort die KI-Weiterbildung mit verifizierbarem Lernnachweis an. Die Online-Plattform enthält Praxisaufgaben, Modul-Quizze, einen KI-Lerncoach und Zertifikate mit öffentlicher Verifikation. Foundation-Angebote setzen keine Vorkenntnisse voraus.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- Computer VisionWas ist Computer Vision? Maschinelles Sehen einfach erklärt: Welche Aufgaben KI mit Bildern und Videos übernimmt, wo sie hilft und wo ihre Grenzen liegen.
- Large Language ModelWas ist ein Large Language Model (LLM)? Einfach erklärt: Die Technik hinter KI, die Texte schreibt und Fragen beantwortet, mit Stärken, Grenzen und Beispiel.
- Text-to-ImageWas ist Text-to-Image? Einfach erklärt: Wie aus einer Beschreibung ein neues Bild entsteht, wo die Grenzen liegen und was Sie rechtlich beachten sollten.
- SpracherkennungWas ist Spracherkennung? Einfach erklärt: Wie KI gesprochene Sprache in Text umwandelt, wo sie eingesetzt wird und warum Dialekt und Lärm sie aus dem Takt bringen.