Multimodalität
Multimodalität bezeichnet die Fähigkeit von KI-Systemen, verschiedene Datentypen wie Text, Bilder, Audio und Video gleichzeitig zu verarbeiten und miteinander in Beziehung zu setzen. Im Gegensatz zu unimodalen Systemen ermöglicht sie ein umfassenderes Verständnis durch die Kombination mehrerer Informationsquellen.
Ausführliche Erklärung
Multimodale KI-Systeme verarbeiten Eingaben aus mehreren Modalitäten in einem einzigen Modell. Während ältere Systeme jeweils auf eine Datenart spezialisiert waren, also entweder Text oder Bild oder Sprache, kombinieren multimodale Modelle Text, Bilder, Audio, Video und teilweise auch Sensordaten. Technisch geschieht das, indem die unterschiedlichen Eingaben in eine gemeinsame interne Repräsentation überführt werden, sodass das Modell Zusammenhänge über die Modalitäten hinweg herstellen kann. Alle Eingaben zählen dabei gegen dasselbe Kontextfenster, wobei ein Bild oder eine Tonspur deutlich mehr Token verbraucht als ein kurzer Textabsatz.
Für Unternehmen ist das relevant, weil die betriebliche Datenlandschaft heterogen ist. Neben strukturierten Daten aus ERP- oder CRM-Systemen entstehen laufend Fotos, Scans, Sprachnachrichten, Chatverläufe, Maschinensignale und Videoaufzeichnungen. Ein multimodales System kann einen abfotografierten Lieferschein lesen, eine gesprochene Notiz dazu berücksichtigen und beides mit dem Textprotokoll verknüpfen, statt drei getrennte Werkzeuge zu benötigen. Das reduziert Medienbrüche und macht Informationen zugänglich, die in isolierten Ablagen verborgen bleiben.
Die großen Modellfamilien sind heute durchgehend multimodal: die GPT-Modelle von OpenAI, Gemini von Google und Claude von Anthropic verstehen neben Text auch Bilder und Dokumente mit eingebetteten Diagrammen, mehrere davon zusätzlich Audio und Video. In der Praxis heißt das: Sie können eine Präsentation hochladen und Fragen dazu stellen, ein Foto eines defekten Bauteils analysieren lassen oder eine Besprechungsaufzeichnung zusammenfassen. Weil sich die Modellgenerationen im Mehrmonatsrhythmus ablösen, sollten Sie den konkret unterstützten Funktionsumfang immer beim jeweiligen Anbieter nachschlagen, statt sich auf Versionsangaben in Fachartikeln zu verlassen. Die technische Grundlage bilden weiterhin die Verfahren des Machine Learning; ein multimodales Modell ist im Kern ein erweitertes Large Language Model (LLM).
Zu beachten sind drei Punkte. Erstens die Kosten: Bilder, Audio und Video verbrauchen ein Vielfaches an Rechenleistung und damit an Token gegenüber reinem Text. Zweitens die Verlässlichkeit: Auch multimodale Modelle erfinden Inhalte, etwa beim Ablesen von Zahlen aus unscharfen Scans oder Diagrammen; eine Halluzination fällt bei Bildmaterial oft später auf als bei Text. Drittens der Datenschutz: Fotos von Personen, Sprachaufnahmen oder Videomaterial sind personenbezogene Daten, Aufnahmen zur eindeutigen Erkennung einer Person sind sogar biometrische Daten mit entsprechend strengen Anforderungen. Legen Sie deshalb vor dem Einsatz fest, welches Material überhaupt an ein KI-System übergeben werden darf.
Praxisbeispiel
Ein österreichisches Ingenieurbüro mit 25 Mitarbeitenden setzt multimodale KI für die Projektdokumentation ein. Das System wertet technische Zeichnungen, Baustellenfotos, diktierte Notizen und schriftliche Protokolle gemeinsam aus. Fragt jemand nach einem bestimmten Bauteil, liefert es die Planzeichnung, die Fotos vom Einbau und die passende Audionotiz in einer Antwort zusammen. Personenbezogene Aufnahmen von Arbeitskräften werden vorab aussortiert, weil dafür eine eigene datenschutzrechtliche Grundlage nötig wäre.
Quellen
Diese Definition verlinken
Sie dürfen diese Definition gern zitieren oder verlinken — mit Quellenangabe.
„Multimodalität“ — Definition im Strukturaflow IT Glossar: https://begriffe.strukturaflow.com/begriff/multimodalitaet <a href="https://begriffe.strukturaflow.com/begriff/multimodalitaet">Multimodalität</a> — Definition im Strukturaflow IT Glossar