# Was ist Multimodal?

Dabei handelt es sich um eine Fähigkeit der künstlichen Intelligenz, die verschiedene Arten von Daten wie Text, Audio, Bild und Video gleichzeitig verarbeiten kann.

## Definition
Multimodal ist die Fähigkeit künstlicher Intelligenz, verschiedene Arten von Daten, wie Text, Audio, Bilder und Video, gleichzeitig zu verarbeiten und zu verbinden. Das Modell kann nicht nur lesen, sondern auch sehen und hören.

## So funktioniert es
Es wandelt verschiedene Datentypen in eine gemeinsame numerische Sprache um. Auf diese Weise kann es ein Foto analysieren und einen Text darüber schreiben oder einen Sprachbefehl in ein Bild umwandeln.

## Wo es eingesetzt wird
Es wird in Assistenten verwendet, die Fragen und Antworten über Bilder, Videoanalysetools und fortschrittliche Übersetzungssysteme beantworten können.

## Häufig verwechselt mit
Es wird mit Nur-Text-Modellen verwechselt; Die Wahrnehmung multimodaler Modelle ist viel umfassender.

## Häufige Fragen
**Sind multimodale Modelle intelligenter?**
Sie verstehen die Welt besser, weil sie eine umfassendere Wahrnehmung haben.

**Können sie Videos ansehen?**
Ja, sie können verstehen, was im Inhalt enthalten ist, indem sie Videos Bild für Bild analysieren.


## Verwandte Begriffe
- [LLM](/de/dictionary/llm/)
- [Generative AI](/de/dictionary/generative-ai/)
- [Diffusion Model](/de/dictionary/diffusion-model/)
- [Text-to-Speech](/de/dictionary/text-to-speech/)
- [Embedding](/de/dictionary/embedding/)

## Verwandte Werkzeuge
- [UI-TARS-desktop](/de/discover/ui-tars-desktop/)

---
Quelle: TreScout Glossar · https://trescout.com/de/dictionary/multimodal/
