# Qu'est-ce que Multimodal ?

Il s’agit d’une capacité d’intelligence artificielle capable de traiter simultanément différents types de données telles que le texte, l’audio, le visuel et la vidéo.

## Définition
Le multimodal est la capacité de l’intelligence artificielle à traiter et connecter simultanément différents types de données, telles que le texte, l’audio, les images et la vidéo. Le modèle peut non seulement lire, mais aussi voir et entendre.

## Comment ça marche
Il convertit différents types de données en un langage numérique commun. De cette façon, il peut analyser une photo et écrire un texte à ce sujet ou convertir une commande vocale en image.

## Où est-ce utilisé
Il est utilisé dans des assistants capables de répondre aux questions et réponses via des images, des outils d'analyse vidéo et des systèmes de traduction avancés.

## Souvent confondu avec
Il est confondu avec les modèles textuels ; La perception des modèles multimodaux est beaucoup plus large.

## Questions fréquentes
**Les modèles multimodaux sont-ils plus intelligents ?**
Ils comprennent mieux le monde parce qu’ils ont une perception plus globale.

**Peuvent-ils regarder des vidéos ?**
Oui, ils peuvent comprendre le contenu du contenu en analysant les vidéos image par image.


## Termes liés
- [LLM](/fr/dictionary/llm/)
- [Generative AI](/fr/dictionary/generative-ai/)
- [Diffusion Model](/fr/dictionary/diffusion-model/)
- [Text-to-Speech](/fr/dictionary/text-to-speech/)
- [Embedding](/fr/dictionary/embedding/)

## Outils liés
- [UI-TARS-desktop](/fr/discover/ui-tars-desktop/)

---
Source : TreScout Glossaire · https://trescout.com/fr/dictionary/multimodal/
