← Glossaire
Glossaire · AI

Qu'est-ce que Multimodal Model ?

Il s’agit d’un modèle d’intelligence artificielle capable de traiter simultanément non seulement du texte mais également différents types de données telles que des images, de l’audio et de la vidéo.

Définition

Les modèles plus anciens ne fonctionnaient qu'avec du texte. Les modèles multimodaux, quant à eux, tentent de percevoir le monde comme nous le faisons ; Autrement dit, il peut voir et interpréter une image, entendre une voix et la retranscrire en texte, et analyser des événements dans une vidéo. Ces modèles acquièrent une compréhension plus riche en établissant des relations entre différents types de données.

Analogie : C'est comme passer d'une personne qui sait seulement lire et écrire à quelqu'un qui peut lire, entendre et combiner ce qu'il voit.

Comment ça marche

Le modèle transforme différents types de données en un langage mathématique commun. De cette façon, il peut faire correspondre un objet dans une image avec le nom de cet objet ou le son qu'il émet.

Où est-ce utilisé

Il est utilisé dans les chatbots avancés, les outils d’analyse visuelle et les systèmes autonomes.

Souvent confondu avec

Il en va de même pour le concept multimodal, où la structure « modèle » est particulièrement mise en valeur.

Questions fréquentes

Pourquoi le texte ne suffit-il pas ?

Le monde n’est pas uniquement constitué de textes ; Les informations sur les images et les sons sont essentielles à la compréhension du monde.

Quels sont les modèles multimodaux les plus populaires ?

Des modèles tels que GPT-4o ou Claude 3.5 sont des modèles phares dotés de capacités multimodales.

Termes liés

This explanation was written in plain language for TreScout · translated from the Turkish original. If something looks wrong or missing, write to hello@trescout.com. Read in Turkish →