← Glossaire
Glossaire · AI

Qu'est-ce que Multimodal Large Language Model ?

Pas seulement avec du texte ; Il s’agit de modèles d’intelligence artificielle avancés capables de traiter simultanément différents types de données telles que l’image, l’audio et la vidéo.

Définition

Alors que les modèles traditionnels d’intelligence artificielle se concentrent généralement uniquement sur le texte, ces modèles perçoivent le monde de multiples manières, à l’instar des humains. Ils peuvent analyser différents types de données simultanément et établir des connexions entre elles. Par exemple, ils peuvent examiner une photographie et rédiger un texte détaillé à ce sujet, ou encore analyser un enregistrement vocal et résumer son contenu.

Analogie : C'est comme la différence entre un étudiant qui ne sait lire que des textes et un étudiant qui peut à la fois regarder des images et écouter de la musique ; ces modèles comprennent le monde dans une perspective beaucoup plus large.

Comment ça marche

Ces modèles utilisent des couches spéciales qui convertissent différents types de données en un langage numérique commun. De cette façon, lorsque le modèle voit l’image d’un chat, il peut faire correspondre ses données textuelles dans le même espace mental.

Où est-ce utilisé

Il est utilisé dans les applications d'analyse d'images, les assistants vocaux et les outils professionnels nécessitant une analyse de données complexe.

Souvent confondu avec

Il peut être confondu avec les modèles d’IA standard qui sont uniquement orientés texte.

Questions fréquentes

Tout modèle multimodal est-il une intelligence artificielle ?

Oui, ces modèles constituent l’une des formes de technologie d’IA les plus avancées et les plus polyvalentes.

Pourquoi parle-t-on de « multimodal » ?

Parce que le mot « mode » représente ici le canal de données ; Il tire son nom du fait qu'il peut utiliser plusieurs canaux tels que le texte, l'audio et la vidéo en même temps.

Termes liés

This explanation was written in plain language for TreScout · translated from the Turkish original. If something looks wrong or missing, write to hello@trescout.com. Read in Turkish →