# O que é Multimodal Large Language Model?

Não apenas com texto; São modelos avançados de inteligência artificial que podem processar simultaneamente diversos tipos de dados como imagem, áudio e vídeo.

## Definição
Embora os modelos tradicionais de inteligência artificial geralmente se concentrem apenas no texto, esses modelos percebem o mundo de várias maneiras, como os humanos. Eles podem analisar diferentes tipos de dados simultaneamente e estabelecer conexões entre eles. Por exemplo, podem examinar uma fotografia e escrever um texto detalhado sobre ela, ou analisar uma gravação de voz e resumir o seu conteúdo.

## Como funciona
Esses modelos usam camadas especiais que convertem diferentes tipos de dados em uma linguagem numérica comum. Dessa forma, quando o modelo vê a imagem de um gato, ele pode combinar seus dados de texto no mesmo espaço mental.

## Onde é usado
É usado em aplicativos que analisam imagens, assistentes de voz e ferramentas profissionais que exigem análise complexa de dados.

## Costuma ser confundido com
Pode ser confundido com modelos padrão de IA que são somente texto.

## Perguntas frequentes
**Todo modelo multimodal é uma inteligência artificial?**
Sim, estes modelos são uma das formas mais avançadas e versáteis de tecnologia de IA.

**Por que é chamado de 'multimodal'?**
Porque a palavra 'modo' representa o canal de dados aqui; Ele recebe esse nome porque pode usar vários canais como texto, áudio e vídeo ao mesmo tempo.


## Termos relacionados
- [Multimodal](/pt/dictionary/multimodal/)
- [LLM](/pt/dictionary/llm/)
- [Foundation Model](/pt/dictionary/foundation-model/)
- [Generative AI](/pt/dictionary/generative-ai/)

---
Fonte: TreScout Glossário · https://trescout.com/pt/dictionary/multimodal-large-language-model/
