# O que é Multimodal Model?

É um modelo de inteligência artificial que pode processar simultaneamente não só texto, mas também diversos tipos de dados como imagens, áudio e vídeo.

## Definição
Os modelos mais antigos funcionavam apenas com texto. Os modelos multimodais, por outro lado, tentam perceber o mundo como nós; Em outras palavras, ele pode ver e interpretar uma imagem, ouvir uma voz e transcrevê-la em texto e analisar eventos em um vídeo. Esses modelos ganham uma compreensão mais rica ao estabelecer relações entre diferentes tipos de dados.

## Como funciona
O modelo transforma diferentes tipos de dados em uma linguagem matemática comum. Desta forma, ele pode combinar um objeto em uma imagem com o nome desse objeto ou com o som que ele emite.

## Onde é usado
É usado em chatbots avançados, ferramentas de análise visual e sistemas autônomos.

## Costuma ser confundido com
É o mesmo que o conceito multimodal, onde a estrutura do “modelo” é particularmente enfatizada.

## Perguntas frequentes
**Por que apenas texto não é suficiente?**
O mundo não consiste apenas em textos; Informações sobre imagens e sons são essenciais para a compreensão do mundo.

**Quais são os modelos multimodais mais populares?**
Modelos como GPT-4o ou Claude 3.5 são modelos líderes com capacidades multimodais.


## Termos relacionados
- [Multimodal](/pt/dictionary/multimodal/)
- [LLM](/pt/dictionary/llm/)
- [Generative AI](/pt/dictionary/generative-ai/)

---
Fonte: TreScout Glossário · https://trescout.com/pt/dictionary/multimodal-model/
