# O que é Multimodal?

É uma habilidade de inteligência artificial que pode processar simultaneamente diferentes tipos de dados, como texto, áudio, visual e vídeo.

## Definição
Multimodal é a capacidade da inteligência artificial de processar e conectar simultaneamente diferentes tipos de dados, como texto, áudio, imagens e vídeo. O modelo não só pode ler, mas também ver e ouvir.

## Como funciona
Ele converte diferentes tipos de dados em uma linguagem numérica comum. Desta forma, ele pode analisar uma foto e escrever um texto sobre ela ou converter um comando de voz em imagem.

## Onde é usado
É utilizado em assistentes que podem responder perguntas e respostas por meio de imagens, ferramentas de análise de vídeo e sistemas avançados de tradução.

## Costuma ser confundido com
É confundido com modelos somente texto; A percepção dos modelos multimodais é muito mais ampla.

## Perguntas frequentes
**Os modelos multimodais são mais inteligentes?**
Eles entendem melhor o mundo porque têm uma percepção mais abrangente.

**Eles podem assistir a vídeos?**
Sim, eles podem entender o que está no conteúdo analisando os vídeos quadro a quadro.


## Termos relacionados
- [LLM](/pt/dictionary/llm/)
- [Generative AI](/pt/dictionary/generative-ai/)
- [Diffusion Model](/pt/dictionary/diffusion-model/)
- [Text-to-Speech](/pt/dictionary/text-to-speech/)
- [Embedding](/pt/dictionary/embedding/)

## Ferramentas relacionadas
- [UI-TARS-desktop](/pt/discover/ui-tars-desktop/)

---
Fonte: TreScout Glossário · https://trescout.com/pt/dictionary/multimodal/
