# O que é VLM?

> Vision Language Model

É um modelo de inteligência artificial capaz de compreender e comentar textos e imagens simultaneamente.

## Definição
É um sistema que percebe o mundo não apenas com texto, mas também com os olhos. Pode olhar para uma fotografia e identificar os objetos nela, interpretar um gráfico ou converter uma nota manuscrita em texto digital.

## Como funciona
O modelo passa por um processo de treinamento especial que combina dados visuais com dados de texto. Quando você carrega uma imagem e faz uma pergunta, o modelo responde sintetizando os detalhes da imagem com o conhecimento textual.

## Onde é usado
É utilizado na análise de imagens, na descrição automática de conteúdo e em assistentes de inteligência artificial baseados em visão.

## Costuma ser confundido com
É semelhante aos modelos multimodais; o VLM é um subconjunto focado em visão-texto da inteligência artificial multimodal.

## Perguntas frequentes
**Qual é a diferença entre VLM e a inteligência artificial clássica?**
Enquanto os modelos clássicos processam apenas texto, os modelos VLM também conseguem compreender dados visuais diretamente.


## Termos relacionados
- [Multimodal](/pt/dictionary/multimodal/)
- [Computer Vision](/pt/dictionary/computer-vision/)
- [LLM](/pt/dictionary/llm/)

## Ferramentas relacionadas
- [Miles](/pt/discover/miles/)

---
Fonte: TreScout Glossário · https://trescout.com/pt/dictionary/vlm/
