# ¿Qué es VLM?

> Vision Language Model

Es un modelo de inteligencia artificial capaz de comprender y comentar tanto textos como imágenes al mismo tiempo.

## Definición
Es un sistema que percibe el mundo no solo con texto, sino también con sus ojos. Puede mirar una fotografía e identificar los objetos que contiene, interpretar un gráfico o convertir una nota escrita a mano en texto digital.

## Cómo funciona
El modelo pasa por un proceso de entrenamiento especial que combina datos visuales con datos textuales. Cuando subes una imagen y haces una pregunta, el modelo responde sintetizando los detalles de la imagen con información textual.

## Dónde se usa
Se utiliza en el análisis de imágenes, la descripción automática de contenido y en asistentes de inteligencia artificial basados en visión.

## Suele confundirse con
Es similar a los modelos multimodales; el VLM es un subconjunto de la inteligencia artificial multimodal centrado en la relación visión-texto.

## Preguntas frecuentes
**¿Cuál es la diferencia entre un VLM y la inteligencia artificial clásica?**
Mientras que los modelos clásicos solo procesan texto, los modelos VLM también pueden comprender directamente los datos visuales.


## Términos relacionados
- [Multimodal](/es/dictionary/multimodal/)
- [Computer Vision](/es/dictionary/computer-vision/)
- [LLM](/es/dictionary/llm/)

## Herramientas relacionadas
- [Miles](/es/discover/miles/)

---
Fuente: TreScout Glosario · https://trescout.com/es/dictionary/vlm/
