# ¿Qué es Multimodal?

Es una capacidad de inteligencia artificial que puede procesar simultáneamente diferentes tipos de datos como texto, audio, imágenes y video.

## Definición
Multimodal es la capacidad de la inteligencia artificial para procesar y conectar simultáneamente diferentes tipos de datos, como texto, audio, imágenes y vídeo. El modelo no sólo puede leer, sino también ver y oír.

## Cómo funciona
Convierte diferentes tipos de datos en un lenguaje numérico común. De esta forma, puede analizar una fotografía y escribir texto sobre ella o convertir un comando de voz en una imagen.

## Dónde se usa
Se utiliza en asistentes que pueden responder preguntas y respuestas a través de imágenes, herramientas de análisis de vídeo y sistemas de traducción avanzados.

## Suele confundirse con
Se confunde con los modelos de sólo texto; La percepción de los modelos multimodales es mucho más amplia.

## Preguntas frecuentes
**¿Son los modelos multimodales más inteligentes?**
Entienden mejor el mundo porque tienen una percepción más integral.

**¿Pueden ver vídeos?**
Sí, pueden comprender el contenido analizando los vídeos cuadro por cuadro.


## Términos relacionados
- [LLM](/es/dictionary/llm/)
- [Generative AI](/es/dictionary/generative-ai/)
- [Diffusion Model](/es/dictionary/diffusion-model/)
- [Text-to-Speech](/es/dictionary/text-to-speech/)
- [Embedding](/es/dictionary/embedding/)

## Herramientas relacionadas
- [UI-TARS-desktop](/es/discover/ui-tars-desktop/)

---
Fuente: TreScout Glosario · https://trescout.com/es/dictionary/multimodal/
