# ¿Qué es Multimodal Large Language Model?

No sólo con texto; Son modelos avanzados de inteligencia artificial que pueden procesar simultáneamente diferentes tipos de datos como imagen, audio y vídeo.

## Definición
Si bien los modelos tradicionales de inteligencia artificial generalmente se centran únicamente en el texto, estos modelos perciben el mundo de múltiples maneras, como los humanos. Pueden analizar diferentes tipos de datos simultáneamente y establecer conexiones entre ellos. Por ejemplo, pueden examinar una fotografía y escribir un texto detallado sobre ella, o analizar una grabación de voz y resumir su contenido.

## Cómo funciona
Estos modelos utilizan capas especiales que convierten diferentes tipos de datos en un lenguaje numérico común. De esta manera, cuando el modelo ve la imagen de un gato, puede hacer coincidir sus datos de texto en el mismo espacio mental.

## Dónde se usa
It is used in applications that analyze images, voice assistants, and professional tools that require complex data analysis.

## Suele confundirse con
Se puede confundir con los modelos de IA estándar que sólo están orientados a texto.

## Preguntas frecuentes
**¿Es todo modelo multimodal una inteligencia artificial?**
Sí, estos modelos son una de las formas más avanzadas y versátiles de tecnología de IA.

**¿Por qué se llama 'multimodal'?**
Porque la palabra 'modo' representa aquí el canal de datos; Recibe este nombre porque puede utilizar varios canales, como texto, audio y vídeo, al mismo tiempo.


## Términos relacionados
- [Multimodal](/es/dictionary/multimodal/)
- [LLM](/es/dictionary/llm/)
- [Foundation Model](/es/dictionary/foundation-model/)
- [Generative AI](/es/dictionary/generative-ai/)

---
Fuente: TreScout Glosario · https://trescout.com/es/dictionary/multimodal-large-language-model/
