Definición·
Capacidades

Multimodal

Capacidad de un modelo de IA para comprender y generar varias modalidades (texto, imagen, audio, vídeo) dentro de un mismo sistema.

Explicación detallada

Un modelo multimodal acepta, por ejemplo, una imagen + un texto y produce una respuesta escrita, o acepta un texto y genera un vídeo. Esta unificación abre casos de uso muy variados: análisis de capturas de pantalla, visión y lenguaje en robótica, asistentes de voz completos.

Ejemplos

GPT-4o que ve y escucha
Gemini multimodal
Claude 3.5 leyendo PDFs ilustrados
Sora para vídeo

Preguntas frecuentes

¿Todos los LLM son multimodales?

No: algunos siguen siendo solo texto. Los modelos multimodales ganan terreno pero son más costosos.

Términos relacionados

Última actualización: 15/7/2026

Talent AI

Pasa de la teoría a la práctica

Publica una misión o únete a la comunidad de los mejores expertos en IA, Data y Machine Learning.