En el benchmark de IA multimodal MMMU-Pro (comprensión multidisciplinar a través de imágenes, gráficos y figuras), los mejores modelos ya están por encima del 80 %. OpenAI publicó en abril de 2026 un 81,2 % para GPT-5.5 (sin herramientas), y Google, en febrero, un 80,5 % para Gemini 3.1 Pro. Cuando se lanzó el MMMU original, a finales de 2023, GPT-4V obtuvo alrededor del 56 %. MMMU-Pro es una versión más difícil de MMMU (publicada en septiembre de 2024), así que no es la misma vara de medir; aun así, los modelos ya superan el 80 % en la más exigente. La era de la IA «solo de texto» ha terminado de verdad.

No solo han cambiado las puntuaciones. La forma de construir estos modelos ha ido pasando de «ensamblada» a «nativa». Antes lo normal era encadenar modelos distintos: uno para transcribir la voz, otro para razonar sobre el texto y otro para leer la respuesta en voz alta (OpenAI explica que el modo de voz de ChatGPT anterior a GPT-4o era justo esa cadena de tres modelos). Hoy se han extendido los diseños en los que un solo modelo recibe directamente varios tipos de entrada, y Gemini y la línea Omni de Qwen manejan las cuatro —texto, imagen, audio y vídeo— en un único modelo. Pero no todos los proveedores han ido por ahí: a septiembre de 2026, el modelo insignia de OpenAI y la API de Claude solo aceptan texto e imágenes como entrada, y OpenAI resuelve el audio con modelos de voz aparte, como gpt-realtime (ver la tabla del §4).

Adelanto mi conclusión: lo multimodal ha pasado de ser un «extra agradable» a ser «no tenerlo es inviable». Saca una foto a una pantalla de error y deja que la IA la resuelva al instante, captura un PDF y extrae lo esencial, transcribe y resume un vídeo de YouTube: esto es ya la base de la fluidez con la IA en 2026. Este artículo cubre la definición, la diferencia entre multimodal ensamblada y nativa, qué determina técnicamente la fuerza en cada modalidad, con qué criterio elegir según el caso de uso, los benchmarks y los límites. El eje no es la clasificación de un modelo concreto, sino la forma de decidir, de modo que sigue sirviendo aunque cambie la generación.

IA MULTIMODAL · 2026

IA que maneja texto, imagen, audio y vídeo

— cuánto de eso cabe en un solo modelo depende del modelo

TEXTO
Texto
Prosa, código, símbolos
IMAGEN
Imagen
Fotos, gráficos, capturas
AUDIO
Audio
Voz, música, ambiente
VÍDEO
Vídeo
Tiempo + imagen + audio

En MMMU-Pro, los mejores modelos ya están en la franja del 80 % (cifras de cada empresa y fuentes en el §1).
Se acabó la época de «la imagen como extra». Pero solo algunos —Gemini o la línea Omni de Qwen, por ejemplo— reciben las cuatro en un único modelo; el modelo insignia de OpenAI y la API de Claude llegan hasta la imagen (a septiembre de 2026).

1. En 2026, la IA dejó de ser «solo texto»: MMMU-Pro supera el 80 %

«Multimodal» empezó a sonar con fuerza en 2024, pero los modelos justo anteriores solo podían leer imágenes como algo accesorio: cuando se lanzó MMMU (comprensión multimodal multidisciplinar) a finales de 2023, incluso el mejor, GPT-4V, rondaba el 56 %. El experto humano mediano (82,6 %) quedaba muy lejos en preguntas con imágenes que requerían conocimiento especializado.

2026 es muy distinto. Puntuaciones publicadas en MMMU-Pro (la versión más difícil de MMMU):

«Superar el 80 % significa que el benchmark se está saturando» es la realidad de 2026. La diferenciación se ha trasladado a la comprensión de vídeo (Video-MMMU), los documentos con OCR denso y el razonamiento conjunto audiovisual: terreno más difícil. La tabla pública de MMMU benchmark permite a cualquiera comparar.

2. ¿Qué es la IA multimodal? Una IA que entiende más que texto

Definición: «un modelo de IA que puede recibir entradas distintas del texto (imágenes, audio, vídeo, etc.)». Hasta dónde llega depende del modelo: desde texto más imágenes hasta audio y vídeo en un solo modelo (ver el recuadro de términos más abajo).

La IA tradicional era monomodal: GPT-3 manejaba texto; Whisper hacía solo voz a texto; Stable Diffusion solo texto a imagen. Combinarlos requería una tubería en la que la salida de un modelo alimentaba al siguiente, y se perdía información en cada traspaso.

En la IA multimodal, un solo modelo mira varias entradas a la vez y responde. Por ejemplo: «Mira el mensaje de error de esta captura (imagen) junto con mi pregunta (texto) y dime la causa», resuelto en una sola llamada a la API.

Terminología: LMM (Large Multimodal Model) = un modelo grande con capacidad multimodal. VLM (Vision-Language Model) = solo texto + imagen. Omnimodal = modelos de nueva generación que unifican 4 o más modalidades. La misma etiqueta de «compatible con multimodal» significa cosas distintas según se trate de un omnimodal o de un VLM (que llega hasta texto + imagen). Si tienes previsto trabajar con audio o vídeo, conviene comprobar esa distinción en lugar de contar los ◎ de una tabla de compatibilidades: los modelos basados en VLM suelen tener el audio y el vídeo bastante limitados.

3. Ensamblada frente a nativa: la divisoria arquitectónica

Entender la diferencia de mecanismo ayuda a leer los puntos fuertes de cada modelo. A grandes rasgos hay dos formas de construirlos.

Comparación de arquitecturas

Ensamblada frente a Nativa

① Ensamblada
  • Transcripción, razonamiento y voz en modelos separados
  • Los modelos se pasan el trabajo como texto
  • El tono, los varios hablantes y el ruido de fondo se pierden por el camino
  • Cada etapa extra añade latencia
  • p. ej., el modo de voz de ChatGPT antes de GPT-4o (tres modelos encadenados)
VS
② Nativa
  • Un solo modelo recibe varias entradas directamente
  • De la entrada a la salida en la misma red
  • El modelo ve directamente el tono y cómo encajan imagen y sonido
  • Poca información perdida en los relevos
  • p. ej., GPT-4o (mayo de 2024), Gemini de Google, la línea Omni de Qwen

La nativa permite «interpretar a la vez el audio y la imagen de un vídeo» dentro de un solo modelo.
La ensamblada mete un relevo —como transcribir antes la voz a texto— y ahí se pierde información.

Un ejemplo concreto: «mira un vídeo de cocina de YouTube y saca la receta». Ensamblada: audio → Whisper a texto → GPT para resumir; vídeo → extraer fotogramas → analizarlos aparte. Muchos pasos. Un modelo nativo que acepte vídeo directamente (Gemini, por ejemplo) puede recibir el archivo de vídeo entero y devolver la receta en una sola llamada a la API, relacionando la explicación hablada con lo que se ve dentro del propio modelo.

4. ¿Qué determina la fuerza en cada modalidad?

«Qué modelo es el mejor» se reordena con cada generación: tanto el liderazgo en vídeo como la calidad de la experiencia de voz han cambiado de manos en cuestión de seis meses. Por eso lo que conviene retener no es la clasificación en sí, sino qué determina técnicamente la fuerza de cada modalidad. Con esos ejes claros podrás juzgar por tu cuenta cualquier modelo que aparezca mañana.

🎬 Lo que decide la comprensión de vídeo

① La densidad de muestreo de fotogramas (cada cuántos segundos mira una imagen). ② Un contexto capaz de retener material largo. ③ El razonamiento causal sobre el eje temporal. Un vídeo de una hora son 3.600 fotogramas incluso a 1 fps, lo que en tokens ronda las centenas de miles. La capacidad de vídeo y la longitud de contexto van acopladas: por eso todo modelo fuerte en vídeo tiene, sin excepción, una ventana grande.

🎙 Lo que decide la conversación por voz

① La latencia de ida y vuelta. ② Si es dúplex completo (¿puedes interrumpir mientras el modelo está hablando?). ③ La conservación de la prosodia y la emoción. Es el terreno donde más se nota la divisoria del §3 entre ensamblada y nativa: transcribir el audio a texto antes de procesarlo arrastra, por construcción, retardo y pérdida de información.

📄 Lo que decide el análisis de documentos y UI

① La precisión del OCR. ② La conservación del layout (si tablas, columnas y notas al pie aguantan sin descolocarse). ③ Si puede devolver coordenadas. El tercero pasa desapercibido, pero es decisivo en los agentes que manejan una pantalla: saber que hay un botón no sirve de nada si no sabes dónde está, porque entonces no se puede hacer clic.

🔓 Lo que decide los modelos abiertos

① Si es omnimodal o un ensamblaje de modelos modalidad por modalidad. ② La disponibilidad de los pesos y su licencia. Que algo se anuncie como «abierto» no impide que la licencia ponga condiciones al uso comercial, y no es nada raro. Si el plan es alojarlo tú, lee la licencia antes que los benchmarks.

La tabla siguiente es una valoración orientativa nuestra, de mayo de 2026, basada en lo que cada proveedor había publicado sobre las entradas que admite; no son mediciones de benchmarks. Las posiciones cambian, así que conviene mirar la lista de modelos vigentes para saber qué se puede elegir hoy, y la comparativa entre GPT-5.6 Sol y Gemini o las fichas de modelo de cada proveedor para la comparación directa. Aquí léela como un ejemplo concreto de cómo se traducen en diferencias reales los cuatro ejes anteriores.

ModeloTextoImagenAudioVídeoPunto fuerte
GPT-5.5◎◎××Lee texto + imágenes; la API no acepta entrada de audio ni de vídeo
Gemini 3.1 Pro◎◎◎◎◎Fuerte en comprensión de vídeo, también de vídeo largo
Claude Opus 4.7◎◎××Análisis de UI/documentos; fuerte para cargas de agente
Qwen3.5-Omni◎◎◎◎Omnimodal: un solo modelo recibe las cuatro entradas. Se ofrece por API (pesos sin publicar a septiembre de 2026)
DeepSeek V4-Pro◎×××Solo texto y barato (la entrada de imágenes llegó con la línea Flash desde agosto de 2026)

× = la API no acepta esa entrada (no se cuentan funciones de las apps que pasan por otro modelo o por transcripción, como la charla por voz). La compatibilidad se comprobó en fuentes primarias: la página del modelo GPT-5.5 de OpenAI, la página del modelo Gemini 3.1 Pro de Google, la página del modelo Claude Opus 4.7 de Anthropic, el informe técnico de Qwen3.5-Omni, el registro de cambios de la API de DeepSeek (consultadas en septiembre de 2026).

Lo que la tabla deja ver es que los cuatro ejes actúan por separado:

  • En vídeo, la distancia la abre la duración: Video-MME puntúa vídeos de 11 segundos a una hora en tres tramos (corto, medio y largo), y todos los modelos de su tabla oficial bajan en el tramo largo. En metraje largo el cuello de botella son el eje ① (densidad de fotogramas) y el ② (longitud de contexto). Si solo manejas vídeos cortos, la clasificación en vídeo largo no va contigo
  • En audio manda la arquitectura: responder rápido y a la vez captar la emoción es mucho más fácil cuando el audio se trata de forma nativa, sin pasarlo antes a texto (la transcripción añade su propia espera y borra la entonación). Aunque en la tabla de compatibilidades se alineen los «◎ audio», por la ruta de la transcripción la experiencia acaba siendo otra cosa
  • En documentos, la línea divisoria son las coordenadas: si la lectura de PDF densos y de capturas de UI se valora en montajes de agentes como Cursor, no es tanto por la precisión en sí como por poder devolver la posición
  • En los pesos abiertos, el valor depende de si son omnimodales: un único modelo que cubra todas las modalidades resulta muchísimo más ligero de operar que un montaje con un modelo distinto por modalidad. Y ya hay opciones con calidad cercana a la frontera comercial a un coste enormemente menor

5. Benchmarks que importan: MMMU / Video-MMMU / OCR / Audio

Elegirás el modelo equivocado si no sabes qué mide realmente cada benchmark. Cuatro benchmarks que hay que conocer en 2026:

Benchmarks × 4

Cómo medimos la IA multimodal

① MMMU-Pro
Comprensión multidisciplinar a partir de imágenes + figuras + gráficos. Los mejores modelos están por encima del 80 %, a la par del experto humano mediano (80,8 %). Ya sirve poco como diferenciador.
② Video-MMMU
300 vídeos de expertos en formato de clase + 900 preguntas. Mide si un modelo aprende de un vídeo y aplica lo aprendido, en tres fases: percepción, comprensión y adaptación.
③ DocVQA / OCRBench
Documentos + texto dentro de imágenes. La diferencia está en si tablas, columnas y coordenadas se leen sin romperse. Para análisis de UI, facturas y formularios, mira esto antes que MMMU.
④ AudioBench
Mide cuánto entienden lo que oyen los modelos de audio (AudioLLM): reconocimiento y traducción de voz, sonidos del entorno, y emoción y rasgos del hablante (más de 50 conjuntos de datos en el repositorio oficial). No mide la latencia ni la generación de voz, así que la rapidez de la conversación por voz hay que comprobarla aparte.

«MMMU alto = bueno en todo» es falso.
Para vídeo, mira Video-MMMU; para documentos, DocVQA; para audio, AudioBench: si no, la elección falla.

6. Por caso de uso: con qué criterio elegir

Cinco patrones de uso, con lo que conviene comprobar antes de decidir en cada uno. No cito modelos concretos: esta sección quedaría desfasada en seis meses. En su lugar está planteada para que el mismo procedimiento sirva con cualquier modelo que salga.

  • ① Preguntas/diagnóstico con foto del móvil (foto de comida → nutrición, pantalla de error → solución, foto de producto → búsqueda)
    → casi cualquiera vale; prueba dos en su plan gratuito y quédate con el que dé el nivel de detalle que prefieras. Es el caso donde menos se diferencian los modelos, así que no compensa invertir tiempo en la elección
  • ② Análisis de PDF / documentos (recibos, contratos, fichas técnicas, artículos)
    → pruébalo con tus propios documentos. Tres criterios: si las tablas aguantan sin descolocarse, si sigue el orden de lectura en textos a varias columnas y si resiste en páginas mal escaneadas. Más que la precisión de OCR de una ficha técnica, lanzarle tu página de peor calidad te lo aclara antes
  • ③ Transcripción y resumen de vídeo (reuniones, clases, YouTube)
    → depende de la duración del vídeo que manejes. Con diez minutos la diferencia es pequeña. Si vas a soltar piezas de una hora enteras, pesan los ejes ① (densidad de fotogramas) y ② (longitud de contexto) del §4, así que mira los benchmarks de vídeo largo y el tamaño de la ventana
  • ④ Conversación por voz / intérprete / práctica de entrevistas
    → comprueba primero si el tratamiento del audio es nativo. Aunque ponga «compatible con audio», por la vía de la transcripción aparecen el retardo y la pérdida de entonación. La prueba es sencilla: intenta interrumpirlo mientras está hablando
  • ⑤ Coste primero / procesamiento masivo
    → mira no solo el precio unitario, sino los descuentos por lotes y si alojarlo tú es realista. Si te decantas por pesos abiertos, lee las condiciones comerciales de la licencia antes que el rendimiento
Cómo combinarlos: en lugar de apostarlo todo a uno, sale más estable ir con dos: uno principal y otro que cubra su punto débil. Dos planes de la gama de 20 $/mes suman 40 $, no muy lejos de lo que cuesta un único plan superior. Y los usos de poca frecuencia, como el vídeo, se resuelven puntualmente en un plan gratuito como el de Google AI Studio. Este criterio de reparto no cambia por muchas generaciones de modelos que pasen.

7. Límites duros: úsala, no confíes ciegamente

La IA multimodal es potente, pero tres límites te pasarán factura si los ignoras.

Límite ①: no leas las «conjeturas» derivadas de fotos como hechos

Preguntar «haz OCR del importe de este recibo» suena sencillo, pero si la imagen tiene baja resolución, está oscura o torcida, la IA inventa cifras plausibles. Incluso un modelo por encima del 80 % en MMMU-Pro falla casi una de cada cinco respuestas. Importes, fechas, nombres propios: siempre que un humano lo verifique. Especialmente en ámbitos legales, financieros y sanitarios.

Límite ②: la precisión en vídeo cae en la zona media

Incluso para el modelo que lidera los benchmarks de vídeo, recuperar información del medio de un vídeo de 1 hora es difícil: es el mismo problema de «Lost in the Middle» que el problema de la ventana de contexto. Para los segmentos clave, especifica marcas de tiempo: «analiza específicamente el segmento 30:00–35:00» da resultados mucho mejores.

Límite ③: el audio sufre con dialectos y jerga

El habla estándar en inglés o japonés es precisa, pero los dialectos regionales, el vocabulario especializado, los solapamientos entre varios hablantes y los entornos ruidosos aumentan los errores. Para actas de reuniones y otros usos de alto riesgo, combínala con herramientas especializadas (Otter.ai, Notta, etc.) o limpia primero el audio antes de enviarlo a la IA.

Resumen

Recapitulando:

  • 2026: GPT-5.5 y Gemini 3.1 Pro superaron el 80 % en MMMU-Pro (cifras de cada empresa; valores y fuentes en el §1). La IA multimodal ha pasado de «conviene tenerla» a «hay que tenerla»
  • La arquitectura ha ido pasando de cadenas de modelos separados (ensamblada) a modelos nativos que reciben varias entradas directamente. Pero recibir las cuatro en un solo modelo es cosa de Gemini, la línea Omni de Qwen y unos pocos más; el modelo insignia de OpenAI y la API de Claude llegan hasta la imagen (a septiembre de 2026)
  • La fuerza la determinan cuatro ejes: vídeo = densidad de fotogramas y longitud de contexto / audio = tratamiento nativo o vía transcripción / documentos = si devuelve coordenadas / pesos abiertos = si es omnimodal y qué dice su licencia. Las posiciones se reordenan; los ejes no
  • Benchmarks: MMMU-Pro / Video-MMMU / DocVQA / AudioBench: revisa los cuatro ejes antes de elegir
  • Para elegir por caso de uso, lo más rápido es probarlo con tu propio material: en PDF, lanzarle tu página de peor calidad gana a cualquier ficha técnica. Y como combinación, uno principal más otro que cubra su punto débil es lo que mejor aguanta
  • Tres límites: conjeturas en imágenes de baja calidad / caída de precisión en la zona media del vídeo / audio con dialectos y jerga. Verifica dos veces las salidas críticas

En 2026, el trabajo con IA que se resuelve «solo con texto» se reduce a toda velocidad. Fotos del móvil, grabaciones de reuniones, vídeos de YouTube, PDF: pasárselos a la IA ya es lo normal (que un solo modelo los admita todos depende del modelo). Saber usar lo multimodal ya no es «una función útil»: es el mínimo de la alfabetización en IA de 2026. Empieza hoy pasándole a la IA una foto del móvil; con eso basta para arrancar.

Preguntas frecuentes

P1. ¿Puedo probar la IA multimodal gratis?

Sí. El plan gratuito de ChatGPT (admite entrada de imagen), Google AI Studio (plan gratuito, vídeo incluido) y el plan gratuito de Claude.ai (admite imágenes) permiten probarla. Eso sí, en Google AI Studio y en el nivel gratuito de la API de Gemini, lo que envías se usa para mejorar productos de Google y pueden leerlo revisores humanos (condiciones de la API de Gemini), así que no subas imágenes ni audios sensibles. Pero los modelos asignados a los planes gratuitos cambian con cada generación, así que en lugar de memorizar nombres conviene comprobar en la pantalla de cada servicio qué entradas acepta (imagen, audio, vídeo) y cuánto se puede usar al día. Algunas funciones, como los límites de conversación por voz o de vídeo largo, se amplían en los planes de pago. Consulta la guía de herramientas de IA gratuitas.

P2. ¿En qué se diferencia la IA de generación de imágenes de la IA multimodal?

Son cosas distintas. Herramientas como Midjourney y Stable Diffusion se especializan en generar imágenes a partir de texto: un flujo unidireccional texto→imagen. La IA multimodal se refiere a entender imágenes (y otras modalidades) como entradas. Algunos servicios, como ChatGPT y Gemini, hacen ambas cosas, pero entender y generar son capacidades distintas: destacar en una no garantiza destacar en la otra, así que pruébalas por separado según tu uso. Consulta la comparativa de herramientas de IA de generación de imágenes.

P3. ¿Cómo envío vídeo por la API?

La API de Gemini (la API para desarrolladores de ai.google.dev) acepta vídeo tal cual. Para vídeos largos o que vayas a reutilizar, lo recomendado es subirlos con la Files API y pasar la referencia; los vídeos pequeños pueden ir incrustados en la propia petición. También puedes pasar una URL pública de YouTube o registrar archivos de Cloud Storage en la Files API (documentación para desarrolladores de Google). Con Vertex AI de Google Cloud, se indica en fileData una URI gs:// de Cloud Storage (documentación de Google Cloud). Las API de OpenAI y de Claude no aceptan vídeo directamente a 26 de septiembre de 2026 (la página de modelo de GPT-6 Astra marca el vídeo como «Not supported»; Anthropic indica que todos sus modelos actuales admiten entrada de texto e imagen). En ambos casos el procedimiento es extraer fotogramas del vídeo y enviarlos como imágenes; OpenAI tiene un ejemplo en su Cookbook oficial. Consulta la guía para principiantes de la API de IA.

P4. ¿La privacidad está garantizada?

Las imágenes, el audio y el vídeo suelen contener datos sensibles. El uso para entrenamiento cambia entre las apps para particulares y la API o los planes de empresa. En las apps para particulares, ChatGPT puede usar tus conversaciones para entrenar, y puedes evitarlo desactivando «Improve the model for everyone» en la configuración (centro de ayuda de OpenAI). Claude (Free, Pro, Max) usa tus chats para entrenar si tú lo permites (centro de privacidad de Anthropic). Las apps de Gemini usan tus chats —también mediante revisión humana— para mejorar los servicios de Google mientras «Keep Activity» está activado, y al desactivarlo se detiene (centro de privacidad de las apps de Gemini). En cambio, la API de OpenAI y ChatGPT Business/Enterprise, la API y los planes de empresa de Anthropic, y el nivel de pago de la API de Gemini no se usan para entrenar por defecto (explicación de Anthropic para empresas, condiciones de la API de Gemini). La excepción: en el nivel gratuito de la API de Gemini y en Google AI Studio, tus entradas se usan para mejorar productos de Google. Para caras, imágenes médicas o documentos internos, elige una API de pago o un plan de empresa. Para confidencialidad total, ejecuta en tu propio equipo un modelo de pesos abiertos (en la familia Qwen con todas las modalidades, eso es la generación anterior, Qwen3-Omni; el último Qwen3.5-Omni solo se ofrece por API y sus pesos no están publicados a septiembre de 2026).

P5. ¿La multimodal es más cara que solo texto?

Las imágenes y los vídeos se facturan por conversión a tokens. Una imagen ≈ unos cientos a ~1000 tokens (según resolución y modelo); en vídeo, la API de Gemini cuenta unos 100 tokens por segundo con la configuración predeterminada y unos 300 en alta resolución (documentación para desarrolladores de Google, consultada en septiembre de 2026). Una hora con la configuración predeterminada son 100 × 3600 s ≈ 360 000 tokens. Las técnicas de coste de ahorro de tokens en IA (envío solo de extractos, cacheo) también funcionan para vídeo.