Índice
- 1. En 2026, la IA dejó de ser «solo texto»: MMMU-Pro supera el 80 %
- 2. ¿Qué es la IA multimodal? Cuatro entradas, un solo cerebro
- 3. Ensamblada frente a nativa: la divisoria arquitectónica
- 4. ¿Qué determina la fuerza en cada modalidad?
- 5. Benchmarks que importan: MMMU / Video-MMMU / OCR / Audio
- 6. Por caso de uso: con qué criterio elegir
- 7. Límites duros: úsala, no confíes ciegamente
- Resumen
- Preguntas frecuentes
En abril de 2026, el benchmark de IA multimodal MMMU-Pro (comprensión multidisciplinar a través de imágenes, gráficos y figuras) vio cómo GPT-5.5, Claude Opus 4.7, Gemini 3 y Qwen 3.5 Omni se situaron todos entre el 81 y el 83 %. Una cifra impresionante si consideramos que GPT-4V alcanzó por primera vez aquí un 56 % en 2023, pero la frontera está ahora saturada. La era de la IA «solo de texto» ha terminado de verdad.
No son solo las puntuaciones. La arquitectura ha migrado por completo de «ensamblada» a «nativa unificada». Hasta 2024, el patrón dominante era «entrenar un modelo de texto, un codificador de imágenes y un codificador de audio por separado, y luego unirlos en la salida». Los modelos insignia de 2026 convierten texto, imágenes, audio y fotogramas de vídeo en el mismo flujo de tokens y razonan sobre todo ello en un único cerebro. Eso hace que cosas como «relacionar el audio y la imagen de un vídeo para entender el sentido» o «interpretar de forma cruzada las figuras de un PDF y su texto principal» resulten naturales.
Adelanto mi conclusión: lo multimodal ha pasado de ser un «extra agradable» a ser «no tenerlo es inviable». Saca una foto a una pantalla de error y deja que la IA la resuelva al instante, captura un PDF y extrae lo esencial, transcribe y resume un vídeo de YouTube: esto es ya la base de la fluidez con la IA en 2026. Este artículo cubre la definición, la diferencia entre multimodal ensamblada y nativa, qué determina técnicamente la fuerza en cada modalidad, con qué criterio elegir según el caso de uso, los benchmarks y los límites. El eje no es la clasificación de un modelo concreto, sino la forma de decidir, de modo que sigue sirviendo aunque cambie la generación.
Cuatro entradas procesadas por un solo cerebro
— Texto, imágenes, audio y vídeo como un único flujo compartido de tokens
Abril de 2026: GPT-5.5, Claude Opus 4.7 y Gemini 3 alcanzan todos el 81–83 % en MMMU-Pro.
La era del «la imagen es un extra» se acabó; el razonamiento de cuatro modalidades en un cerebro es el nuevo estándar.
1. En 2026, la IA dejó de ser «solo texto»: MMMU-Pro supera el 80 %
«Multimodal» empezó a sonar con fuerza en 2024, pero los modelos de entonces solo podían leer imágenes como algo accesorio: las mejores puntuaciones en MMMU (comprensión multimodal multidisciplinar) rondaban el 56 %. La mediana humana (82 %) quedaba fuera de alcance para preguntas con imágenes que requerían conocimiento especializado.
2026 es muy distinto. Resultados más recientes de MMMU-Pro (el benchmark actualizado más exigente) de abril de 2026:
- GPT-5.5: 83,4 %
- Claude Opus 4.7: 82,1 %
- Gemini 3.1 Pro: 81,7 %
- Qwen 3.5 Omni: 81,0 %
«Superar el 80 % significa que el benchmark se está saturando» es la realidad de 2026. La diferenciación se ha trasladado a la comprensión de vídeo (Video-MMMU), los documentos con OCR denso y el razonamiento conjunto audiovisual: terreno más difícil. La tabla pública de MMMU benchmark permite a cualquiera comparar.
2. ¿Qué es la IA multimodal? Cuatro entradas, un solo cerebro
Definición: «Un modelo de IA que maneja entradas más allá del texto: imágenes, audio, vídeo, etc.» En el lenguaje de 2026, «multimodal» suele referirse a modelos que integran texto, imagen, audio y vídeo —cuatro modalidades— en una sola tubería.
La IA tradicional era monomodal: GPT-3 manejaba texto; Whisper hacía solo voz a texto; Stable Diffusion solo texto a imagen. Combinarlos requería una tubería en la que la salida de un modelo alimentaba al siguiente, y se perdía información en cada traspaso.
La IA multimodal cambia las reglas: «un solo modelo entiende todas las entradas a la vez». Una tarea compuesta como «lee esta captura de error (imagen) junto con mi pregunta (texto), luego explícame la causa en audio» se completa en una sola llamada a la API.
3. Ensamblada frente a nativa: la divisoria arquitectónica
Entender el «bajo el capó» hace evidentes las fortalezas de cada modelo. Entre 2024 y 2026 se produjo un cambio generacional en la arquitectura.
Ensamblada (~2024) frente a Nativa (2025+)
- Modelo de texto + codificador de imágenes
- Capa adaptadora que une en la salida
- Audio/vídeo en tuberías separadas
- Pérdida de información en los límites
- p. ej., GPT-4V, Claude 3 Vision
- Todas las modalidades → mismo flujo de tokens
- Razonadas por un único Transformer a la vez
- Audio + fotogramas de vídeo enlazados en el mismo paso
- Pérdida de información mínima, razonamiento más profundo
- p. ej., GPT-5.5, Gemini 3, Qwen Omni
La nativa hace que «interpretar audio e imagen de un vídeo juntos» / «razonar de forma cruzada entre las figuras de un PDF y su cuerpo» resulte natural.
La ensamblada requería pasos intermedios como «extraer primero el texto de la imagen» a modo de relevo.
Ejemplo concreto: «mira un vídeo de cocina de YouTube y saca la receta». Ensamblada: audio → Whisper a texto → GPT para el resumen; vídeo → extracción de fotogramas → análisis de imagen por separado. Muchos pasos. Nativa: una sola llamada a la API toma el archivo de vídeo completo como entrada → devuelve la receta directamente. La correlación cruzada entre la explicación hablada y la acción visible está en otro nivel de naturalidad.
4. ¿Qué determina la fuerza en cada modalidad?
«Qué modelo es el mejor» se reordena con cada generación: tanto el liderazgo en vídeo como la calidad de la experiencia de voz han cambiado de manos en cuestión de seis meses. Por eso lo que conviene retener no es la clasificación en sí, sino qué determina técnicamente la fuerza de cada modalidad. Con esos ejes claros podrás juzgar por tu cuenta cualquier modelo que aparezca mañana.
① La densidad de muestreo de fotogramas (cada cuántos segundos mira una imagen). ② Un contexto capaz de retener material largo. ③ El razonamiento causal sobre el eje temporal. Un vídeo de una hora son 3.600 fotogramas incluso a 1 fps, lo que en tokens ronda las centenas de miles. La capacidad de vídeo y la longitud de contexto van acopladas: por eso todo modelo fuerte en vídeo tiene, sin excepción, una ventana grande.
① La latencia de ida y vuelta. ② Si es dúplex completo (¿puedes interrumpir mientras el modelo está hablando?). ③ La conservación de la prosodia y la emoción. Es el terreno donde más se nota la divisoria del §3 entre ensamblada y nativa: transcribir el audio a texto antes de procesarlo arrastra, por construcción, retardo y pérdida de información.
① La precisión del OCR. ② La conservación del layout (si tablas, columnas y notas al pie aguantan sin descolocarse). ③ Si puede devolver coordenadas. El tercero pasa desapercibido, pero es decisivo en los agentes que manejan una pantalla: saber que hay un botón no sirve de nada si no sabes dónde está, porque entonces no se puede hacer clic.
① Si es omnimodal o un ensamblaje de modelos modalidad por modalidad. ② La disponibilidad de los pesos y su licencia. Que algo se anuncie como «abierto» no impide que la licencia ponga condiciones al uso comercial, y no es nada raro. Si el plan es alojarlo tú, lee la licencia antes que los benchmarks.
Lo que sigue es una instantánea de mayo de 2026. Las posiciones cambian, así que para la comparativa vigente conviene mirar la comparativa entre GPT-5.6 Sol y Gemini o las fichas de modelo de cada proveedor. Aquí léela como un ejemplo concreto de cómo se traducen en diferencias reales los cuatro ejes anteriores.
| Modelo | Texto | Imagen | Audio | Vídeo | Punto fuerte |
|---|---|---|---|---|---|
| GPT-5.5 | ◎ | ◎ | ◎ | ◎ | Procesa las cuatro modalidades a alto nivel; Voice Mode bidireccional |
| Gemini 3.1 Pro | ◎ | ◎ | ◎ | ◎◎ | Líder en vídeo con 78,4 %, fuerte en vídeo largo |
| Claude Opus 4.7 | ◎ | ◎ | △ | △ | Análisis de UI/documentos; fuerte para cargas de agente |
| Qwen 3.5 Omni | ◎ | ◎ | ◎ | ◎ | Omnimodal de pesos abiertos, gran coste/rendimiento |
| DeepSeek V4-Pro | ◎ | ○ | △ | △ | Centrado en texto + imagen, muy barato |
Lo que la tabla deja ver es que los cuatro ejes actúan por separado (todas las cifras son de mayo de 2026):
- En vídeo, la distancia la abre la duración: en Video-MME la separación fue de 78,4 % frente a 71,2 % y 67,8 %, pero con clips cortos no se abre ni de lejos tanto. La brecha aparece en metrajes de una hora, porque ahí el cuello de botella son el eje ① (densidad de fotogramas) y el ② (longitud de contexto). Si solo manejas vídeos cortos, esa clasificación no va contigo
- En audio manda la arquitectura: responder por debajo de 200 ms y a la vez captar la emoción solo es posible cuando el audio se trata de forma nativa, sin pasarlo antes a texto. Aunque en la tabla de compatibilidades se alineen los «◎ audio», por la ruta de la transcripción la experiencia acaba siendo otra cosa
- En documentos, la línea divisoria son las coordenadas: si la lectura de PDF densos y de capturas de UI se valora en montajes de agentes como Cursor, no es tanto por la precisión en sí como por poder devolver la posición
- En los pesos abiertos, el valor depende de si son omnimodales: un único modelo que cubra todas las modalidades resulta muchísimo más ligero de operar que un montaje con un modelo distinto por modalidad. Y ya hay opciones con calidad cercana a la frontera comercial a un coste enormemente menor
5. Benchmarks que importan: MMMU / Video-MMMU / OCR / Audio
Elegirás el modelo equivocado si no sabes qué mide realmente cada benchmark. Cuatro benchmarks que hay que conocer en 2026:
Cómo medimos la IA multimodal
«MMMU alto = bueno en todo» es falso.
Para vídeo, mira Video-MMMU; para documentos, DocVQA; para audio, AudioBench: si no, la elección falla.
6. Por caso de uso: con qué criterio elegir
Cinco patrones de uso, con lo que conviene comprobar antes de decidir en cada uno. No cito modelos concretos: esta sección quedaría desfasada en seis meses. En su lugar está planteada para que el mismo procedimiento sirva con cualquier modelo que salga.
- ① Preguntas/diagnóstico con foto del móvil (foto de comida → nutrición, pantalla de error → solución, foto de producto → búsqueda)
→ casi cualquiera vale; prueba dos en su plan gratuito y quédate con el que dé el nivel de detalle que prefieras. Es el caso donde menos se diferencian los modelos, así que no compensa invertir tiempo en la elección - ② Análisis de PDF / documentos (recibos, contratos, fichas técnicas, artículos)
→ pruébalo con tus propios documentos. Tres criterios: si las tablas aguantan sin descolocarse, si sigue el orden de lectura en textos a varias columnas y si resiste en páginas mal escaneadas. Más que la precisión de OCR de una ficha técnica, lanzarle tu página de peor calidad te lo aclara antes - ③ Transcripción y resumen de vídeo (reuniones, clases, YouTube)
→ depende de la duración del vídeo que manejes. Con diez minutos la diferencia es pequeña. Si vas a soltar piezas de una hora enteras, pesan los ejes ① (densidad de fotogramas) y ② (longitud de contexto) del §4, así que mira los benchmarks de vídeo largo y el tamaño de la ventana - ④ Conversación por voz / intérprete / práctica de entrevistas
→ comprueba primero si el tratamiento del audio es nativo. Aunque ponga «compatible con audio», por la vía de la transcripción aparecen el retardo y la pérdida de entonación. La prueba es sencilla: intenta interrumpirlo mientras está hablando - ⑤ Coste primero / procesamiento masivo
→ mira no solo el precio unitario, sino los descuentos por lotes y si alojarlo tú es realista. Si te decantas por pesos abiertos, lee las condiciones comerciales de la licencia antes que el rendimiento
7. Límites duros: úsala, no confíes ciegamente
La IA multimodal es potente, pero tres límites te pasarán factura si los ignoras.
Límite ①: no leas las «conjeturas» derivadas de fotos como hechos
Preguntar «haz OCR del importe de este recibo» suena sencillo, pero si la imagen tiene baja resolución, está oscura o torcida, la IA inventa cifras plausibles. Incluso un 83 % en MMMU significa que el 17 % de las respuestas son erróneas. Importes, fechas, nombres propios: siempre que un humano lo verifique. Especialmente en ámbitos legales, financieros y sanitarios.
Límite ②: la precisión en vídeo cae en la zona media
Aunque Gemini 3 lidera en vídeo, recuperar información del medio de un vídeo de 1 hora es difícil: es el mismo problema de «Lost in the Middle» que el problema de la ventana de contexto. Para los segmentos clave, especifica marcas de tiempo: «analiza específicamente el segmento 30:00–35:00» da resultados mucho mejores.
Límite ③: el audio sufre con dialectos y jerga
El habla estándar en inglés o japonés es precisa, pero los dialectos regionales, el vocabulario especializado, los solapamientos entre varios hablantes y los entornos ruidosos aumentan los errores. Para actas de reuniones y otros usos de alto riesgo, combínala con herramientas especializadas (Otter.ai, Notta, etc.) o limpia primero el audio antes de enviarlo a la IA.
Resumen
Recapitulando:
- Abril de 2026: GPT-5.5, Claude Opus 4.7 y Gemini 3 todos al 81–83 % en MMMU-Pro. La IA multimodal ha pasado de «conviene tenerla» a «hay que tenerla»
- Arquitectura: ensamblada (~2024) → omnimodal nativa (2025+). Todas las modalidades fluyen por un único flujo compartido de tokens
- La fuerza la determinan cuatro ejes: vídeo = densidad de fotogramas y longitud de contexto / audio = tratamiento nativo o vía transcripción / documentos = si devuelve coordenadas / pesos abiertos = si es omnimodal y qué dice su licencia. Las posiciones se reordenan; los ejes no
- Benchmarks: MMMU-Pro / Video-MMMU / DocVQA / AudioBench: revisa los cuatro ejes antes de elegir
- Para elegir por caso de uso, lo más rápido es probarlo con tu propio material: en PDF, lanzarle tu página de peor calidad gana a cualquier ficha técnica. Y como combinación, uno principal más otro que cubra su punto débil es lo que mejor aguanta
- Tres límites: conjeturas en imágenes de baja calidad / caída de precisión en la zona media del vídeo / audio con dialectos y jerga. Verifica dos veces las salidas críticas
En 2026, el trabajo con IA que se completa «solo con texto» se reduce a marchas forzadas. Fotos del móvil, grabaciones de reuniones, vídeos de YouTube, PDF: todos pasan ahora por la misma IA. Saber usar lo multimodal ya no es «una funcionalidad útil»; es el suelo de la alfabetización en IA de 2026. Empieza hoy enviándole a la IA una foto de tu móvil: con eso basta para arrancar.
Preguntas frecuentes
Sí. ChatGPT gratuito (GPT-5 mini, admite entrada de imagen), Google AI Studio (Gemini 2.5 Flash, vídeo incluido, plan gratuito) y Claude.ai gratuito (Sonnet, admite imágenes) permiten probarla. Voice Mode y el vídeo largo requieren planes de pago. Consulta la guía de herramientas de IA gratuitas.
Son cosas distintas. Herramientas como Midjourney y Stable Diffusion se especializan en generar imágenes a partir de texto: un flujo unidireccional texto→imagen. La IA multimodal se refiere a entender imágenes (y otras modalidades) como entradas. GPT-5.5 y Gemini 3 hacen ambas cosas. Consulta la comparativa de herramientas de IA de generación de imágenes.
La API de Gemini admite archivos de vídeo directamente a través del campo fileData (vía Google Cloud Storage). En OpenAI el patrón habitual es extraer fotogramas → enviarlos como una secuencia de imágenes. La API de Claude, a mayo de 2026, no admite vídeo de forma nativa: se requieren fotogramas. Consulta la guía para principiantes de la API de IA.
Las imágenes, el audio y el vídeo suelen contener datos sensibles. OpenAI, Anthropic y Google excluyen por defecto tus entradas del entrenamiento, pero para uso corporativo elige planes Enterprise o acceso por API (entrenamiento desactivado por defecto). Caras, imágenes médicas, documentos internos: extrema la cautela. Para confidencialidad total, considera LLM locales (pesos abiertos de Qwen 3.5 Omni, etc.).
Las imágenes y los vídeos se facturan por conversión a tokens. Una imagen ≈ unos cientos a ~1000 tokens (según resolución y modelo); el vídeo se factura por segundos × decenas a cientos de tokens. Un vídeo de 1 hora puede consumir cientos de miles de tokens. Las técnicas de coste de ahorro de tokens en IA (envío solo de extractos, cacheo) también funcionan para vídeo.