¿Qué es la IA multimodal? Arquitectura unificada de texto/imagen/audio/vídeo y criterios para elegir
En abril de 2026, el benchmark multimodal MMMU-Pro alcanzó el 81–83 % en GPT-5.5, Claude Opus 4.7, Gemini 3.1 Pro y Qwen 3.5 Omni: la comprensión de imágenes está prácticamente saturada. La arquitectura ha migrado de ensamblada (codificadores separados + adaptador) a omnimodal nativa (todas las modalidades como un flujo compartido de tokens). Este artículo cubre qué es la IA multimodal (LMM/VLM/Omnimodal), la divisoria arquitectónica y por qué importa, qué determina técnicamente la fuerza en cada modalidad (vídeo, audio, documentos/UI, modelos abiertos) más una instantánea comparativa de mayo de 2026, cuatro benchmarks que vigilar (MMMU-Pro, Video-MMMU, DocVQA, AudioBench), cinco casos de uso y con qué criterio decidir en cada uno y los tres límites duros (conjeturas en imágenes de baja calidad, precisión en la zona media del vídeo, audio con dialectos/jerga), todo anclado en investigación actual y uso práctico.