什么是多模态AI?——文本/图像/音频/视频统一架构与选型基准
2026年4月,多模态基准MMMU-Pro在GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro与Qwen 3.5 Omni上同时达到81–83%——图像理解实际上已经饱和。架构已从拼接式(独立编码器+适配器)迁移至原生全模态(所有模态作为共享token流)。本文涵盖什么是多模态AI(LMM/VLM/Omnimodal)、架构分水岭及其意义、各模态的强弱在技术上由什么决定(视频、音频、文档/UI、开放权重模型)以及2026年5月的对比快照、值得关注的四个基准(MMMU-Pro、Video-MMMU、DocVQA、AudioBench)、五种用例各自该依据什么标准来选,以及三条硬性局限(低质量图像的猜测、视频中段准确率、方言与术语音频)——以最新研究与实操经验为依据。