在多模态AI基准测试MMMU-Pro(跨图像、图表与图形的多学科综合理解)上,顶尖模型已经进入80%区间。OpenAI在2026年4月公布GPT-5.5为81.2%(不使用工具),Google在2月公布Gemini 3.1 Pro为80.5%。初代MMMU于2023年底发布时,GPT-4V的得分约为56%。MMMU-Pro是MMMU的加难版(2024年9月发布),两者并非同一把尺子——但模型如今在更难的版本上也超过了80%。“仅限文本”AI的时代真正结束了。

变化的不只是分数。模型的构建方式也在从“拼接式”转向“原生式”。过去常见的做法是把几个独立的模型串起来:一个把语音转成文字,一个对文本进行推理,一个把回答朗读出来(OpenAI称GPT-4o之前ChatGPT的语音模式正是这样的三段式流水线)。如今,由一个模型直接接收多种输入的设计已经普及,Gemini和Qwen的Omni系列能在一个模型中处理文本、图像、音频、视频全部四种。但并非所有厂商都走了这条路:截至2026年9月,OpenAI的旗舰模型和Claude的API只接受文本和图像输入,OpenAI的语音由gpt-realtime等独立的语音模型负责(见§4的表)。

先把我的观点摆出来:多模态已经从“有更好”变成了“没有就玩不转”。拍一张报错截图让AI当场解决,截图PDF抓取要点,把YouTube视频转录并总结——这些已经是2026年AI流利度的基础门槛。本文将围绕定义、拼接式与原生多模态的区别、各模态的强弱在技术上由什么决定、按用例该依据什么标准来选、基准测试与局限展开。全文以判断方法而非某款模型的排名为主轴,因此换代之后依然用得上。

MULTIMODAL AI · 2026

处理文本、图像、音频、视频的AI

— 一个模型能接收多少种输入,因模型而异

TEXT
文本
散文、代码、符号
IMAGE
图像
照片、图表、截图
AUDIO
音频
语音、音乐、环境音
VIDEO
视频
时间+画面+声音

在MMMU-Pro上,顶尖模型已进入80%区间(各公司公布值及出处见§1)。
“能看图只是附赠”的时代已经结束。但能在一个模型中接收全部四种输入的只有Gemini、Qwen的Omni系列等部分模型;OpenAI的旗舰模型和Claude的API只到图像(截至2026年9月)。

1. 2026年,AI不再“仅限文本”——MMMU-Pro突破80%

“多模态”在2024年开始流行,但在那之前不久的模型只能把图像作为附加品来读:MMMU(多学科多模态理解)于2023年底发布时,连最强的GPT-4V也只有56%左右。在需要专业知识的图像题目上,人类专家中位水平(82.6%)遥不可及。

2026年完全不同。MMMU-Pro(MMMU的加难版)的公布成绩:

“突破80%意味着基准开始饱和”是2026年的现实。差异化已转向视频理解(Video-MMMU)、OCR密集文档以及音画联合推理——更难的疆域。MMMU benchmark的公开排行榜任何人都能比较查看。

2. 什么是多模态AI?——不只读文本的AI

定义:“除文本外,还能接收图像、音频、视频等输入的AI模型”。能接收到什么程度因模型而异,从文本加图像到在一个模型中处理音频和视频都有(见下方的术语整理)。

传统AI是单模态的:GPT-3处理文本;Whisper只做语音转文本;Stable Diffusion只做文本生图。把它们组合起来需要构建管线——一个模型的输出喂给下一个,每次交接都会损失信息。

在多模态AI中,一个模型同时查看多种输入并作答。例如“同时看这张截图里的错误信息(图像)和我的问题(文本),告诉我原因”,一次API调用即可完成。

术语:LMM(Large Multimodal Model,大型多模态模型)= 具有多模态能力的大模型。VLM(Vision-Language Model,视觉-语言模型)= 仅文本+图像。Omnimodal(全模态)= 统一四种及以上模态的新一代模型。同样写着“支持多模态”,是全模态还是VLM(最多到文本+图像)完全是两回事。如果打算处理音频或视频,与其数兼容表里有几个◎,不如先确认这个分类——以VLM为基础的模型,音频和视频能力往往相当有限。

3. 拼接式与原生式——架构的分水岭

理解了机制上的差别,就更容易看清各模型的长处。构建方式大致分为两种。

架构对比

拼接式 vs 原生式

① 拼接式
  • 转录、推理、朗读由各自独立的模型完成
  • 模型之间以文本传递
  • 语气、多个说话人、背景声音在途中丢失
  • 每多一段就多一段延迟
  • 例:GPT-4o之前ChatGPT的语音模式(三个模型串联)
VS
② 原生式
  • 一个模型直接接收多种输入
  • 从输入到输出由同一个网络处理
  • 模型能直接感知语气以及画面与声音的对应
  • 中转造成的信息缺失少
  • 例:GPT-4o(2024年5月)、Google的Gemini、Qwen的Omni系列

原生式可以在一个模型内“同时理解视频的声音与画面”。
拼接式则会插入中转环节(例如先把语音转成文字),信息就在那里丢失。

举个具体例子:“看一段YouTube做菜视频,整理出菜谱”。拼接式是“音频→Whisper转文本→GPT总结”“视频→抽帧→另行分析”,步骤很多。能直接接收视频的原生式模型(如Gemini)则只需一次API调用,“输入整个视频文件→直接输出菜谱”,口头讲解与画面动作的对应也在模型内部完成。

4. 各模态的强弱由什么决定

“哪款模型最强”这个答案每一代都在换:视频的头名换过,语音的体验优劣也在半年之内翻过盘。所以真正该记住的不是名次,而是每种模态的强弱在技术上究竟由什么决定。掌握了这一点,新模型一出来你就能自己判断。

🎬 决定视频理解的因素

①抽帧密度(每隔几秒看一帧)②能容纳长时长的上下文 ③时序上的因果推理。1小时的视频即使按1fps也有3,600帧,折算成token是几十万量级。视频能力与上下文长度是绑在一起的——所以“视频强”的模型无一例外窗口都大。

🎙 决定语音对话的因素

①往返延迟 ②是否全双工(对方还在说的时候能不能插话)③韵律与情绪的保留。这里正是§3中拼接式与原生式差距表现得最明显的地方:先把语音转成文本再处理的结构,原理上就避不开延迟和信息损失。

📄 决定文档与UI解析的因素

①OCR精度 ②版面的保留(表格、分栏、脚注会不会乱)③能否返回坐标。第三点最容易被忽略,但对操作界面的智能体来说是决定性的:只回答“有这个按钮”而答不出“在哪里”,就点不下去。

🔓 决定开放权重模型的因素

①是真正的全模态,还是各模态拼凑起来的 ②权重能否取得,以及许可证条款。名字里带“开放”,不等于商用不受限制——附带使用条件的许可证并不少见。如果打算自己部署,请把许可证读在跑分之前。

下表是依据2026年5月时点各公司公开的输入支持情况给出的笔者参考评级,并非基准测试的实测值。名次会变,当前可选的模型及其世代请查看现行模型一览,具体对比请参考GPT-5.6 Sol 与 Gemini 的对比文章或各家的模型卡。这里的表格更适合当作“上面四条轴在现实中如何拉开差距”的实例来读。

模型文本图像音频视频优势
GPT-5.5◎◎××读取文本+图像;API不接受音频和视频输入
Gemini 3.1 Pro◎◎◎◎◎视频理解强,也能处理长视频
Claude Opus 4.7◎◎××UI/文档解析;适合智能体场景
Qwen3.5-Omni◎◎◎◎全模态:一个模型接收全部四种输入。通过API提供(截至2026年9月未公开权重)
DeepSeek V4-Pro◎×××仅文本,价格低(图像输入自2026年8月起由Flash系列提供)

×=该API不接受这种输入(语音对话等经由其他模型或转录的应用功能不计入)。输入支持情况均按一手资料核对:OpenAI的GPT-5.5模型页、Google的Gemini 3.1 Pro模型页、Anthropic的Claude Opus 4.7模型页、Qwen3.5-Omni技术报告、DeepSeek的API更新日志(2026年9月确认)。

从这张表能读出的是,四条轴各自独立地在起作用:

  • 视频的差距是被“时长”拉开的:Video-MME把11秒到1小时的视频分为短、中、长三档打分,其官方排行榜上的所有模型在长视频档的得分都更低。长视频之所以掉分,是因为上面的①抽帧密度和②上下文长度成了瓶颈。如果你只处理短视频,长视频的名次跟你没关系
  • 语音由“架构”决定:快速响应与读懂情绪要兼得,语音被原生处理、不落成文本时要容易得多(中间夹一步转录,就会多出一段等待,语调也会丢失)。产品页的兼容表上音频一栏排满◎,若走的是转录路线,实际体验完全是另一回事
  • 文档解析以“坐标”分野:PDF与UI截图的读取之所以在Cursor这类智能体场景中受重视,起作用的与其说是精度本身,不如说是能否返回位置
  • 开放权重模型的价值取决于“是不是全模态”:一款模型吃下全部模态,运维负担远小于按模态拼几个模型的做法。而且已经出现了以大幅更低成本逼近商用前沿质量的选项

5. 重要基准测试——MMMU / Video-MMMU / OCR / Audio

如果不了解每个基准实际在测什么,选型很容易选错。2026年值得记住的四个基准:

基准 × 4

衡量多模态AI的四把尺子

① MMMU-Pro
基于图像+图形+图表的多学科理解。顶尖模型已进入80%区间,与人类专家中位水平(80.8%)持平。作为区分度的指标已经较弱。
② Video-MMMU
300个讲座式专家视频+900道题。测的是模型能否从视频中学到知识并用到新问题上,分感知、理解、迁移三个阶段。
③ DocVQA / OCRBench
文档+图中文字。差距在于能否不走样地读出表格、分栏和坐标。若用于UI解析、发票、表单,应看这一项而不是MMMU。
④ AudioBench
衡量音频大模型(AudioLLM)听懂了多少:语音识别与翻译、环境声音理解、声音中的情感与说话人特征(官方仓库收录50多个数据集)。它不测延迟,也不测语音生成,语音对话的速度需要另行确认。

“MMMU高=啥都行”是错的。
视频看Video-MMMU、文档看DocVQA、音频看AudioBench——否则选型就会失准。

6. 按用例——依据什么标准来选

按用途给出五种模式,每一种都写明“确认什么之后再决定”。这里不点具体的模型名——那样写半年就过期了。取而代之的是一套流程:不管出来的是哪款模型,都能按同样的步骤判断。

  • ① 手机拍照问答/诊断(拍餐食→营养、报错画面→修复、商品照→搜索)
    → 几乎任何一款都够用。用免费版试两家,挑回答颗粒度更合你口味的那个。这个用途上模型之间差距最小,不值得在选型上耗时间
  • ② PDF/文档解析(收据、合同、技术规格、论文)
    → 拿自己的真实文件去试。判断依据有三条:“表格会不会乱”、“分栏能否按阅读顺序读下来”、“扫描质量差的页面能不能扛住”。与其看产品页标称的OCR精度,不如把手头最脏的那一页丢进去,答案来得更快
  • ③ 视频转录与摘要(会议、讲座、YouTube)
    → 按你要处理的视频时长分岔。10分钟左右差别不大。要整段丢进1小时量级的素材,§4的①抽帧密度和②上下文长度就会起作用,此时应确认长视频基准与窗口大小
  • ④ 语音对话/口译/面试练习
    → 先确认是不是原生处理。即便写着“支持语音”,走转录路线也会带来延迟和抑扬顿挫的丢失。验证方法很简单:试试在对方说话途中插话
  • ⑤ 成本优先/批量处理
    → 不只看单价,还要看批处理折扣,以及自建部署是否现实。若要选开放权重模型,请把许可证的商用条款读在性能之前
关于组合的思路:与其压在一款上,不如采用一款主力+一款补短板的双轨配置,稳定性更好。签两个20美元/月档的方案也就40美元,和单独上一档高价方案差不太多。像视频这种使用频率低的用途,每次临时借用Google AI Studio之类的免费额度就够了。这套分配思路本身,模型再迭代几代也不会变。

7. 硬性局限——可以用,但不能盲信

多模态AI很强,但三条局限若忽视,就会反咬一口。

局限①:别把照片的“猜测”当事实

问“OCR这张收据上的金额”听起来简单,但如果图像分辨率低、光线暗或拍歪了,AI会编出像模像样的数字。即便是在MMMU-Pro上超过80%的模型,也有近五分之一的回答是错的。金额、日期、专有名词——一定要由人复核。法律、金融、医疗场景尤甚。

局限②:视频中段的准确率会下降

即便是视频基准领先的模型,从1小时视频的中段检索信息依然困难——这与上下文窗口问题中的“Lost in the Middle”是同一回事。对关键片段请指定时间戳:“请专门分析30:00–35:00这一段”会得到好得多的结果。

局限③:音频在方言与术语面前吃力

标准英语/日语的语音识别很准,但地方方言、专业词汇、多人对谈、嘈杂环境都会让错误率上升。会议记录等高风险用途,请配合专门工具(Otter.ai、Notta等),或先清理音频再送入AI。

总结

回顾要点:

  • 2026年:GPT-5.5与Gemini 3.1 Pro在MMMU-Pro上超过80%(各公司公布值,数值与出处见§1)。多模态AI已从“有更好”变成了“必须有”
  • 构建方式正在从串联独立模型的拼接式,转向由一个模型直接接收多种输入的原生式。但能在一个模型中处理全部四种的只有Gemini、Qwen的Omni系列等少数模型;OpenAI的旗舰模型和Claude的API只到图像(截至2026年9月)
  • 决定强弱的是四条轴:视频=抽帧密度与上下文长度 / 语音=原生处理还是经转录 / 文档=能否返回坐标 / 开放权重=是否全模态与许可证。名次会换,这几条轴不会
  • 基准:MMMU-Pro / Video-MMMU / DocVQA / AudioBench——在选型前请同时核对这四个轴
  • 按用例的选法,“拿自己的真实素材去试”是最快的路径。PDF尤其如此——丢手头最脏的那一页,比看标称值快得多。组合上以一款主力+一款补短板最稳
  • 三条局限:低质量图像的猜测 / 视频中段的准确率下降 / 方言与术语的音频。关键输出务必复核

2026年,只靠“文本”就能完成的AI工作正在迅速减少。手机拍的照片、会议录音、YouTube视频、PDF——把它们交给AI处理已成常态(一个模型能否全部接收,因模型而异)。会不会用多模态,已不再是“方便的功能”,而是“2026年AI素养的底线”。今天就从把一张手机照片发给AI开始吧。

常见问题

Q1. 多模态AI可以免费试用吗?

可以。ChatGPT免费版(可输入图像)、Google AI Studio(免费层,含视频)、Claude.ai免费版(可上传图像)都能体验。需要注意的是,在Google AI Studio和Gemini API的免费层级中,提交的内容会被用于改进Google的产品,也可能由人工审核员阅读(Gemini API条款),因此不要上传敏感的图像和音频。但免费版分配的模型会随每一代更替,与其记模型名,不如在各服务的界面上确认它能输入哪些内容(图像、音频、视频)以及每天能用多少。语音对话和长视频的额度等部分功能,在付费层会放宽。详见免费AI工具指南。

Q2. 图像生成AI与多模态AI有什么区别?

是不同的概念。Midjourney和Stable Diffusion等工具专长于从文本生成图像——是单向的文本→图像流。多模态AI指的是把图像(及其他模态)作为输入来理解。ChatGPT、Gemini等服务两者兼能,但理解与生成是不同的能力,擅长其一不代表也擅长另一项,选择时应按用途分别试用。详见图像生成AI工具对比。

Q3. 如何通过API发送视频?

Gemini API(ai.google.dev的开发者API)可以直接输入视频。较长或需要反复使用的视频,推荐用Files API上传后传入文件引用;小视频可以直接嵌入请求。也可以传入公开的YouTube链接,或把Cloud Storage中的文件注册到Files API(Google开发者文档)。通过Google Cloud的Vertex AI使用时,在fileData中指定Cloud Storage的gs:// URI(Google Cloud文档)。截至2026年9月26日,OpenAI和Claude的API都不直接接受视频(OpenAI在GPT-6 Astra的模型页上将Video标为“Not supported”;Anthropic写明当前所有模型支持文本和图像输入)。两者的做法都是从视频中抽取帧,作为图像发送,OpenAI的官方Cookbook里有示例。详见AI API入门指南。

Q4. 隐私安全吗?

图像、音频与视频常含敏感数据。是否用于训练,面向个人的应用与API、企业版之间并不相同。个人版中,ChatGPT可能会用你的对话训练模型,在设置中关闭“Improve the model for everyone”即可停止(OpenAI帮助中心)。Claude(Free、Pro、Max)在用户允许时才会用聊天内容训练(Anthropic隐私中心)。Gemini应用在“Keep Activity”开启期间,会把对话(包括经人工审核)用于改进Google的服务,关闭即可停止(Gemini应用隐私中心)。相对地,OpenAI的API与ChatGPT Business/Enterprise、Anthropic的API与企业版、Gemini API的付费层级,默认都不用于训练(Anthropic面向企业的说明、Gemini API条款)。例外是:Gemini API的免费层级和Google AI Studio,输入内容会被用于改进Google的产品。涉及人脸、医学影像、内部文档时,请选用付费API或企业版。如果要彻底保密,可以在自己的设备上运行开放权重模型(Qwen的全模态模型中,可用的是上一代Qwen3-Omni;最新的Qwen3.5-Omni仅通过API提供,截至2026年9月未公开权重)。

Q5. 多模态比纯文本更贵吗?

图像与视频按token换算计费。一张图像≈几百到约1000 token(取决于分辨率与模型);视频方面,Gemini API在默认设置下每秒约计100 token,高分辨率下约300 token(Google开发者文档,2026年9月确认)。按默认设置,1小时为100×3600秒≈36万token。AI Token成本节省中的方法(只发送摘录、启用缓存)同样适用于视频。