目次
マルチモーダルAI のベンチマーク MMMU-Pro(画像・図表・グラフを含む多分野の理解力テスト)で、上位モデルが80%台に並んだ。2026年4月に OpenAI が公表した GPT-5.5 は 81.2%(ツールなし)、Google が2月に公表した Gemini 3.1 Pro は 80.5%。前身の MMMU が公開された2023年末、GPT-4V の正答率は 約56% だった。MMMU-Pro はその MMMU を難しくした改良版(2024年9月公開)なので同じ物差しではないが、より難しい版のほうで8割を超えたことになる。テキストだけ読む AI の時代は、本当に終わった。
変わったのはスコアだけではない。作り方も「接ぎ木」から「ネイティブ」へ移ってきた。以前は、音声を文字に起こすモデル・文章を考えるモデル・読み上げるモデルを別々に用意して繋ぐのが普通だった(OpenAI は GPT-4o 以前の ChatGPT の音声会話をこの3段構成だったと説明している)。いまは1つのモデルが複数の入力をそのまま受け取る設計が広がり、Gemini や Qwen の Omni 系はテキスト・画像・音声・動画の4つを1モデルで扱う。ただし全社がそうなったわけではない。2026年9月時点で、OpenAI の旗艦モデルと Claude の API が受け付ける入力はテキストと画像までで、OpenAI の音声は gpt-realtime などの音声用モデルが受け持つ(§4の表)。
私の率直な評価を先に書く: マルチモーダルは「あれば便利」から「ないと話にならない」段階に入った。スマホで撮ったエラー画面を AI に見せて即解決、PDF をスクショして要点抽出、YouTube 動画の内容を文字起こし+要約——これらは2026年の AI 活用の最低ラインになっている。本記事ではマルチモーダル AI の定義、接ぎ木型とネイティブ型の違い、モダリティ別の強さが技術的に何で決まるか、用途別に何を基準に選ぶか、ベンチマーク、落とし穴までを整理する。特定のモデルの順位ではなく判断の仕方を軸にしたので、世代が変わっても使える。
テキスト・画像・音声・動画を扱う AI
— どこまでを1つのモデルで扱えるかは、モデルによって違う
MMMU-Pro では上位モデルが80%台に届いた(各社の公表値と出典は§1)。
「画像も読めるおまけ」の時代は終わった。ただし4つすべてを1つのモデルで扱えるのは Gemini や Qwen の Omni 系などで、OpenAI の旗艦モデルと Claude の API は画像まで(2026年9月時点)。
1. 2026年、AIは「テキスト読むだけ」では無くなった——MMMU-Pro 80%突破
「マルチモーダル」という言葉は2024年頃から急に流行り出した。だがその直前のモデルは 画像を「おまけ」として読むレベルで、2023年末に MMMU(多分野マルチモーダル理解ベンチ)が公開されたとき、最高の GPT-4V でも正答率は 56% 前後だった。専門知識を要する画像問題で、人間の専門家の中位(82.6%)には遠く及ばなかった。
2026年は様変わりした。MMMU-Pro(MMMU を難しくした改良版)の公表値:
- GPT-5.5: 81.2%(ツールなし)、83.2%(ツールあり)——OpenAI の発表、2026年4月
- Gemini 3.1 Pro: 80.5%(ツールなし)——Google DeepMind の評価資料、2026年2月
- Qwen3.5-Omni-Plus: 73.9%——Qwen チームの技術報告、2026年4月
- 参考: 人間の専門家(中位)80.8%——MMMU の公式ボード
「80% を超えたあたりでベンチマークが飽和し始めた」のが2026年。差別化軸は 動画理解(Video-MMMU)、OCR が必要な濃密ドキュメント、音声と映像の同時推論のような、より難しい領域に移った。MMMU benchmark の公式ボードで誰でも比較確認できる。
2. マルチモーダルAIとは——テキスト以外の入力も扱うAI
定義: 「テキスト以外の入力(画像・音声・動画など)も扱える AI モデル」。どこまで扱えるかはモデルによって違い、テキスト+画像までのものから、音声・動画まで1つのモデルで扱うものまである(下の用語整理)。
従来の AI は 1モダリティ専用だった: GPT-3 はテキストのみ、Whisper は音声→テキスト変換のみ、Stable Diffusion はテキスト→画像のみ。これらを組み合わせる場合、各モデルの出力を別モデルの入力にする「パイプライン」を組む必要があり、途中で情報が落ちる。
マルチモーダルAI では、1つのモデルが複数の入力を同時に見て答える。例えば「このスクリーンショットのエラーメッセージ(画像)と、私の質問(テキスト)を同時に見て、原因を教えて」が、1度の API 呼び出しで済む。
3. 接ぎ木型 vs ネイティブ型——アーキテクチャの決定的な違い
マルチモーダルの「仕組みの違い」を理解すると、各モデルの強みが見えやすくなる。作り方は大きく2つの型に分かれる。
接ぎ木型 vs ネイティブ型
- 書き起こし・推論・読み上げを別々のモデルで行う
- モデルの間はテキストで受け渡す
- 声の調子・複数の話者・背景音が途中で落ちる
- 段数のぶん応答が遅い
- 例: GPT-4o 以前の ChatGPT の音声会話(3つのモデルを連結)
- 複数の入力を1つのモデルが直接受け取る
- 入力から出力まで同じネットワークで処理
- 声の調子や、映像と音の対応をモデルが直接見られる
- 中継ぎによる情報の欠落が少ない
- 例: GPT-4o(2024年5月)、Google の Gemini、Qwen の Omni 系
ネイティブ型なら 「動画の音声と映像を同時に解釈」が1つのモデルの中で済む。
接ぎ木型では、音声をいったん文字に起こすような中継ぎが入り、そこで情報が落ちる。
具体例で違いを示すと: 「YouTube の料理動画を見て、レシピをまとめて」というタスク。接ぎ木型なら「音声→Whisper でテキスト化→GPT で要約」「映像→フレームを抜き出して別途解析」と多段になる。ネイティブ型で動画を直接受け付けるモデル(Gemini など)なら、1回の API 呼び出しで「動画ファイル全体を入力 → 直接レシピを出力」ができ、音声の説明と映像の動作の対応もモデルの中で取れる。
4. モダリティ別の強さは何で決まるか
「どのモデルが一番か」は世代ごとに入れ替わる。動画の首位も音声の体験も、半年で順位が変わってきた。だから覚えるべきは順位そのものではなく、各モダリティの強さが技術的に何で決まっているかだ。これを押さえておけば、新しいモデルが出たときに自分で判断できる。
①フレームのサンプリング密度(何秒に1枚見るか)②長時間を保持できるコンテキスト ③時系列の因果推論。1時間の動画は1fpsでも3,600枚で、トークン換算では数十万規模になる。動画性能とコンテキスト長は連動する——だから「動画が強いモデル」は例外なく窓が大きい。
①往復レイテンシ ②全二重かどうか(相手が話している最中に割り込めるか)③韻律・感情の保持。ここが§3の接ぎ木型/ネイティブ型の差が最も出る領域で、音声を一度テキストに書き起こしてから処理する構成は、原理的に遅延と情報欠落が避けられない。
①OCR精度 ②レイアウトの保持(表・段組・脚注が崩れないか)③座標を返せるか。③は見落とされがちだが、画面を操作させるエージェント用途では決定的だ。「ボタンがある」だけでなく「どこにあるか」を答えられないと、クリックできない。
①omnimodal か、モダリティ別の寄せ集めか ②重みの入手性とライセンス。「オープン」と名乗っていても、商用利用に条件が付くライセンスは珍しくない。自前で動かす前提なら、性能より先にここを読む。
以下の表は2026年5月時点で各社が公開していた対応状況をもとにした筆者の目安で、ベンチマークの測定値ではない。順位は変わるので、いま選べるモデルとその世代は現行モデルの一覧で、実際の比較はGPT-5.6 Sol vs Gemini の比較記事や各社のモデルカードで確認してほしい。ここでは「上の4つの軸が実際にどう差として現れるか」の実例として読むとよい。
| モデル | テキスト | 画像 | 音声 | 動画 | 強み |
|---|---|---|---|---|---|
| GPT-5.5 | ◎ | ◎ | × | × | テキスト+画像の読解。API は音声・動画の入力に非対応 |
| Gemini 3.1 Pro | ◎ | ◎ | ◎ | ◎◎ | 動画理解に強く、長時間ビデオも扱える |
| Claude Opus 4.7 | ◎ | ◎ | × | × | UI/ドキュメント解析、エージェント用途で強い |
| Qwen3.5-Omni | ◎ | ◎ | ◎ | ◎ | 1モデルで4つの入力を扱う omnimodal。API で提供(2026年9月時点で重みは未公開) |
| DeepSeek V4-Pro | ◎ | × | × | × | テキスト専用で安価(画像入力は2026年8月以降の Flash 系から) |
×=その API が入力として受け付けない(アプリの音声会話など、別のモデルや書き起こしを通す機能は含めない)。入力の可否は各社の一次情報で確認した:OpenAI の GPT-5.5 のモデルページ、Google の Gemini 3.1 Pro のモデルページ、Anthropic の Claude Opus 4.7 のモデルページ、Qwen3.5-Omni の技術報告、DeepSeek の API 更新履歴(2026年9月確認)。
この表から読み取れるのは、4つの軸がそれぞれ別々に効いているということだ:
- 動画の差は「長さ」で開く: Video-MME は11秒〜1時間の動画を短・中・長の3区分に分けて採点するが、公式ボードに載るモデルはどれも長尺の区分で点が下がる。長尺で落ちるのは、上の①フレーム密度と②コンテキスト長がボトルネックになるからだ。短い動画しか扱わないなら、長尺での順位はあなたには関係ない
- 音声は「アーキテクチャ」で決まる: 応答の速さと感情の読み取りを両立しやすいのは、音声をテキストに落とさずネイティブに扱っている場合だ(書き起こしを挟むと、その分の待ちと抑揚の欠落が避けられない)。カタログの対応表で「音声対応 ◎」が並んでいても、書き起こし経由なら体験は別物になる
- 文書解析は「座標」で分かれる: PDF や UI スクリーンショットの読み取りがCursor のようなエージェント用途で評価されるのは、精度そのものより位置を返せるかが効いているため
- オープン系は「omnimodal かどうか」で価値が変わる: 1モデルで全モダリティを扱えるものは、モダリティごとに別モデルを組み合わせる構成に比べて運用がはるかに軽い。商用フロンティアに近い品質のものが大幅に安価に出てきている
5. ベンチマークの実力——MMMU / Video-MMMU / OCR / 音声
「何のテストが意味あるのか」を理解しないとモデル選定で迷う。2026年に注目すべき4つのベンチマーク。
マルチモーダルAIを測る指標
「MMMU が高い = 万能」ではない。
動画は Video-MMMU、ドキュメント解析は DocVQA、音声は AudioBench を見ないと、選定を誤る。
6. ユースケース別——何を基準に選ぶか
用途ごとに「何を確認してから決めるか」を5パターンで示す。固有のモデル名は挙げない——このセクションは半年で古くなってしまうからだ。代わりに、どのモデルが出てきても同じ手順で判断できる形にした。
- ① スマホ画像からの質問・診断(料理写真→栄養、エラー画面→解決、商品写真→検索)
→ ほぼどれでも足りる。無料プランで2つ試して、返答の粒度が好みな方を選ぶ。この用途はモデル間の差がいちばん小さく、選定に時間をかける価値が薄い - ② PDF・ドキュメント解析(領収書、契約書、技術仕様書、論文)
→ 自分の実物で試す。判断材料は「表が崩れないか」「段組を読み順どおりに追えるか」「スキャン画質が悪いページで踏ん張れるか」の3点。カタログのOCR精度より、手元の一番汚い1枚を投げたほうが早く分かる - ③ 動画の文字起こし・要約(会議録、講義、YouTube)
→ 扱う動画の長さで分岐する。10分程度なら差は小さい。1時間級を丸ごと投げるなら、§4の①フレーム密度と②コンテキスト長が効くので、長尺の動画ベンチと窓のサイズを確認する - ④ 音声会話・通訳・面接練習
→ ネイティブ処理かどうかを先に確認する。「音声対応」と書いてあっても書き起こし経由なら遅延と抑揚の欠落が出る。判断は簡単で、相手が話している最中に割り込めるかを試せばいい - ⑤ コスト最優先・大量処理
→ 単価だけでなくバッチ割引と、自前運用が現実的かを見る。オープン系を選ぶなら、性能より先にライセンスの商用条件を読む
7. 落とし穴と限界——盲信せず使う
マルチモーダルAIは強力だが、3つの限界を知らずに使うと事故る。
限界①: 写真からの「推測」を「事実」と読まないこと
たとえば「このレシートを見て金額を OCR して」と指示しても、画像が低解像度・暗い・歪んでいる場合、AIは「もっともらしい数字を作る」。MMMU-Pro で8割を超えるモデルでも、2割近くは誤答だ。金額・日付・固有名詞は必ず人間が二重チェックする。法務・財務・医療では特に。
限界②: 動画は「長くなるほど」精度が落ちる
動画ベンチで首位のモデルでも、1時間動画の中盤情報を正確に取り出すのは難しい(Lost in the Middle 問題と同根)。重要場面は時刻を指定して「30:00〜35:00 の部分を集中分析して」と頼むほうが精度が出る。
限界③: 音声は方言・専門用語に弱い
標準的な英語・日本語の会話なら精度高いが、方言、専門用語、複数話者のクロストーク、騒音環境では誤認識が増える。会議録など重要シーンでは 専用ツール(Otter.ai、Notta 等)と併用、または音声を一度クリーンアップしてから AI に投げる工程を挟む。
まとめ
本記事のポイントを整理する。
- 2026年、GPT-5.5 と Gemini 3.1 Pro が MMMU-Pro で80%を超えた(各社の公表値。数値と出典は§1)。マルチモーダルAIは「あれば便利」から「ないと話にならない」段階へ
- 作り方は別々のモデルを繋ぐ接ぎ木型から、1つのモデルが複数の入力を直接受け取るネイティブ型へ移ってきた。ただし4つすべてを1モデルで扱うのは Gemini や Qwen の Omni 系などで、OpenAI の旗艦モデルと Claude の API は画像まで(2026年9月時点)
- 強さを決めるのは4つの軸: 動画=フレーム密度とコンテキスト長 / 音声=ネイティブ処理か書き起こし経由か / 文書=座標を返せるか / オープン系=omnimodal かとライセンス。順位は入れ替わるが、この軸は変わらない
- ベンチマークは MMMU-Pro / Video-MMMU / DocVQA / AudioBench の4軸で見る。MMMU だけ見ると選定ミスる
- 用途別の選び方は「自分の実物で試す」が最短。とくにPDFは手元の一番汚い1枚を投げるのがカタログ値より速い。組み合わせは主力1つ+不得意を埋める1つが安定する
- 3つの限界: 低品質画像からの推測 / 長時間動画の中盤精度 / 方言・専門用語の音声。重要場面は必ず二重チェック
2026年のAI 活用において、「テキストだけ」で完結する仕事は急速に少なくなっている。スマホで撮った写真、会議録音、YouTube 動画、PDF——これらをAI に渡して処理するのが当たり前になった(1つのモデルで全部を扱えるかは、モデルによって違う)。マルチモーダルを使いこなせるかは、もはや「便利な機能」ではなく「2026年のAIリテラシーの最低ライン」だ。今日からスマホの写真を 1枚 AI に投げてみる——そこから始めればいい。
FAQ
はい。ChatGPT の無料プラン(画像入力可)、Google AI Studio(動画も含めて無料枠あり)、Claude.ai の無料プラン(画像可)のどれでも試せる。なお、Google AI Studio と Gemini API の無料枠では、入力した内容が Google の製品改善に使われ、人が読むこともある(Gemini API 利用規約)。機微な画像・音声は入れないこと。ただし無料プランに割り当てられるモデルは世代交代のたびに入れ替わるので、モデル名で覚えるより「画像・音声・動画のどれを入力できるか」「1日にどれだけ使えるか」を各サービスの画面で確かめるほうが確実だ。音声会話や長時間動画の上限など、一部の機能は有料プランで広がる。詳しくは無料AIツールガイド。
用語が少し違う。Midjourney や Stable Diffusion のような画像「生成」専門ツールは「テキスト→画像」の1方向。マルチモーダルAIは「画像を理解する」側の能力を指す。ChatGPT や Gemini のように1つのサービスで両方をこなすものもあるが、理解と生成は別の能力なので、片方が得意でももう片方が得意とは限らない。選ぶときは用途に合わせて別々に試すこと。画像生成AI比較も参照。
Gemini API(ai.google.dev の開発者向け API)は動画をそのまま入力できる。長い動画や何度も使う動画は Files API でアップロードして、その参照を渡すのが推奨で、小さい動画はリクエストに直接埋め込める。公開 YouTube の URL や、Cloud Storage のファイルを Files API に登録して渡す方法もある(Google の開発者ドキュメント)。Google Cloud の Vertex AI 経由なら、fileData に Cloud Storage の gs:// URI を指定する(Google Cloud のドキュメント)。OpenAI と Claude の API は、2026年9月26日時点で動画を直接受け付けない(OpenAI は GPT-6 Astra のモデルページで Video が「Not supported」、Anthropic は現行の全モデルが「テキストと画像の入力」)。どちらも動画からフレームを切り出して画像として送るのが手順で、OpenAI は公式 Cookbookに例がある。詳しくは AI API入門。
画像・音声・動画は機微情報を含みやすい。学習への利用は個人向けのアプリと、API・法人向けで扱いが違う。個人向けでは、ChatGPT は会話を学習に使うことがあり、設定の「Improve the model for everyone」をオフにすれば止められる(OpenAI のヘルプ)。Claude(Free・Pro・Max)は、利用者が学習への利用を許可した場合に使う(Anthropic のプライバシーセンター)。Gemini アプリは「Keep Activity」がオンのあいだ、会話が人によるレビューを含めて Google のサービス改善に使われ、オフにすればそれを止められる(Gemini アプリのプライバシー ハブ)。一方、OpenAI の API と ChatGPT Business・Enterprise、Anthropic の API と法人向けプラン、Gemini API の有料枠は、既定で学習に使わない(Anthropic の法人向けの説明・Gemini API 利用規約)。ただしGemini API の無料枠と Google AI Studio は、入力が Google の製品改善に使われる。顔写真・医療画像・社内資料を扱うなら、有料の API か法人向けプランを選ぶこと。完全機密なら、重みが公開されたオープンモデルを手元で動かすのが選択肢(Qwen の全モダリティ対応なら旧世代の Qwen3-Omni。最新の Qwen3.5-Omni は API 提供で、2026年9月時点では重みが公開されていない)。
画像と動画は「トークン換算」で課金される。画像 1枚 ≒ 数百〜千トークン(解像度・モデル依存)、動画は Gemini API の場合、標準設定で1秒あたり約100トークン、高解像度で約300トークン(Google の開発者ドキュメント、2026年9月確認)。標準設定の1時間なら 100 × 3,600秒 ≒ 36万トークンになる。AIトークンコスト節約 の手法(要点だけ抽出、キャッシュ)は動画でも有効。