В апреле 2026 года на мультимодальном бенчмарке MMMU-Pro (междисциплинарное понимание изображений, диаграмм и схем) GPT-5.5, Claude Opus 4.7, Gemini 3 и Qwen 3.5 Omni разом вышли на 81–83 %. Цифра впечатляющая, если вспомнить, что GPT-4V в 2023 году впервые добрался здесь до 56 %, — но фронтир уже насыщен. Эпоха «только текстового» AI действительно закончилась.

Дело не только в баллах. Архитектура целиком мигрировала от «сшитой» к «нативно-единой». До 2024 года господствовала схема «обучаем текстовую модель, энкодер изображений и энкодер аудио отдельно, а затем прикручиваем их на выходе». Флагманы 2026 года превращают текст, изображения, аудио и кадры видео в один и тот же поток токенов и рассуждают о них в едином мозге. Благодаря этому такие задачи, как «соотнести аудио и видеоряд, чтобы понять смысл сцены» или «перекрёстно интерпретировать схемы и основной текст в PDF», ощущаются естественно.

Сразу обозначу позицию: мультимодальность перешла из «приятного дополнения» в «без него никуда». Сфотографировать экран с ошибкой и тут же получить решение, сделать скриншот PDF и вытащить ключевые тезисы, расшифровать и резюмировать YouTube-видео — это базовая беглость работы с AI в 2026 году. В статье разобраны определение, разница между сшитой и нативной мультимодальностью, чем технически определяется сила модели в каждой модальности, по каким критериям выбирать под конкретный сценарий, бенчмарки и ограничения. Опорой служат не позиции в рейтинге, а способ принимать решение, — поэтому текст не устареет со сменой поколения моделей.

МУЛЬТИМОДАЛЬНЫЙ AI · 2026

Четыре входа обрабатывает один мозг

— Текст, изображения, аудио и видео как единый общий поток токенов

ТЕКСТ
Текст
Проза, код, символы
ИЗОБРАЖЕНИЕ
Изображение
Фото, графики, скриншоты
АУДИО
Аудио
Речь, музыка, фоновые звуки
ВИДЕО
Видео
Время + картинка + звук

Апрель 2026: GPT-5.5, Claude Opus 4.7, Gemini 3 — все на 81–83 % в MMMU-Pro.
Эпоха «изображение как бонус» закончилась; новая норма — рассуждение по четырём модальностям в одном мозге.

1. В 2026 году AI перестал быть «только текстом» — MMMU-Pro преодолел 80 %

Тренд «мультимодальность» поднялся в 2024 году, но модели тогда воспринимали изображения как нечто второстепенное: топовые результаты MMMU (междисциплинарное мультимодальное понимание) колебались около 56 %. Медиана человека (82 %) оставалась недосягаемой для вопросов с изображениями, требующих экспертных знаний.

В 2026 году картина совсем иная. Свежие результаты MMMU-Pro (более жёсткой обновлённой версии бенчмарка) на апрель 2026:

  • GPT-5.5: 83,4 %
  • Claude Opus 4.7: 82,1 %
  • Gemini 3.1 Pro: 81,7 %
  • Qwen 3.5 Omni: 81,0 %

«Переход за 80 % означает, что бенчмарк насыщается» — это реальность 2026 года. Точка дифференциации сместилась в понимание видео (Video-MMMU), документы с плотным OCR и совместное аудиовизуальное рассуждение — на более сложную территорию. Публичный лидерборд на MMMU benchmark позволяет сравнить модели самостоятельно.

2. Что такое мультимодальный AI? — Четыре входа, один мозг

Определение: «AI-модель, обрабатывающая входы шире, чем просто текст, — изображения, аудио, видео и т. д.» В лексиконе 2026 года «мультимодальный» чаще всего означает модели, которые интегрируют текст, изображение, аудио и видео — четыре модальности — в едином конвейере.

Прежний AI был одномодальным: GPT-3 работал с текстом, Whisper — только с распознаванием речи, Stable Diffusion — только text-to-image. Чтобы соединить их, требовался конвейер, в котором выход одной модели подавался во вход другой, и на каждом стыке часть информации терялась.

Мультимодальный AI меняет правила: «одна модель одновременно понимает все входы». Составная задача вроде «прочти этот скриншот ошибки (изображение) вместе с моим вопросом (текст), а затем объясни причину голосом (аудио)» закрывается одним вызовом API.

Терминология: LMM (Large Multimodal Model) — большая модель с мультимодальными способностями. VLM (Vision-Language Model) — только текст + изображение. Omnimodal — модели следующего поколения, объединяющие 4 и более модальностей. За одной и той же надписью «поддерживает мультимодальность» скрываются разные вещи: omnimodal или VLM (то есть максимум текст + изображение). Если в планах есть аудио или видео, смотреть надо не на количество «◎» в таблице совместимости, а именно на эту границу: у моделей на базе VLM аудио и видео чаще всего поддержаны ограниченно.

3. «Сшитая» vs «нативная» — архитектурный водораздел

Понимание того, «как это устроено внутри», сразу проясняет сильные стороны каждой модели. Между 2024 и 2026 годами произошёл смена поколений в архитектуре.

Поколения архитектур

Сшитая (~2024) vs нативная (2025+)

① Сшитая (~2024)
  • Текстовая модель + энкодер изображений
  • Слой-адаптер соединяет их на выходе
  • Аудио и видео — на отдельных конвейерах
  • Потери информации на стыках
  • Например, GPT-4V, Claude 3 Vision
VS
② Нативная (2025+)
  • Все модальности → единый поток токенов
  • Одновременно обрабатываются одним Transformer
  • Аудио + кадры видео связаны на одном шаге
  • Минимум потерь, более глубокое рассуждение
  • Например, GPT-5.5, Gemini 3, Qwen Omni

В нативной архитектуре естественны такие задачи, как «совместно интерпретировать аудио и видеоряд» / «перекрёстно рассуждать о схемах и тексте PDF».
Сшитой требовались промежуточные шаги — например, «сначала вытащить текст из изображения» в качестве реле.

Конкретный пример: «посмотреть кулинарное видео на YouTube и достать рецепт». Сшитая: аудио → Whisper в текст → GPT для резюме; видео → извлечение кадров → отдельный анализ изображений. Много шагов. Нативная: один вызов API принимает видеофайл целиком и возвращает рецепт напрямую. Корреляция между речевыми пояснениями и видимыми действиями ощущается на принципиально ином уровне естественности.

4. Чем определяется сила в каждой модальности

Ответ на вопрос «какая модель лучше» меняется от поколения к поколению: и лидер по видео, и качество голосового опыта пересматривались каждые полгода. Поэтому запоминать надо не порядок мест, а то, чем технически определяется сила в каждой модальности. С этим знанием вы сами оцените любую новую модель, как только она выйдет.

🎬 Что решает в понимании видео

Плотность выборки кадров (раз в сколько секунд берётся кадр). ② Контекст, способный удержать длинную запись. ③ Причинно-следственный вывод по времени. Час видео даже при 1 fps — это 3600 кадров, в токенах счёт идёт на сотни тысяч. Возможности по видео и длина контекста связаны напрямую: у «сильных по видео» моделей окно без исключений большое.

🎙 Что решает в голосовом диалоге

Задержка полного цикла. ② Полный дуплекс (можно ли перебить собеседника, пока он говорит). ③ Сохранение просодии и эмоций. Именно здесь разница между сшитой и нативной архитектурой из §3 проявляется резче всего: схема «сначала расшифровать речь в текст, потом обработать» принципиально не может избавиться ни от задержки, ни от потери информации.

📄 Что решает в разборе документов и UI

Точность OCR. ② Сохранение вёрстки (не рассыпаются ли таблицы, колонки, сноски). ③ Умение возвращать координаты. Третий пункт упускают из виду, но для агентов, управляющих интерфейсом, он решающий: если модель отвечает «кнопка есть», но не отвечает «где именно», нажать по ней невозможно.

🔓 Что решает у открытых моделей

Настоящая omnimodal-модель или набор отдельных моделей на каждую модальность. ② Доступность весов и лицензия. Слово «открытая» в названии ещё не значит, что коммерческое применение свободно, — условия в лицензии встречаются часто. Если планируете хостить у себя, читайте лицензию раньше, чем результаты бенчмарков.

Ниже — измерения по состоянию на май 2026 года. Порядок мест меняется, поэтому текущее сравнение сверяйте по разбору GPT-5.6 Sol и Gemini или по модельным картам вендоров. Здесь же таблицу стоит читать как пример того, как четыре оси выше превращаются в реальную разницу.

МодельТекстИзобр.АудиоВидеоСильная сторона
GPT-5.5Обрабатывает все 4 модальности на высоком уровне; двусторонний Voice Mode
Gemini 3.1 Pro◎◎Лидер по видео — 78,4 %; сильна на длинных видео
Claude Opus 4.7Разбор UI и документов; сильна для агентных задач
Qwen 3.5 OmniОткрытые веса, omnimodal, хорошее соотношение цена/качество
DeepSeek V4-ProТекст + изображение, очень дешёвая

Из таблицы видно, что четыре оси работают независимо друг от друга (все цифры — по состоянию на май 2026 года):

  • Разрыв по видео открывается на длине: в Video-MME получились 78,4 %, 71,2 % и 67,8 %, но на коротких клипах такого расхождения не будет. Разница проявляется на записях часового масштаба, где узким местом становятся ① плотность кадров и ② длина контекста. Если вы работаете только с короткими роликами, этот рейтинг к вам не относится
  • Голос определяется архитектурой: отклик менее 200 мс и считывание эмоций сочетаются только там, где речь обрабатывается нативно, без промежуточного текста. В каталоге может стоять ряд «◎» напротив аудио, но при работе через расшифровку опыт получится совсем другим
  • Разбор документов делится по координатам: PDF и UI-скриншоты ценятся в агентных связках вроде Cursor не столько из-за точности как таковой, сколько из-за умения вернуть позицию элемента
  • У открытых моделей ценность зависит от того, omnimodal ли это: одна модель на все модальности эксплуатируется несравнимо проще, чем связка из отдельных моделей под каждую. При этом качество, близкое к коммерческому фронтиру, выходит кратно дешевле

5. Важные бенчмарки — MMMU / Video-MMMU / OCR / Audio

Не зная, что именно измеряет каждый бенчмарк, легко выбрать не ту модель. Четыре бенчмарка, которые нужно знать в 2026 году:

Бенчмарки × 4

Чем измеряем мультимодальный AI

① MMMU-Pro
Междисциплинарное понимание по изображениям, схемам и графикам. Фронтир насыщен на 81–83 %. Как разделитель уже слаб.
② Video-MMMU
300 экспертных видео + 900 вопросов и ответов. Лидер — Gemini 3 с 78,4 %; настоящая мера понимания длинного видео.
③ DocVQA / OCRBench
Документы + текст внутри изображений. Claude Opus 4.7 силён; полезен для разбора UI, счетов, форм.
④ AudioBench
Совместное понимание и генерация аудио. GPT-5.5 Voice — высокий результат по низкой задержке и передаче эмоций (измерения на май 2026 года).

«Высокий MMMU = хорош во всём» — неверно.
Для видео смотри Video-MMMU, для документов — DocVQA, для аудио — AudioBench, иначе ошибёшься с выбором.

6. По сценариям — по каким критериям выбирать

Пять распространённых паттернов, и для каждого — что проверить, прежде чем решать. Конкретных названий моделей здесь нет: этот раздел устарел бы за полгода. Вместо них — порядок действий, который сработает с любой моделью, какая бы ни вышла следующей.

  • ① Q&A и диагностика по фото со смартфона (фото блюда → калорийность, экран с ошибкой → исправление, фото товара → поиск)
    Подойдёт практически любая. Попробуйте две на бесплатных тарифах и оставьте ту, чья манера отвечать вам ближе. Разброс между моделями здесь минимален, и тратить время на выбор смысла мало
  • ② Разбор PDF и документов (чеки, договоры, технические спецификации, научные статьи)
    Проверяйте на собственных файлах. Критериев три: не рассыпаются ли таблицы, читается ли многоколоночная вёрстка в правильном порядке, выдерживает ли модель страницы с плохим качеством скана. Вместо заявленной точности OCR быстрее всё покажет самый грязный лист из ваших собственных
  • ③ Расшифровка и резюме видео (совещания, лекции, YouTube)
    Развилка проходит по длине ваших записей. На десяти минутах разница невелика. Если же вы отправляете часовые файлы целиком, вступают в силу ① плотность кадров и ② длина контекста из §4, — значит, смотрите бенчмарки на длинном видео и размер окна
  • ④ Голосовой диалог / синхронный переводчик / тренировка интервью
    Сначала выясните, нативная ли обработка речи. Даже при заявленной «поддержке аудио» работа через расшифровку даст задержку и потерю интонаций. Проверка простая: попробуйте перебить собеседника, пока он говорит
  • ⑤ Приоритет — стоимость / массовая обработка
    Смотрите не только на цену за токен, но и на batch-скидку и на то, реально ли хостить модель у себя. Если берёте открытую, раньше характеристик читайте коммерческие условия лицензии
Как думать о комбинации: устойчивее не сводить всё к одной модели, а держать основную плюс вторую, закрывающую её слабые места. Две подписки уровня $20/мес — это $40, то есть примерно столько же, сколько один старший тариф. Редкие задачи вроде видео можно каждый раз отдавать в бесплатные лимиты, например в Google AI Studio. Сама эта логика распределения не меняется, сколько бы поколений моделей ни сменилось.

7. Жёсткие ограничения — пользуйся, но не доверяй слепо

Мультимодальный AI силён, но три ограничения сильно ударят, если их игнорировать.

Ограничение ①: не воспринимай «догадки» по фото как факты

Вопрос «распознай сумму на этом чеке через OCR» звучит просто, но если изображение низкого разрешения, тёмное или перекошенное, AI выдумывает правдоподобные цифры. Даже 83 % на MMMU означают 17 % ошибок. Суммы, даты, имена собственные — всегда перепроверяйте человеком. Особенно в юриспруденции, финансах и медицине.

Ограничение ②: в середине видео точность падает

Даже у лидера по видео, Gemini 3, извлечение информации из середины часового видео даётся тяжело — та же проблема «Lost in the Middle», что и у контекстного окна. Для важных фрагментов указывайте таймкоды: «проанализируй именно отрезок 30:00–35:00» — результат заметно лучше.

Ограничение ③: с диалектами и жаргоном аудио буксует

Стандартная английская и японская речь распознаётся точно, но региональные диалекты, узкоспециальная лексика, наложение голосов нескольких говорящих и шумные условия резко увеличивают ошибки. Для протоколов совещаний и других ответственных задач сочетайте AI со специализированными инструментами (Otter.ai, Notta и т. д.) или предварительно чистите аудио, прежде чем отправлять модели.

Итог

Кратко:

  • Апрель 2026: GPT-5.5, Claude Opus 4.7, Gemini 3 — все на 81–83 % в MMMU-Pro. Мультимодальный AI прошёл путь от «приятного дополнения» к «обязательной части набора»
  • Архитектура: сшитая (~2024) → нативная omnimodal (2025+). Все модальности идут через единый поток токенов
  • Силу определяют четыре оси: видео — плотность кадров и длина контекста / аудио — нативная обработка или через расшифровку / документы — умение вернуть координаты / открытые модели — omnimodal ли это и какая лицензия. Порядок мест меняется, а оси остаются
  • Бенчмарки: MMMU-Pro / Video-MMMU / DocVQA / AudioBench — перед выбором сверяй все четыре оси
  • Выбор под сценарий быстрее всего делается проверкой на собственных материалах: для PDF отправьте самый грязный лист, какой у вас есть, — это точнее каталожных цифр. Устойчивая связка — основная модель плюс вторая под её слабые места
  • Три ограничения: догадки по низкокачественным изображениям / падение точности в середине видео / диалекты и жаргон в аудио. Критичные выводы перепроверяйте

В 2026 году работа с AI, которая укладывается «только в текст», стремительно сжимается. Фото со смартфона, записи совещаний, YouTube-видео, PDF — теперь всё это проходит через один и тот же AI. Уметь обращаться с мультимодальностью — уже не «удобная опция», а базовый уровень AI-грамотности 2026 года. Начните с того, чтобы скормить AI сегодня одну фотографию со смартфона — этого достаточно, чтобы стартовать.

FAQ

Q1. Можно ли попробовать мультимодальный AI бесплатно?

Да. Бесплатный ChatGPT (GPT-5 mini, приём изображений), Google AI Studio (Gemini 2.5 Flash, с видео, бесплатный тариф), Claude.ai на бесплатном тарифе (Sonnet, изображения поддерживаются) — везде можно попробовать. Voice Mode и длинное видео требуют платных тарифов. См. Гид по бесплатным AI-инструментам.

Q2. Чем AI для генерации изображений отличается от мультимодального AI?

Это разные понятия. Такие инструменты, как Midjourney и Stable Diffusion, специализируются на генерации изображений из текста — однонаправленный поток text → image. Мультимодальный AI означает понимание изображений (и других модальностей) как входов. GPT-5.5 и Gemini 3 умеют и то, и другое. См. Сравнение AI для генерации изображений.

Q3. Как передать видео через API?

Gemini API принимает видеофайлы напрямую через поле fileData (с использованием Google Cloud Storage). У OpenAI типовой паттерн — извлечь кадры и отправить их как последовательность изображений. API Claude по состоянию на май 2026 года не принимает видео нативно — нужны кадры. См. Гид по AI API для новичков.

Q4. А что с приватностью?

В изображениях, аудио и видео часто содержатся чувствительные данные. OpenAI, Anthropic и Google по умолчанию исключают ваши входы из обучения, но для корпоративного использования выбирайте Enterprise-тарифы или доступ через API (по умолчанию обучение отключено). Лица, медицинские снимки, внутренние документы — будьте особенно осторожны. Для полной конфиденциальности рассмотрите локальные LLM (открытые веса Qwen 3.5 Omni и др.).

Q5. Дороже ли мультимодальность, чем работа только с текстом?

Изображения и видео тарифицируются через перевод в токены. Одно изображение ≈ несколько сотен — порядка 1000 токенов (зависит от разрешения и модели); видео — секунды × десятки или сотни токенов. Часовое видео может «съесть» сотни тысяч токенов. Приёмы экономии из статьи об экономии токенов AI (отправка только нужных фрагментов, кеширование) работают и для видео.