Содержание
- 1. В 2026 году AI перестал быть «только текстом» — MMMU-Pro преодолел 80 %
- 2. Что такое мультимодальный AI? — Четыре входа, один мозг
- 3. «Сшитая» vs «нативная» — архитектурный водораздел
- 4. Чем определяется сила в каждой модальности
- 5. Важные бенчмарки — MMMU / Video-MMMU / OCR / Audio
- 6. По сценариям — по каким критериям выбирать
- 7. Жёсткие ограничения — пользуйся, но не доверяй слепо
- Итог
- FAQ
В апреле 2026 года на мультимодальном бенчмарке MMMU-Pro (междисциплинарное понимание изображений, диаграмм и схем) GPT-5.5, Claude Opus 4.7, Gemini 3 и Qwen 3.5 Omni разом вышли на 81–83 %. Цифра впечатляющая, если вспомнить, что GPT-4V в 2023 году впервые добрался здесь до 56 %, — но фронтир уже насыщен. Эпоха «только текстового» AI действительно закончилась.
Дело не только в баллах. Архитектура целиком мигрировала от «сшитой» к «нативно-единой». До 2024 года господствовала схема «обучаем текстовую модель, энкодер изображений и энкодер аудио отдельно, а затем прикручиваем их на выходе». Флагманы 2026 года превращают текст, изображения, аудио и кадры видео в один и тот же поток токенов и рассуждают о них в едином мозге. Благодаря этому такие задачи, как «соотнести аудио и видеоряд, чтобы понять смысл сцены» или «перекрёстно интерпретировать схемы и основной текст в PDF», ощущаются естественно.
Сразу обозначу позицию: мультимодальность перешла из «приятного дополнения» в «без него никуда». Сфотографировать экран с ошибкой и тут же получить решение, сделать скриншот PDF и вытащить ключевые тезисы, расшифровать и резюмировать YouTube-видео — это базовая беглость работы с AI в 2026 году. В статье разобраны определение, разница между сшитой и нативной мультимодальностью, чем технически определяется сила модели в каждой модальности, по каким критериям выбирать под конкретный сценарий, бенчмарки и ограничения. Опорой служат не позиции в рейтинге, а способ принимать решение, — поэтому текст не устареет со сменой поколения моделей.
Четыре входа обрабатывает один мозг
— Текст, изображения, аудио и видео как единый общий поток токенов
Апрель 2026: GPT-5.5, Claude Opus 4.7, Gemini 3 — все на 81–83 % в MMMU-Pro.
Эпоха «изображение как бонус» закончилась; новая норма — рассуждение по четырём модальностям в одном мозге.
1. В 2026 году AI перестал быть «только текстом» — MMMU-Pro преодолел 80 %
Тренд «мультимодальность» поднялся в 2024 году, но модели тогда воспринимали изображения как нечто второстепенное: топовые результаты MMMU (междисциплинарное мультимодальное понимание) колебались около 56 %. Медиана человека (82 %) оставалась недосягаемой для вопросов с изображениями, требующих экспертных знаний.
В 2026 году картина совсем иная. Свежие результаты MMMU-Pro (более жёсткой обновлённой версии бенчмарка) на апрель 2026:
- GPT-5.5: 83,4 %
- Claude Opus 4.7: 82,1 %
- Gemini 3.1 Pro: 81,7 %
- Qwen 3.5 Omni: 81,0 %
«Переход за 80 % означает, что бенчмарк насыщается» — это реальность 2026 года. Точка дифференциации сместилась в понимание видео (Video-MMMU), документы с плотным OCR и совместное аудиовизуальное рассуждение — на более сложную территорию. Публичный лидерборд на MMMU benchmark позволяет сравнить модели самостоятельно.
2. Что такое мультимодальный AI? — Четыре входа, один мозг
Определение: «AI-модель, обрабатывающая входы шире, чем просто текст, — изображения, аудио, видео и т. д.» В лексиконе 2026 года «мультимодальный» чаще всего означает модели, которые интегрируют текст, изображение, аудио и видео — четыре модальности — в едином конвейере.
Прежний AI был одномодальным: GPT-3 работал с текстом, Whisper — только с распознаванием речи, Stable Diffusion — только text-to-image. Чтобы соединить их, требовался конвейер, в котором выход одной модели подавался во вход другой, и на каждом стыке часть информации терялась.
Мультимодальный AI меняет правила: «одна модель одновременно понимает все входы». Составная задача вроде «прочти этот скриншот ошибки (изображение) вместе с моим вопросом (текст), а затем объясни причину голосом (аудио)» закрывается одним вызовом API.
3. «Сшитая» vs «нативная» — архитектурный водораздел
Понимание того, «как это устроено внутри», сразу проясняет сильные стороны каждой модели. Между 2024 и 2026 годами произошёл смена поколений в архитектуре.
Сшитая (~2024) vs нативная (2025+)
- Текстовая модель + энкодер изображений
- Слой-адаптер соединяет их на выходе
- Аудио и видео — на отдельных конвейерах
- Потери информации на стыках
- Например, GPT-4V, Claude 3 Vision
- Все модальности → единый поток токенов
- Одновременно обрабатываются одним Transformer
- Аудио + кадры видео связаны на одном шаге
- Минимум потерь, более глубокое рассуждение
- Например, GPT-5.5, Gemini 3, Qwen Omni
В нативной архитектуре естественны такие задачи, как «совместно интерпретировать аудио и видеоряд» / «перекрёстно рассуждать о схемах и тексте PDF».
Сшитой требовались промежуточные шаги — например, «сначала вытащить текст из изображения» в качестве реле.
Конкретный пример: «посмотреть кулинарное видео на YouTube и достать рецепт». Сшитая: аудио → Whisper в текст → GPT для резюме; видео → извлечение кадров → отдельный анализ изображений. Много шагов. Нативная: один вызов API принимает видеофайл целиком и возвращает рецепт напрямую. Корреляция между речевыми пояснениями и видимыми действиями ощущается на принципиально ином уровне естественности.
4. Чем определяется сила в каждой модальности
Ответ на вопрос «какая модель лучше» меняется от поколения к поколению: и лидер по видео, и качество голосового опыта пересматривались каждые полгода. Поэтому запоминать надо не порядок мест, а то, чем технически определяется сила в каждой модальности. С этим знанием вы сами оцените любую новую модель, как только она выйдет.
① Плотность выборки кадров (раз в сколько секунд берётся кадр). ② Контекст, способный удержать длинную запись. ③ Причинно-следственный вывод по времени. Час видео даже при 1 fps — это 3600 кадров, в токенах счёт идёт на сотни тысяч. Возможности по видео и длина контекста связаны напрямую: у «сильных по видео» моделей окно без исключений большое.
① Задержка полного цикла. ② Полный дуплекс (можно ли перебить собеседника, пока он говорит). ③ Сохранение просодии и эмоций. Именно здесь разница между сшитой и нативной архитектурой из §3 проявляется резче всего: схема «сначала расшифровать речь в текст, потом обработать» принципиально не может избавиться ни от задержки, ни от потери информации.
① Точность OCR. ② Сохранение вёрстки (не рассыпаются ли таблицы, колонки, сноски). ③ Умение возвращать координаты. Третий пункт упускают из виду, но для агентов, управляющих интерфейсом, он решающий: если модель отвечает «кнопка есть», но не отвечает «где именно», нажать по ней невозможно.
① Настоящая omnimodal-модель или набор отдельных моделей на каждую модальность. ② Доступность весов и лицензия. Слово «открытая» в названии ещё не значит, что коммерческое применение свободно, — условия в лицензии встречаются часто. Если планируете хостить у себя, читайте лицензию раньше, чем результаты бенчмарков.
Ниже — измерения по состоянию на май 2026 года. Порядок мест меняется, поэтому текущее сравнение сверяйте по разбору GPT-5.6 Sol и Gemini или по модельным картам вендоров. Здесь же таблицу стоит читать как пример того, как четыре оси выше превращаются в реальную разницу.
| Модель | Текст | Изобр. | Аудио | Видео | Сильная сторона |
|---|---|---|---|---|---|
| GPT-5.5 | ◎ | ◎ | ◎ | ◎ | Обрабатывает все 4 модальности на высоком уровне; двусторонний Voice Mode |
| Gemini 3.1 Pro | ◎ | ◎ | ◎ | ◎◎ | Лидер по видео — 78,4 %; сильна на длинных видео |
| Claude Opus 4.7 | ◎ | ◎ | △ | △ | Разбор UI и документов; сильна для агентных задач |
| Qwen 3.5 Omni | ◎ | ◎ | ◎ | ◎ | Открытые веса, omnimodal, хорошее соотношение цена/качество |
| DeepSeek V4-Pro | ◎ | ○ | △ | △ | Текст + изображение, очень дешёвая |
Из таблицы видно, что четыре оси работают независимо друг от друга (все цифры — по состоянию на май 2026 года):
- Разрыв по видео открывается на длине: в Video-MME получились 78,4 %, 71,2 % и 67,8 %, но на коротких клипах такого расхождения не будет. Разница проявляется на записях часового масштаба, где узким местом становятся ① плотность кадров и ② длина контекста. Если вы работаете только с короткими роликами, этот рейтинг к вам не относится
- Голос определяется архитектурой: отклик менее 200 мс и считывание эмоций сочетаются только там, где речь обрабатывается нативно, без промежуточного текста. В каталоге может стоять ряд «◎» напротив аудио, но при работе через расшифровку опыт получится совсем другим
- Разбор документов делится по координатам: PDF и UI-скриншоты ценятся в агентных связках вроде Cursor не столько из-за точности как таковой, сколько из-за умения вернуть позицию элемента
- У открытых моделей ценность зависит от того, omnimodal ли это: одна модель на все модальности эксплуатируется несравнимо проще, чем связка из отдельных моделей под каждую. При этом качество, близкое к коммерческому фронтиру, выходит кратно дешевле
5. Важные бенчмарки — MMMU / Video-MMMU / OCR / Audio
Не зная, что именно измеряет каждый бенчмарк, легко выбрать не ту модель. Четыре бенчмарка, которые нужно знать в 2026 году:
Чем измеряем мультимодальный AI
«Высокий MMMU = хорош во всём» — неверно.
Для видео смотри Video-MMMU, для документов — DocVQA, для аудио — AudioBench, иначе ошибёшься с выбором.
6. По сценариям — по каким критериям выбирать
Пять распространённых паттернов, и для каждого — что проверить, прежде чем решать. Конкретных названий моделей здесь нет: этот раздел устарел бы за полгода. Вместо них — порядок действий, который сработает с любой моделью, какая бы ни вышла следующей.
- ① Q&A и диагностика по фото со смартфона (фото блюда → калорийность, экран с ошибкой → исправление, фото товара → поиск)
→ Подойдёт практически любая. Попробуйте две на бесплатных тарифах и оставьте ту, чья манера отвечать вам ближе. Разброс между моделями здесь минимален, и тратить время на выбор смысла мало - ② Разбор PDF и документов (чеки, договоры, технические спецификации, научные статьи)
→ Проверяйте на собственных файлах. Критериев три: не рассыпаются ли таблицы, читается ли многоколоночная вёрстка в правильном порядке, выдерживает ли модель страницы с плохим качеством скана. Вместо заявленной точности OCR быстрее всё покажет самый грязный лист из ваших собственных - ③ Расшифровка и резюме видео (совещания, лекции, YouTube)
→ Развилка проходит по длине ваших записей. На десяти минутах разница невелика. Если же вы отправляете часовые файлы целиком, вступают в силу ① плотность кадров и ② длина контекста из §4, — значит, смотрите бенчмарки на длинном видео и размер окна - ④ Голосовой диалог / синхронный переводчик / тренировка интервью
→ Сначала выясните, нативная ли обработка речи. Даже при заявленной «поддержке аудио» работа через расшифровку даст задержку и потерю интонаций. Проверка простая: попробуйте перебить собеседника, пока он говорит - ⑤ Приоритет — стоимость / массовая обработка
→ Смотрите не только на цену за токен, но и на batch-скидку и на то, реально ли хостить модель у себя. Если берёте открытую, раньше характеристик читайте коммерческие условия лицензии
7. Жёсткие ограничения — пользуйся, но не доверяй слепо
Мультимодальный AI силён, но три ограничения сильно ударят, если их игнорировать.
Ограничение ①: не воспринимай «догадки» по фото как факты
Вопрос «распознай сумму на этом чеке через OCR» звучит просто, но если изображение низкого разрешения, тёмное или перекошенное, AI выдумывает правдоподобные цифры. Даже 83 % на MMMU означают 17 % ошибок. Суммы, даты, имена собственные — всегда перепроверяйте человеком. Особенно в юриспруденции, финансах и медицине.
Ограничение ②: в середине видео точность падает
Даже у лидера по видео, Gemini 3, извлечение информации из середины часового видео даётся тяжело — та же проблема «Lost in the Middle», что и у контекстного окна. Для важных фрагментов указывайте таймкоды: «проанализируй именно отрезок 30:00–35:00» — результат заметно лучше.
Ограничение ③: с диалектами и жаргоном аудио буксует
Стандартная английская и японская речь распознаётся точно, но региональные диалекты, узкоспециальная лексика, наложение голосов нескольких говорящих и шумные условия резко увеличивают ошибки. Для протоколов совещаний и других ответственных задач сочетайте AI со специализированными инструментами (Otter.ai, Notta и т. д.) или предварительно чистите аудио, прежде чем отправлять модели.
Итог
Кратко:
- Апрель 2026: GPT-5.5, Claude Opus 4.7, Gemini 3 — все на 81–83 % в MMMU-Pro. Мультимодальный AI прошёл путь от «приятного дополнения» к «обязательной части набора»
- Архитектура: сшитая (~2024) → нативная omnimodal (2025+). Все модальности идут через единый поток токенов
- Силу определяют четыре оси: видео — плотность кадров и длина контекста / аудио — нативная обработка или через расшифровку / документы — умение вернуть координаты / открытые модели — omnimodal ли это и какая лицензия. Порядок мест меняется, а оси остаются
- Бенчмарки: MMMU-Pro / Video-MMMU / DocVQA / AudioBench — перед выбором сверяй все четыре оси
- Выбор под сценарий быстрее всего делается проверкой на собственных материалах: для PDF отправьте самый грязный лист, какой у вас есть, — это точнее каталожных цифр. Устойчивая связка — основная модель плюс вторая под её слабые места
- Три ограничения: догадки по низкокачественным изображениям / падение точности в середине видео / диалекты и жаргон в аудио. Критичные выводы перепроверяйте
В 2026 году работа с AI, которая укладывается «только в текст», стремительно сжимается. Фото со смартфона, записи совещаний, YouTube-видео, PDF — теперь всё это проходит через один и тот же AI. Уметь обращаться с мультимодальностью — уже не «удобная опция», а базовый уровень AI-грамотности 2026 года. Начните с того, чтобы скормить AI сегодня одну фотографию со смартфона — этого достаточно, чтобы стартовать.
FAQ
Да. Бесплатный ChatGPT (GPT-5 mini, приём изображений), Google AI Studio (Gemini 2.5 Flash, с видео, бесплатный тариф), Claude.ai на бесплатном тарифе (Sonnet, изображения поддерживаются) — везде можно попробовать. Voice Mode и длинное видео требуют платных тарифов. См. Гид по бесплатным AI-инструментам.
Это разные понятия. Такие инструменты, как Midjourney и Stable Diffusion, специализируются на генерации изображений из текста — однонаправленный поток text → image. Мультимодальный AI означает понимание изображений (и других модальностей) как входов. GPT-5.5 и Gemini 3 умеют и то, и другое. См. Сравнение AI для генерации изображений.
Gemini API принимает видеофайлы напрямую через поле fileData (с использованием Google Cloud Storage). У OpenAI типовой паттерн — извлечь кадры и отправить их как последовательность изображений. API Claude по состоянию на май 2026 года не принимает видео нативно — нужны кадры. См. Гид по AI API для новичков.
В изображениях, аудио и видео часто содержатся чувствительные данные. OpenAI, Anthropic и Google по умолчанию исключают ваши входы из обучения, но для корпоративного использования выбирайте Enterprise-тарифы или доступ через API (по умолчанию обучение отключено). Лица, медицинские снимки, внутренние документы — будьте особенно осторожны. Для полной конфиденциальности рассмотрите локальные LLM (открытые веса Qwen 3.5 Omni и др.).
Изображения и видео тарифицируются через перевод в токены. Одно изображение ≈ несколько сотен — порядка 1000 токенов (зависит от разрешения и модели); видео — секунды × десятки или сотни токенов. Часовое видео может «съесть» сотни тысяч токенов. Приёмы экономии из статьи об экономии токенов AI (отправка только нужных фрагментов, кеширование) работают и для видео.