Содержание
- 1. В 2026 году AI перестал быть «только текстом» — MMMU-Pro преодолел 80 %
- 2. Что такое мультимодальный AI? — AI, который понимает не только текст
- 3. «Сшитая» vs «нативная» — архитектурный водораздел
- 4. Чем определяется сила в каждой модальности
- 5. Важные бенчмарки — MMMU / Video-MMMU / OCR / Audio
- 6. По сценариям — по каким критериям выбирать
- 7. Жёсткие ограничения — пользуйся, но не доверяй слепо
- Итог
- FAQ
На мультимодальном бенчмарке MMMU-Pro (междисциплинарное понимание изображений, диаграмм и схем) лучшие модели уже перешагнули 80 %. OpenAI в апреле 2026 года опубликовала для GPT-5.5 81,2 % (без инструментов), Google в феврале — 80,5 % для Gemini 3.1 Pro. Когда в конце 2023 года вышел исходный MMMU, GPT-4V набрал около 56 %. MMMU-Pro — усложнённая версия MMMU (опубликована в сентябре 2024 года), так что это не одна и та же линейка, но модели уже берут 80 % на более трудной. Эпоха «только текстового» AI действительно закончилась.
Изменились не только оценки. Сам способ устройства моделей смещается от «сшитого» к «нативному». Раньше нормой было соединять отдельные модели в цепочку: одна расшифровывает речь, другая рассуждает над текстом, третья зачитывает ответ (OpenAI описывает голосовой режим ChatGPT до GPT-4o именно как такую цепочку из трёх моделей). Сейчас распространились решения, где одна модель напрямую принимает несколько типов ввода, а Gemini и линейка Qwen Omni обрабатывают все четыре — текст, изображения, аудио и видео — в одной модели. Но так поступили не все: на сентябрь 2026 года флагманская модель OpenAI и API Claude принимают на вход только текст и изображения, а звук у OpenAI обрабатывают отдельные голосовые модели вроде gpt-realtime (см. таблицу в §4).
Сразу обозначу позицию: мультимодальность перешла из «приятного дополнения» в «без него никуда». Сфотографировать экран с ошибкой и тут же получить решение, сделать скриншот PDF и вытащить ключевые тезисы, расшифровать и резюмировать YouTube-видео — это базовая беглость работы с AI в 2026 году. В статье разобраны определение, разница между сшитой и нативной мультимодальностью, чем технически определяется сила модели в каждой модальности, по каким критериям выбирать под конкретный сценарий, бенчмарки и ограничения. Опорой служат не позиции в рейтинге, а способ принимать решение, — поэтому текст не устареет со сменой поколения моделей.
AI для текста, изображений, аудио и видео
— сколько из этого берёт одна модель, зависит от модели
В MMMU-Pro лучшие модели уже вышли на уровень 80 % (данные компаний и источники — в §1).
Эпоха «картинки как бонуса» закончилась. Но все четыре типа в одной модели принимают лишь некоторые — например, Gemini и линейка Qwen Omni; флагманская модель OpenAI и API Claude ограничиваются изображениями (на сентябрь 2026 года).
1. В 2026 году AI перестал быть «только текстом» — MMMU-Pro преодолел 80 %
Тренд «мультимодальность» поднялся в 2024 году, но модели незадолго до этого воспринимали изображения как нечто второстепенное: когда в конце 2023 года вышел MMMU (междисциплинарное мультимодальное понимание), даже лучший — GPT-4V — набирал около 56 %. Медианный эксперт-человек (82,6 %) оставался далеко впереди на вопросах с изображениями, требующих экспертных знаний.
В 2026 году картина совсем иная. Опубликованные результаты MMMU-Pro (усложнённой версии MMMU):
- GPT-5.5: 81,2 % (без инструментов), 83,2 % (с инструментами) — анонс OpenAI, апрель 2026
- Gemini 3.1 Pro: 80,5 % (без инструментов) — документ с оценками Google DeepMind, февраль 2026
- Qwen3.5-Omni-Plus: 73,9 % — технический отчёт команды Qwen, апрель 2026
- Для сравнения: эксперты-люди (медиана) — 80,8 %, официальная таблица MMMU
«Переход за 80 % означает, что бенчмарк насыщается» — это реальность 2026 года. Точка дифференциации сместилась в понимание видео (Video-MMMU), документы с плотным OCR и совместное аудиовизуальное рассуждение — на более сложную территорию. Публичный лидерборд на MMMU benchmark позволяет сравнить модели самостоятельно.
2. Что такое мультимодальный AI? — AI, который понимает не только текст
Определение: «AI-модель, которая принимает не только текст, но и другие данные (изображения, аудио, видео и т. д.)». Насколько широко — зависит от модели: от текста с изображениями до аудио и видео в одной модели (см. блок с терминами ниже).
Прежний AI был одномодальным: GPT-3 работал с текстом, Whisper — только с распознаванием речи, Stable Diffusion — только text-to-image. Чтобы соединить их, требовался конвейер, в котором выход одной модели подавался во вход другой, и на каждом стыке часть информации терялась.
В мультимодальном AI одна модель смотрит сразу на несколько входов и отвечает. Например: «Посмотри на сообщение об ошибке на этом скриншоте (изображение) вместе с моим вопросом (текст) и назови причину» — это решается одним вызовом API.
3. «Сшитая» vs «нативная» — архитектурный водораздел
Если понять разницу в устройстве, сильные стороны моделей читаются легче. В общих чертах есть два способа их построить.
Сшитая vs нативная
- Расшифровка, рассуждение и озвучка — в отдельных моделях
- Модели передают друг другу текст
- Интонация, несколько говорящих и фоновые звуки теряются по дороге
- Каждый лишний этап добавляет задержку
- Пример: голосовой режим ChatGPT до GPT-4o (три модели в цепочке)
- Одна модель напрямую принимает несколько входов
- От входа до выхода — в одной сети
- Модель напрямую видит интонацию и связь картинки со звуком
- Мало потерь информации на передачах
- Пример: GPT-4o (май 2024), Gemini от Google, линейка Qwen Omni
Нативная модель может «понимать звук и картинку видео вместе» внутри одной модели.
В сшитой схеме появляется промежуточное звено — например, сначала перевести речь в текст, — и там теряется информация.
Конкретный пример: «посмотри кулинарное видео на YouTube и выпиши рецепт». Сшитая схема: аудио → Whisper в текст → GPT для пересказа; видео → вытащить кадры → анализировать отдельно. Много шагов. Нативная модель, которая принимает видео напрямую (например, Gemini), берёт весь видеофайл и возвращает рецепт за один вызов API, сопоставляя устное объяснение с тем, что видно в кадре, внутри самой модели.
4. Чем определяется сила в каждой модальности
Ответ на вопрос «какая модель лучше» меняется от поколения к поколению: и лидер по видео, и качество голосового опыта пересматривались каждые полгода. Поэтому запоминать надо не порядок мест, а то, чем технически определяется сила в каждой модальности. С этим знанием вы сами оцените любую новую модель, как только она выйдет.
① Плотность выборки кадров (раз в сколько секунд берётся кадр). ② Контекст, способный удержать длинную запись. ③ Причинно-следственный вывод по времени. Час видео даже при 1 fps — это 3600 кадров, в токенах счёт идёт на сотни тысяч. Возможности по видео и длина контекста связаны напрямую: у «сильных по видео» моделей окно без исключений большое.
① Задержка полного цикла. ② Полный дуплекс (можно ли перебить собеседника, пока он говорит). ③ Сохранение просодии и эмоций. Именно здесь разница между сшитой и нативной архитектурой из §3 проявляется резче всего: схема «сначала расшифровать речь в текст, потом обработать» принципиально не может избавиться ни от задержки, ни от потери информации.
① Точность OCR. ② Сохранение вёрстки (не рассыпаются ли таблицы, колонки, сноски). ③ Умение возвращать координаты. Третий пункт упускают из виду, но для агентов, управляющих интерфейсом, он решающий: если модель отвечает «кнопка есть», но не отвечает «где именно», нажать по ней невозможно.
① Настоящая omnimodal-модель или набор отдельных моделей на каждую модальность. ② Доступность весов и лицензия. Слово «открытая» в названии ещё не значит, что коммерческое применение свободно, — условия в лицензии встречаются часто. Если планируете хостить у себя, читайте лицензию раньше, чем результаты бенчмарков.
Таблица ниже — наша ориентировочная оценка на май 2026 года по тому, что каждая компания публиковала о поддерживаемых типах ввода, а не результаты бенчмарков. Порядок мест меняется, поэтому какие модели доступны сейчас, смотрите в списке актуальных моделей, а прямое сравнение — в разборе GPT-5.6 Sol и Gemini или в модельных картах вендоров. Здесь же таблицу стоит читать как пример того, как четыре оси выше превращаются в реальную разницу.
| Модель | Текст | Изобр. | Аудио | Видео | Сильная сторона |
|---|---|---|---|---|---|
| GPT-5.5 | ◎ | ◎ | × | × | Читает текст и изображения; API не принимает аудио и видео на вход |
| Gemini 3.1 Pro | ◎ | ◎ | ◎ | ◎◎ | Сильна в понимании видео, в том числе длинного |
| Claude Opus 4.7 | ◎ | ◎ | × | × | Разбор UI и документов; сильна для агентных задач |
| Qwen3.5-Omni | ◎ | ◎ | ◎ | ◎ | Omnimodal: одна модель принимает все четыре типа ввода. Доступна через API (веса на сентябрь 2026 года не опубликованы) |
| DeepSeek V4-Pro | ◎ | × | × | × | Только текст, дешёвая (ввод изображений появился в линейке Flash с августа 2026 года) |
× — API не принимает такой ввод (функции приложений, которые идут через отдельную модель или расшифровку, например голосовой чат, не учитываются). Поддержка проверена по первоисточникам: страница модели GPT-5.5 у OpenAI, страница модели Gemini 3.1 Pro у Google, страница модели Claude Opus 4.7 у Anthropic, технический отчёт Qwen3.5-Omni, журнал изменений API DeepSeek (проверено в сентябре 2026 года).
Из таблицы видно, что четыре оси работают независимо друг от друга:
- Разрыв по видео открывается на длине: Video-MME оценивает ролики от 11 секунд до часа в трёх группах — короткие, средние и длинные, и все модели в его официальной таблице проседают на длинных. На длинных записях узким местом становятся ① плотность кадров и ② длина контекста. Если вы работаете только с короткими роликами, рейтинг по длинному видео к вам не относится
- Голос определяется архитектурой: быстрый отклик и считывание эмоций гораздо легче совместить там, где речь обрабатывается нативно, без промежуточного текста (расшифровка добавляет собственную задержку и стирает интонацию). В каталоге может стоять ряд «◎» напротив аудио, но при работе через расшифровку опыт получится совсем другим
- Разбор документов делится по координатам: PDF и UI-скриншоты ценятся в агентных связках вроде Cursor не столько из-за точности как таковой, сколько из-за умения вернуть позицию элемента
- У открытых моделей ценность зависит от того, omnimodal ли это: одна модель на все модальности эксплуатируется несравнимо проще, чем связка из отдельных моделей под каждую. При этом качество, близкое к коммерческому фронтиру, выходит кратно дешевле
5. Важные бенчмарки — MMMU / Video-MMMU / OCR / Audio
Не зная, что именно измеряет каждый бенчмарк, легко выбрать не ту модель. Четыре бенчмарка, которые нужно знать в 2026 году:
Чем измеряем мультимодальный AI
«Высокий MMMU = хорош во всём» — неверно.
Для видео смотри Video-MMMU, для документов — DocVQA, для аудио — AudioBench, иначе ошибёшься с выбором.
6. По сценариям — по каким критериям выбирать
Пять распространённых паттернов, и для каждого — что проверить, прежде чем решать. Конкретных названий моделей здесь нет: этот раздел устарел бы за полгода. Вместо них — порядок действий, который сработает с любой моделью, какая бы ни вышла следующей.
- ① Q&A и диагностика по фото со смартфона (фото блюда → калорийность, экран с ошибкой → исправление, фото товара → поиск)
→ Подойдёт практически любая. Попробуйте две на бесплатных тарифах и оставьте ту, чья манера отвечать вам ближе. Разброс между моделями здесь минимален, и тратить время на выбор смысла мало - ② Разбор PDF и документов (чеки, договоры, технические спецификации, научные статьи)
→ Проверяйте на собственных файлах. Критериев три: не рассыпаются ли таблицы, читается ли многоколоночная вёрстка в правильном порядке, выдерживает ли модель страницы с плохим качеством скана. Вместо заявленной точности OCR быстрее всё покажет самый грязный лист из ваших собственных - ③ Расшифровка и резюме видео (совещания, лекции, YouTube)
→ Развилка проходит по длине ваших записей. На десяти минутах разница невелика. Если же вы отправляете часовые файлы целиком, вступают в силу ① плотность кадров и ② длина контекста из §4, — значит, смотрите бенчмарки на длинном видео и размер окна - ④ Голосовой диалог / синхронный переводчик / тренировка интервью
→ Сначала выясните, нативная ли обработка речи. Даже при заявленной «поддержке аудио» работа через расшифровку даст задержку и потерю интонаций. Проверка простая: попробуйте перебить собеседника, пока он говорит - ⑤ Приоритет — стоимость / массовая обработка
→ Смотрите не только на цену за токен, но и на batch-скидку и на то, реально ли хостить модель у себя. Если берёте открытую, раньше характеристик читайте коммерческие условия лицензии
7. Жёсткие ограничения — пользуйся, но не доверяй слепо
Мультимодальный AI силён, но три ограничения сильно ударят, если их игнорировать.
Ограничение ①: не воспринимай «догадки» по фото как факты
Вопрос «распознай сумму на этом чеке через OCR» звучит просто, но если изображение низкого разрешения, тёмное или перекошенное, AI выдумывает правдоподобные цифры. Даже модель с результатом выше 80 % в MMMU-Pro ошибается почти в каждом пятом ответе. Суммы, даты, имена собственные — всегда перепроверяйте человеком. Особенно в юриспруденции, финансах и медицине.
Ограничение ②: в середине видео точность падает
Даже у лидера видеобенчмарков извлечение информации из середины часового видео даётся тяжело — та же проблема «Lost in the Middle», что и у контекстного окна. Для важных фрагментов указывайте таймкоды: «проанализируй именно отрезок 30:00–35:00» — результат заметно лучше.
Ограничение ③: с диалектами и жаргоном аудио буксует
Стандартная английская и японская речь распознаётся точно, но региональные диалекты, узкоспециальная лексика, наложение голосов нескольких говорящих и шумные условия резко увеличивают ошибки. Для протоколов совещаний и других ответственных задач сочетайте AI со специализированными инструментами (Otter.ai, Notta и т. д.) или предварительно чистите аудио, прежде чем отправлять модели.
Итог
Кратко:
- 2026: GPT-5.5 и Gemini 3.1 Pro перешагнули 80 % в MMMU-Pro (данные компаний; значения и источники — в §1). Мультимодальный AI прошёл путь от «приятного дополнения» к «обязательной части набора»
- Архитектура смещается от цепочек отдельных моделей (сшитая схема) к нативным моделям, которые принимают несколько входов напрямую. Но все четыре типа в одной модели принимают лишь Gemini, линейка Qwen Omni и немногие другие; флагманская модель OpenAI и API Claude ограничиваются изображениями (на сентябрь 2026 года)
- Силу определяют четыре оси: видео — плотность кадров и длина контекста / аудио — нативная обработка или через расшифровку / документы — умение вернуть координаты / открытые модели — omnimodal ли это и какая лицензия. Порядок мест меняется, а оси остаются
- Бенчмарки: MMMU-Pro / Video-MMMU / DocVQA / AudioBench — перед выбором сверяй все четыре оси
- Выбор под сценарий быстрее всего делается проверкой на собственных материалах: для PDF отправьте самый грязный лист, какой у вас есть, — это точнее каталожных цифр. Устойчивая связка — основная модель плюс вторая под её слабые места
- Три ограничения: догадки по низкокачественным изображениям / падение точности в середине видео / диалекты и жаргон в аудио. Критичные выводы перепроверяйте
В 2026 году работы с AI, которую можно закончить «одним текстом», становится всё меньше. Фото с телефона, записи встреч, видео с YouTube, PDF — отдавать их AI стало обычным делом (примет ли их все одна модель, зависит от модели). Умение пользоваться мультимодальностью — уже не «полезная функция», а базовый уровень AI-грамотности 2026 года. Начните сегодня с того, что отправите AI одно фото с телефона, — этого достаточно для старта.
FAQ
Да. Бесплатный тариф ChatGPT (приём изображений), Google AI Studio (бесплатный тариф, с видео) и бесплатный тариф Claude.ai (изображения поддерживаются) — везде можно попробовать. Учтите: в Google AI Studio и на бесплатном уровне Gemini API всё, что вы отправляете, используется для улучшения продуктов Google и может читаться людьми-проверяющими (условия Gemini API), поэтому не загружайте туда конфиденциальные изображения и аудио. Но модели, доступные на бесплатных тарифах, меняются с каждым поколением, поэтому вместо того чтобы запоминать названия, проверяйте в интерфейсе каждого сервиса, какие входы он принимает (изображение, аудио, видео) и сколько можно использовать в день. Часть возможностей — например, лимиты голосового общения и длинного видео — расширяется на платных тарифах. См. Гид по бесплатным AI-инструментам.
Это разные понятия. Такие инструменты, как Midjourney и Stable Diffusion, специализируются на генерации изображений из текста — однонаправленный поток text → image. Мультимодальный AI означает понимание изображений (и других модальностей) как входов. Некоторые сервисы, например ChatGPT и Gemini, умеют и то, и другое, но понимание и генерация — разные способности: сила в одной не гарантирует силы в другой, поэтому проверяйте их по отдельности под свою задачу. См. Сравнение AI для генерации изображений.
Gemini API (API для разработчиков на ai.google.dev) принимает видео как есть. Длинные или многократно используемые ролики рекомендуется загрузить через Files API и передать ссылку на файл; небольшие можно встроить прямо в запрос. Можно также передать публичную ссылку на YouTube или зарегистрировать файлы из Cloud Storage в Files API (документация Google для разработчиков). Через Vertex AI в Google Cloud в fileData указывают URI Cloud Storage вида gs:// (документация Google Cloud). API OpenAI и Claude на 26 сентября 2026 года видео напрямую не принимают (на странице модели GPT-6 Astra видео отмечено как «Not supported»; у Anthropic все текущие модели принимают на вход текст и изображения). В обоих случаях порядок такой: извлечь кадры из видео и отправить их как изображения — пример есть в официальном Cookbook OpenAI. См. Гид по AI API для новичков.
В изображениях, аудио и видео часто содержатся чувствительные данные. Использование для обучения различается у потребительских приложений и у API или бизнес-тарифов. В потребительских приложениях ChatGPT может использовать ваши разговоры для обучения; это можно остановить, отключив в настройках «Improve the model for everyone» (справка OpenAI). Claude (Free, Pro, Max) использует ваши чаты для обучения, если вы это разрешили (Privacy Center Anthropic). Приложения Gemini, пока включён «Keep Activity», используют ваши чаты — в том числе через проверку людьми — для улучшения сервисов Google, а отключение это прекращает (центр конфиденциальности приложений Gemini). Напротив, API OpenAI и ChatGPT Business/Enterprise, API и бизнес-тарифы Anthropic, а также платный уровень Gemini API по умолчанию для обучения не используются (пояснение Anthropic для бизнеса, условия Gemini API). Исключение: на бесплатном уровне Gemini API и в Google AI Studio ваши данные используются для улучшения продуктов Google. Для лиц, медицинских снимков и внутренних документов выбирайте платный API или бизнес-тариф. Для полной конфиденциальности запускайте на своём оборудовании модель с открытыми весами (среди моделей Qwen со всеми модальностями это предыдущее поколение, Qwen3-Omni; новейшая Qwen3.5-Omni доступна только через API, её веса на сентябрь 2026 года не опубликованы).
Изображения и видео тарифицируются через перевод в токены. Одно изображение ≈ несколько сотен — порядка 1000 токенов (зависит от разрешения и модели); для видео Gemini API считает около 100 токенов в секунду при стандартной настройке и около 300 при высоком разрешении (документация Google для разработчиков, проверено в сентябре 2026 года). Час видео при стандартной настройке — это 100 × 3600 с ≈ 360 000 токенов. Приёмы экономии из статьи об экономии токенов AI (отправка только нужных фрагментов, кеширование) работают и для видео.