Что такое мультимодальный AI? — Единая архитектура текст/изображение/аудио/видео и критерии выбора
В апреле 2026 года мультимодальный бенчмарк MMMU-Pro достиг 81–83 % у GPT-5.5, Claude Opus 4.7, Gemini 3.1 Pro и Qwen 3.5 Omni — понимание изображений фактически насыщено. Архитектура мигрировала от «сшитой» (отдельные энкодеры + адаптер) к нативной omnimodal (все модальности как общий поток токенов). В статье разобрано, что такое мультимодальный AI (LMM/VLM/Omnimodal), архитектурный водораздел и его значение, что технически определяет силу в каждой модальности (видео, аудио, документы/UI, открытые модели) плюс сравнительный срез на май 2026 года, четыре ключевых бенчмарка (MMMU-Pro, Video-MMMU, DocVQA, AudioBench), пять сценариев и критерий выбора для каждого, а также три жёстких ограничения (догадки по низкокачественным изображениям, точность в середине видео, диалекты и жаргон в аудио) — на основе актуальных исследований и практики.