Qu'est-ce que l'IA multimodale ? — L'architecture unifiée texte/image/audio/vidéo et les critères de choix
En avril 2026, le benchmark multimodal MMMU-Pro a atteint 81–83 % pour GPT-5.5, Claude Opus 4.7, Gemini 3.1 Pro et Qwen 3.5 Omni — la compréhension d'images a effectivement saturé. L'architecture a migré de l'assemblée (encodeurs séparés + adaptateur) à l'omnimodale native (toutes les modalités comme un flux de tokens partagé). Cet article couvre ce qu'est l'IA multimodale (LMM/VLM/Omnimodal), la fracture architecturale et son importance, ce qui détermine techniquement la force dans chaque modalité (vidéo, audio, documents/UI, modèles ouverts) ainsi qu'un instantané comparatif de mai 2026, les quatre benchmarks à surveiller (MMMU-Pro, Video-MMMU, DocVQA, AudioBench), cinq cas d'usage et le critère de décision pour chacun, et les trois limites dures (conjectures sur images de mauvaise qualité, précision au milieu de la vidéo, audio dialectal/jargon) — ancré dans la recherche actuelle et l'usage pratique.