Sur le benchmark d'IA multimodale MMMU-Pro (compréhension pluridisciplinaire couvrant images, graphiques et figures), les meilleurs modèles dépassent désormais 80 %. OpenAI a publié en avril 2026 81,2 % pour GPT-5.5 (sans outils), et Google, en février, 80,5 % pour Gemini 3.1 Pro. Quand le MMMU d'origine est sorti fin 2023, GPT-4V obtenait environ 56 %. MMMU-Pro est une version plus difficile de MMMU (publiée en septembre 2024) : ce n'est donc pas la même mesure — et pourtant les modèles franchissent 80 % sur la plus exigente. L'ère de l'IA « texte uniquement » est véritablement révolue.

Les scores ne sont pas seuls à avoir changé. La façon de construire ces modèles glisse de « assemblé » vers « natif ». Avant, il était courant d'enchaîner des modèles distincts : un pour transcrire la voix, un pour raisonner sur le texte, un pour lire la réponse à voix haute (OpenAI décrit le mode vocal de ChatGPT d'avant GPT-4o comme exactement cette chaîne de trois modèles). Aujourd'hui, les conceptions où un seul modèle reçoit directement plusieurs types d'entrée se sont répandues, et Gemini comme la gamme Omni de Qwen traitent les quatre — texte, image, audio et vidéo — dans un seul modèle. Mais tous les éditeurs n'ont pas suivi : en septembre 2026, le modèle phare d'OpenAI et l'API de Claude n'acceptent en entrée que le texte et les images, et OpenAI confie l'audio à des modèles vocaux séparés comme gpt-realtime (voir le tableau du §4).

Je vais poser mon avis d'emblée : le multimodal est passé de « bon à avoir » à « ne pas l'avoir est rédhibitoire ». Photographier un écran d'erreur et faire résoudre le problème par l'IA sur le champ, capturer un PDF et en extraire les points clés, transcrire et résumer une vidéo YouTube — c'est désormais le socle de la maîtrise de l'IA en 2026. Cet article couvre la définition, la différence entre multimodal assemblé et natif, ce qui détermine techniquement la force d'un modèle dans chaque modalité, les critères à retenir selon le cas d'usage, les benchmarks et les limites. L'axe retenu n'est pas le classement d'un modèle mais la manière de décider — ce qui reste utilisable après un changement de génération.

IA MULTIMODALE · 2026

Une IA qui traite texte, image, audio et vidéo

— ce qu'un seul modèle peut prendre en charge dépend du modèle

TEXTE
Texte
Prose, code, symboles
IMAGE
Image
Photos, graphiques, captures
AUDIO
Audio
Parole, musique, ambiance
VIDÉO
Vidéo
Temps + visuel + audio

Sur MMMU-Pro, les meilleurs modèles atteignent désormais la barre des 80 % (chiffres des entreprises et sources au §1).
L'ère de « l'image en bonus » est finie. Mais seuls certains modèles — Gemini ou la gamme Omni de Qwen, par exemple — reçoivent les quatre dans un seul modèle ; le modèle phare d'OpenAI et l'API de Claude s'arrêtent à l'image (en septembre 2026).

1. En 2026, l'IA a cessé d'être « texte uniquement » — MMMU-Pro franchit 80 %

Le terme « multimodal » a commencé à émerger en 2024, mais les modèles juste avant ne pouvaient lire les images qu'en seconde intention : à la sortie de MMMU (compréhension multimodale pluridisciplinaire) fin 2023, même le meilleur, GPT-4V, plafonnait autour de 56 %. L'expert humain médian (82,6 %) restait loin devant sur les questions imagées requérant une expertise.

2026 est tout autre. Scores publiés sur MMMU-Pro (la version plus difficile de MMMU) :

« Franchir 80 % signifie que le benchmark sature » est la réalité 2026. La différenciation s'est déplacée vers la compréhension vidéo (Video-MMMU), les documents denses en OCR et le raisonnement audio-visuel conjoint — terrain plus ardu. Le classement public sur MMMU benchmark permet à chacun de comparer.

2. Qu'est-ce que l'IA multimodale ? — Une IA qui comprend plus que le texte

Définition : « un modèle d'IA capable de recevoir d'autres entrées que le texte (images, audio, vidéo, etc.) ». Jusqu'où cela va dépend du modèle : du texte plus des images jusqu'à l'audio et la vidéo dans un seul modèle (voir l'encadré de vocabulaire plus bas).

L'IA traditionnelle était monomodale : GPT-3 traitait le texte ; Whisper la reconnaissance vocale uniquement ; Stable Diffusion la génération texte-vers-image uniquement. Les combiner exigeait un pipeline où la sortie d'un modèle alimentait un autre, avec perte d'information à chaque transfert.

Avec l'IA multimodale, un seul modèle regarde plusieurs entrées à la fois et répond. Par exemple : « Regarde le message d'erreur de cette capture (image) avec ma question (texte) et donne-moi la cause » — réglé en un seul appel d'API.

Terminologie : LMM (Large Multimodal Model) = grand modèle doté de capacités multimodales. VLM (Vision-Language Model) = texte + image uniquement. Omnimodal = modèles de nouvelle génération unifiant 4+ modalités. Derrière une même mention « prend en charge le multimodal », omnimodal et VLM (texte + image au mieux) sont deux choses différentes. Si vous prévoyez de traiter de l'audio ou de la vidéo, mieux vaut vérifier cette distinction que compter les ◎ d'un tableau de compatibilité : les modèles basés VLM n'ont souvent qu'un support audio/vidéo limité.

3. Assemblé contre natif — La fracture architecturale

Comprendre la différence de mécanisme aide à lire les points forts de chaque modèle. Il existe en gros deux façons de les construire.

Comparaison des architectures

Assemblé contre Natif

① Assemblé
  • Transcription, raisonnement et voix sur des modèles séparés
  • Les modèles se passent le relais sous forme de texte
  • Le ton, les locuteurs multiples et le bruit de fond se perdent en route
  • Chaque étape en plus ajoute de la latence
  • ex. le mode vocal de ChatGPT avant GPT-4o (trois modèles enchaînés)
VS
② Natif
  • Un seul modèle reçoit directement plusieurs entrées
  • De l'entrée à la sortie dans le même réseau
  • Le modèle voit directement le ton et l'accord entre image et son
  • Peu d'information perdue dans les relais
  • ex. GPT-4o (mai 2024), Gemini de Google, la gamme Omni de Qwen

Le natif permet d'« interpréter ensemble l'audio et l'image d'une vidéo » au sein d'un seul modèle.
L'assemblé insère un relais — comme transcrire d'abord la voix en texte — et l'information s'y perd.

Exemple concret : « regarde une vidéo de cuisine sur YouTube et extrais la recette ». Assemblé : audio → Whisper en texte → GPT pour résumer ; vidéo → extraction de trames → analyse à part. Beaucoup d'étapes. Un modèle natif qui accepte directement la vidéo (Gemini, par exemple) prend le fichier vidéo entier et renvoie la recette en un seul appel d'API, en reliant l'explication orale à l'action visible au sein même du modèle.

4. Ce qui détermine la force dans chaque modalité

« Quel modèle est le meilleur » change à chaque génération : la tête du classement vidéo comme la qualité de l'expérience vocale se sont inversées en l'espace de six mois. Ce qu'il faut retenir n'est donc pas le classement lui-même, mais ce qui détermine techniquement la force dans chaque modalité. Avec ça en tête, vous jugerez par vous-même chaque nouveau modèle dès sa sortie.

🎬 Ce qui décide de la compréhension vidéo

① La densité d'échantillonnage des trames (une image toutes les combien de secondes). ② Un contexte capable de retenir une longue durée. ③ Le raisonnement causal dans le temps. Une heure de vidéo, même à 1 fps, fait 3 600 trames, soit plusieurs centaines de milliers de tokens. Capacité vidéo et longueur de contexte sont couplées : les modèles « forts en vidéo » ont sans exception une grande fenêtre.

🎙 Ce qui décide de la conversation vocale

① La latence aller-retour. ② Le full duplex (pouvoir couper l'interlocuteur pendant qu'il parle). ③ La conservation de la prosodie et de l'émotion. C'est ici que l'écart entre assemblé et natif du §3 se voit le plus : une architecture qui transcrit d'abord la voix en texte avant de la traiter ne peut structurellement échapper ni à la latence ni à la perte d'information.

📄 Ce qui décide de l'analyse de documents et d'UI

① La précision de l'OCR. ② La conservation de la mise en page (tableaux, colonnes, notes de bas de page qui ne se disloquent pas). ③ La capacité à renvoyer des coordonnées. Ce troisième point passe souvent inaperçu, mais il est décisif pour un agent qui pilote une interface : répondre « il y a un bouton » sans dire « où », c'est ne pas pouvoir cliquer.

🔓 Ce qui décide côté open-weight

① Vrai omnimodal, ou assemblage de modèles séparés par modalité. ② Disponibilité des poids et licence. Porter le nom d'« ouvert » ne veut pas dire usage commercial libre : les licences assorties de conditions sont fréquentes. Si vous comptez héberger vous-même, lisez la licence avant les benchmarks.

Le tableau ci-dessous est notre appréciation indicative de mai 2026, fondée sur ce que chaque éditeur avait publié sur les entrées prises en charge — il ne s'agit pas de mesures de benchmark. Le classement bouge : pour savoir quels modèles sont disponibles aujourd'hui, voyez la liste des modèles actuels, et pour la comparaison directe le comparatif GPT-5.6 Sol contre Gemini ou les fiches modèles des éditeurs. Ici, lisez plutôt le tableau comme un exemple de la façon dont les quatre axes ci-dessus se traduisent concrètement en écarts.

ModèleTexteImageAudioVidéoForce
GPT-5.5◎◎××Lit texte + images ; l'API n'accepte ni l'audio ni la vidéo en entrée
Gemini 3.1 Pro◎◎◎◎◎Fort en compréhension vidéo, y compris la vidéo longue
Claude Opus 4.7◎◎××Analyse UI/documents ; fort pour charges agentiques
Qwen3.5-Omni◎◎◎◎Omnimodal : un seul modèle reçoit les quatre entrées. Proposé via API (poids non publiés en septembre 2026)
DeepSeek V4-Pro◎×××Texte seul et bon marché (l'entrée d'images est arrivée avec la gamme Flash à partir d'août 2026)

× = l'API n'accepte pas cette entrée (les fonctions des applis qui passent par un autre modèle ou par une transcription, comme la conversation vocale, ne comptent pas). La prise en charge a été vérifiée dans les sources primaires : la page du modèle GPT-5.5 d'OpenAI, la page du modèle Gemini 3.1 Pro de Google, la page du modèle Claude Opus 4.7 d'Anthropic, le rapport technique de Qwen3.5-Omni, le journal des modifications de l'API DeepSeek (consultées en septembre 2026).

Ce que ce tableau montre, c'est que les quatre axes jouent indépendamment les uns des autres :

  • L'écart vidéo se creuse avec la durée : Video-MME note des vidéos de 11 secondes à une heure en trois tranches (courte, moyenne, longue), et tous les modèles de son classement officiel baissent sur la tranche longue. Sur les formats longs, ① la densité de trames et ② la longueur de contexte deviennent le goulot d'étranglement. Si vous ne traitez que des vidéos courtes, le classement en vidéo longue ne vous concerne pas
  • La voix se joue sur l'architecture : concilier réponse rapide et lecture de l'émotion est bien plus facile lorsque la parole est traitée nativement, sans passer par du texte (une transcription ajoute sa propre attente et efface l'intonation). Un tableau de compatibilité peut aligner les ◎ en face de l'audio : si le chemin passe par une transcription, l'expérience est tout autre
  • L'analyse documentaire se départage sur les coordonnées : si la lecture des PDF et des captures d'UI est appréciée dans les usages agentiques comme Cursor, ce n'est pas tant pour la précision en soi que pour la capacité à renvoyer la position
  • Côté open-weight, la valeur dépend du caractère omnimodal : un modèle unique couvrant toutes les modalités s'exploite bien plus légèrement qu'un assemblage d'un modèle par modalité. Et des options d'une qualité proche de la frontière commerciale sortent à un coût très inférieur

5. Les benchmarks qui comptent — MMMU / Video-MMMU / OCR / Audio

Vous choisirez le mauvais modèle si vous ignorez ce que chaque benchmark teste réellement. Quatre benchmarks à connaître en 2026 :

Benchmarks × 4

Ce que nous mesurons sur l'IA multimodale

① MMMU-Pro
Compréhension pluridisciplinaire à partir d'images + figures + graphiques. Les meilleurs modèles dépassent 80 %, au niveau de l'expert humain médian (80,8 %). Déjà faible comme facteur de différenciation.
② Video-MMMU
300 vidéos d'experts au format cours + 900 questions. Mesure si un modèle apprend d'une vidéo et réutilise ce savoir, en trois étapes : perception, compréhension, adaptation.
③ DocVQA / OCRBench
Document + texte intégré aux images. L'écart se joue sur la lecture intacte des tableaux, colonnes et coordonnées. Pour l'analyse d'UI, les factures et les formulaires, regardez ce score plutôt que MMMU.
④ AudioBench
Mesure à quel point les modèles audio (AudioLLM) comprennent ce qu'ils entendent : reconnaissance et traduction de la parole, sons ambiants, émotion et traits du locuteur (plus de 50 jeux de données dans le dépôt officiel). Il ne mesure ni la latence ni la génération de voix : vérifiez à part la rapidité de la conversation vocale.

« MMMU élevé = bon partout » est faux.
Pour la vidéo, regardez Video-MMMU ; pour les documents, DocVQA ; pour l'audio, AudioBench — sans cela la sélection rate sa cible.

6. Par cas d'usage — Sur quels critères choisir

Cinq schémas courants, et pour chacun ce qu'il faut vérifier avant de trancher. Aucun nom de modèle ici : cette section serait périmée en six mois. À la place, une marche à suivre applicable à n'importe quel modèle, quel que soit le prochain à sortir.

  • ① Q&R / diagnostic par photo de smartphone (photo de repas → nutrition, écran d'erreur → correction, photo produit → recherche)
    → À peu près n'importe lequel suffit. Testez-en deux en forfait gratuit et gardez celui dont la granularité de réponse vous parle. C'est l'usage où l'écart entre modèles est le plus faible ; y consacrer du temps de sélection n'a guère de valeur
  • ② Analyse de PDF / documents (reçus, contrats, spécifications techniques, articles)
    → Testez sur vos propres fichiers. Trois critères : les tableaux tiennent-ils, les colonnes se lisent-elles dans le bon ordre, le modèle encaisse-t-il une page mal scannée. Plus vite que la précision OCR annoncée, envoyez la page la plus sale que vous ayez
  • ③ Transcription et résumé vidéo (réunions, cours, YouTube)
    → Tout dépend de la durée de vos vidéos. Sur dix minutes, l'écart est faible. Si vous envoyez des formats d'une heure d'un bloc, ① la densité de trames et ② la longueur de contexte du §4 entrent en jeu : regardez alors les benchmarks sur vidéo longue et la taille de la fenêtre
  • ④ Conversation vocale / interprétariat / entraînement à l'entretien
    → Vérifiez d'abord si le traitement est natif. Même avec la mention « audio pris en charge », un passage par transcription produit de la latence et une perte d'intonation. Le test est simple : essayez de couper l'interlocuteur pendant qu'il parle
  • ⑤ Coût d'abord / traitement en masse
    → Regardez au-delà du prix unitaire : remise batch, et faisabilité réelle d'un hébergement maison. Si vous partez sur de l'open-weight, lisez les conditions commerciales de la licence avant les performances
Comment penser la combinaison : plutôt que de tout miser sur un seul, un modèle principal plus un second qui comble ses faiblesses tient mieux dans la durée. Deux abonnements à 20 $/mois font 40 $, à peu près le prix d'un unique forfait supérieur. Les usages peu fréquents comme la vidéo peuvent être renvoyés au coup par coup vers un quota gratuit, par exemple Google AI Studio. Cette logique de répartition, elle, ne change pas d'une génération de modèles à l'autre.

7. Limites strictes — Utiliser, ne pas faire confiance aveuglément

L'IA multimodale est puissante, mais trois limites vous mordront si vous les ignorez.

Limite ① : Ne pas lire les « conjectures » issues de photos comme des faits

Demander « OCR le montant sur ce reçu » paraît simple, mais si l'image est basse résolution, sombre ou inclinée, l'IA fabrique des chiffres plausibles. Même un modèle au-delà de 80 % sur MMMU-Pro se trompe encore sur près d'une réponse sur cinq. Montants, dates, noms propres — toujours faire vérifier par un humain. Surtout en juridique, finance, santé.

Limite ② : La précision vidéo chute au milieu

Même pour le modèle en tête des benchmarks vidéo, récupérer une information au milieu d'une vidéo d'une heure est difficile — le même problème « Lost in the Middle » que la fenêtre de contexte. Pour les segments clés, spécifiez les horodatages : « analyser spécifiquement le segment 30:00–35:00 » donne de bien meilleurs résultats.

Limite ③ : L'audio peine avec les dialectes et le jargon

L'anglais / japonais standard est précis, mais les dialectes régionaux, le vocabulaire spécialisé, les chevauchements multi-locuteurs et les environnements bruyants augmentent les erreurs. Pour les comptes-rendus de réunion et autres usages à fort enjeu, associez à des outils spécialisés (Otter.ai, Notta, etc.), ou nettoyez l'audio en amont avant de l'envoyer à l'IA.

Résumé

Récapitulatif :

  • 2026 : GPT-5.5 et Gemini 3.1 Pro ont dépassé 80 % sur MMMU-Pro (chiffres des entreprises ; valeurs et sources au §1). L'IA multimodale est passée de « bon à avoir » à « indispensable »
  • L'architecture glisse des chaînes de modèles séparés (assemblé) vers des modèles natifs qui reçoivent directement plusieurs entrées. Mais recevoir les quatre dans un seul modèle reste le fait de Gemini, de la gamme Omni de Qwen et de quelques autres ; le modèle phare d'OpenAI et l'API de Claude s'arrêtent à l'image (en septembre 2026)
  • Quatre axes déterminent la force : vidéo = densité de trames et longueur de contexte / audio = traitement natif ou via transcription / documents = capacité à renvoyer des coordonnées / open-weight = omnimodal ou non, et licence. Le classement change, ces axes non
  • Benchmarks : MMMU-Pro / Video-MMMU / DocVQA / AudioBench — vérifier les quatre axes avant de choisir
  • Pour choisir selon le cas d'usage, le plus court chemin est de tester sur vos propres documents : pour les PDF, envoyez la page la plus sale que vous ayez, c'est plus rapide que les valeurs annoncées. En combinaison, un modèle principal plus un second qui comble ses faiblesses reste le plus stable
  • Trois limites : conjectures sur images de mauvaise qualité / chute de précision au milieu d'une vidéo / dialectes & jargon audio. Double-vérifier les sorties critiques

En 2026, le travail d'IA qui se boucle « avec du texte seul » recule vite. Photos du téléphone, enregistrements de réunions, vidéos YouTube, PDF — les confier à l'IA est devenu courant (qu'un seul modèle les accepte tous dépend du modèle). Savoir se servir du multimodal n'est plus « une fonction pratique » : c'est le socle de la culture IA en 2026. Commencez aujourd'hui par donner à l'IA une photo de votre téléphone — cela suffit pour démarrer.

FAQ

Q1. Puis-je essayer l'IA multimodale gratuitement ?

Oui. L'offre gratuite de ChatGPT (entrée image OK), Google AI Studio (palier gratuit, vidéo incluse) et l'offre gratuite de Claude.ai (images OK) permettent tous d'essayer. Attention : dans Google AI Studio et le niveau gratuit de l'API Gemini, ce que vous envoyez sert à améliorer les produits Google et peut être lu par des évaluateurs humains (conditions de l'API Gemini) ; n'y mettez donc pas d'images ni d'audio sensibles. Mais les modèles attribués aux offres gratuites changent à chaque génération : plutôt que de retenir des noms, vérifiez dans l'interface de chaque service quelles entrées il accepte (image, audio, vidéo) et combien vous pouvez l'utiliser par jour. Certaines fonctions, comme les limites de conversation vocale ou de vidéo longue, s'élargissent sur les paliers payants. Voir Guide des outils IA gratuits.

Q2. En quoi l'IA de génération d'images diffère-t-elle de l'IA multimodale ?

Termes différents. Des outils comme Midjourney et Stable Diffusion se spécialisent dans la génération d'images à partir de texte — un flux unidirectionnel texte→image. L'IA multimodale désigne la compréhension des images (et autres modalités) en entrée. Certains services, comme ChatGPT et Gemini, font les deux, mais comprendre et générer sont deux capacités distinctes : exceller dans l'une ne garantit pas d'exceller dans l'autre, testez-les donc séparément selon votre usage. Voir Comparatif des outils d'IA de génération d'images.

Q3. Comment envoyer de la vidéo via l'API ?

L'API Gemini (l'API développeurs d'ai.google.dev) accepte la vidéo telle quelle. Pour les vidéos longues ou réutilisées, la voie recommandée est de les téléverser avec la Files API et de passer la référence ; les petites vidéos peuvent être intégrées directement dans la requête. On peut aussi passer une URL YouTube publique, ou enregistrer des fichiers Cloud Storage dans la Files API (documentation développeurs de Google). Via Vertex AI de Google Cloud, on indique dans fileData une URI gs:// de Cloud Storage (documentation Google Cloud). Les API d'OpenAI et de Claude n'acceptent pas la vidéo directement au 26 septembre 2026 (la page de modèle de GPT-6 Astra indique la vidéo « Not supported » ; Anthropic précise que tous ses modèles actuels prennent du texte et des images en entrée). Dans les deux cas, la marche à suivre est d'extraire des trames de la vidéo et de les envoyer comme images ; OpenAI en donne un exemple dans son Cookbook officiel. Voir Guide débutant API IA.

Q4. La confidentialité est-elle assurée ?

Images, audio et vidéo contiennent souvent des données sensibles. L'usage pour l'entraînement diffère entre les applis grand public et l'API ou les offres entreprise. Côté grand public, ChatGPT peut utiliser vos conversations pour l'entraînement, et vous pouvez l'arrêter en désactivant « Improve the model for everyone » dans les paramètres (centre d'aide d'OpenAI). Claude (Free, Pro, Max) utilise vos conversations pour l'entraînement si vous l'autorisez (centre de confidentialité d'Anthropic). Les applis Gemini utilisent vos conversations — y compris via une relecture humaine — pour améliorer les services Google tant que « Keep Activity » est activé, et le désactiver y met fin (centre de confidentialité des applis Gemini). En revanche, l'API d'OpenAI et ChatGPT Business/Enterprise, l'API et les offres entreprise d'Anthropic, ainsi que le niveau payant de l'API Gemini ne servent pas à l'entraînement par défaut (explication d'Anthropic pour les entreprises, conditions de l'API Gemini). Exception : avec le niveau gratuit de l'API Gemini et Google AI Studio, vos entrées servent à améliorer les produits Google. Pour des visages, des images médicales ou des documents internes, choisissez une API payante ou une offre entreprise. Pour une confidentialité totale, faites tourner sur votre propre matériel un modèle à poids ouverts (dans la famille Qwen toutes modalités, c'est la génération précédente, Qwen3-Omni ; le dernier Qwen3.5-Omni n'est proposé que via API et ses poids ne sont pas publiés en septembre 2026).

Q5. Le multimodal est-il plus coûteux que le texte seul ?

Les images et vidéos sont facturées par conversion en tokens. Une image ≈ quelques centaines à ~1 000 tokens (selon résolution et modèle) ; pour la vidéo, l'API Gemini compte environ 100 tokens par seconde avec le réglage par défaut et environ 300 en haute résolution (documentation développeurs de Google, consultée en septembre 2026). Une heure au réglage par défaut représente 100 × 3 600 s ≈ 360 000 tokens. Les techniques de coût dans Réduire les coûts en tokens IA (envoi d'extraits seulement, mise en cache) fonctionnent aussi pour la vidéo.