Índice
- 1. Em 2026, a IA deixou de ser "somente texto" — MMMU-Pro ultrapassa 80%
- 2. O que é IA multimodal? — Uma IA que entende mais que texto
- 3. Costurado vs Nativo — A divisão arquitetural
- 4. O que determina a força em cada modalidade
- 5. Benchmarks que importam — MMMU / Video-MMMU / OCR / Áudio
- 6. Por caso de uso: com que critério escolher
- 7. Limites rígidos — Use, não confie cegamente
- Resumo
- FAQ
No benchmark de IA multimodal MMMU-Pro (compreensão multidisciplinar de imagens, gráficos e figuras), os melhores modelos já estão acima de 80%. A OpenAI divulgou em abril de 2026 81,2% para o GPT-5.5 (sem ferramentas), e o Google, em fevereiro, 80,5% para o Gemini 3.1 Pro. Quando o MMMU original foi lançado, no fim de 2023, o GPT-4V fez cerca de 56%. O MMMU-Pro é uma versão mais difícil do MMMU (lançada em setembro de 2024), então não é a mesma régua — ainda assim, os modelos já passam de 80% na mais difícil. A era da IA "somente texto" realmente acabou.
Não foram só as pontuações que mudaram. O jeito de construir esses modelos vem passando de "costurado" para "nativo". Antes, o normal era encadear modelos separados: um para transcrever a fala, outro para raciocinar sobre o texto e outro para ler a resposta em voz alta (a OpenAI descreve o modo de voz do ChatGPT anterior ao GPT-4o exatamente como essa cadeia de três modelos). Hoje se espalharam os projetos em que um único modelo recebe vários tipos de entrada diretamente, e o Gemini e a linha Omni do Qwen tratam as quatro — texto, imagem, áudio e vídeo — em um só modelo. Mas nem todos os fornecedores seguiram esse caminho: em setembro de 2026, o modelo principal da OpenAI e a API do Claude aceitam só texto e imagens como entrada, e a OpenAI cuida do áudio com modelos de voz à parte, como o gpt-realtime (veja a tabela da §4).
Deixo minha opinião na frente: o multimodal passou de "bom ter" para "não ter é inviável". Tirar uma foto de uma tela de erro e a IA resolver na hora, capturar a tela de um PDF e extrair os pontos-chave, transcrever e resumir um vídeo do YouTube — essas são agora as bases da fluência em IA em 2026. Este artigo cobre a definição, a diferença entre multimodal costurado e nativo, o que tecnicamente determina a força em cada modalidade, com que critério escolher em cada caso de uso, benchmarks e os limites. O eixo aqui não é o ranking de um modelo específico, e sim a forma de decidir — por isso continua servindo mesmo quando a geração muda.
IA que lida com texto, imagem, áudio e vídeo
— quanto disso cabe em um só modelo depende do modelo
No MMMU-Pro, os melhores modelos já estão na faixa dos 80% (números de cada empresa e fontes na §1).
Acabou a era da "imagem como bônus". Mas só alguns — como o Gemini e a linha Omni do Qwen — recebem as quatro em um único modelo; o modelo principal da OpenAI e a API do Claude vão até a imagem (em setembro de 2026).
1. Em 2026, a IA deixou de ser "somente texto" — MMMU-Pro ultrapassa 80%
"Multimodal" começou a ganhar destaque em 2024, mas os modelos logo antes disso só conseguiam ler imagens como uma reflexão tardia: quando o MMMU (compreensão multimodal multidisciplinar) foi lançado, no fim de 2023, até o melhor, o GPT-4V, ficava em torno de 56%. O especialista humano mediano (82,6%) estava muito longe em questões de imagem que exigem conhecimento especializado.
2026 parece totalmente diferente. Pontuações divulgadas no MMMU-Pro (a versão mais difícil do MMMU):
- GPT-5.5: 81,2% (sem ferramentas), 83,2% (com ferramentas) — anúncio da OpenAI, abril de 2026
- Gemini 3.1 Pro: 80,5% (sem ferramentas) — documento de avaliação do Google DeepMind, fevereiro de 2026
- Qwen3.5-Omni-Plus: 73,9% — relatório técnico da equipe Qwen, abril de 2026
- Como referência: especialistas humanos (mediana) 80,8% — placar oficial do MMMU
"Ultrapassar 80% significa que o benchmark está saturando" é a realidade de 2026. A diferenciação migrou para compreensão de vídeo (Video-MMMU), documentos densos em OCR e raciocínio audiovisual conjunto — território mais difícil. O placar público em MMMU benchmark permite que qualquer pessoa compare.
2. O que é IA multimodal? — Uma IA que entende mais que texto
Definição: "um modelo de IA que aceita entradas além de texto (imagens, áudio, vídeo etc.)". Até onde isso vai depende do modelo: de texto mais imagens até áudio e vídeo em um só modelo (veja o quadro de termos abaixo).
A IA tradicional era de modalidade única: o GPT-3 lidava com texto; o Whisper lidava apenas com fala para texto; o Stable Diffusion lidava apenas com texto para imagem. Combiná-los exigia um pipeline em que a saída de um modelo alimentava outro, e havia perda de informação a cada transição.
Na IA multimodal, um só modelo olha várias entradas ao mesmo tempo e responde. Por exemplo: "Veja a mensagem de erro deste print (imagem) junto com a minha pergunta (texto) e me diga a causa" — resolvido em uma única chamada de API.
3. Costurado vs Nativo — A divisão arquitetural
Entender a diferença de mecanismo ajuda a ler os pontos fortes de cada modelo. Em linhas gerais, há dois jeitos de construí-los.
Costurado vs Nativo
- Transcrição, raciocínio e fala em modelos separados
- Os modelos passam o trabalho adiante como texto
- Tom de voz, vários falantes e ruído de fundo se perdem no caminho
- Cada etapa a mais aumenta a latência
- ex.: o modo de voz do ChatGPT antes do GPT-4o (três modelos encadeados)
- Um só modelo recebe várias entradas diretamente
- Da entrada à saída na mesma rede
- O modelo enxerga diretamente o tom e como imagem e som se encaixam
- Pouca informação perdida nas passagens
- ex.: GPT-4o (maio de 2024), o Gemini do Google, a linha Omni do Qwen
O nativo permite "interpretar juntos o áudio e a imagem de um vídeo" dentro de um só modelo.
O costurado insere uma passagem intermediária — como transcrever a fala para texto antes — e a informação se perde ali.
Exemplo concreto: "assista a um vídeo de receita no YouTube e extraia a receita". Costurado: áudio → Whisper para texto → GPT para resumir; vídeo → extrair quadros → analisar à parte. Muitas etapas. Um modelo nativo que aceita vídeo diretamente (o Gemini, por exemplo) recebe o arquivo de vídeo inteiro e devolve a receita em uma só chamada de API, ligando a explicação falada ao que aparece na tela dentro do próprio modelo.
4. O que determina a força em cada modalidade
"Qual modelo é o melhor" muda a cada geração. A liderança em vídeo e a qualidade da experiência de voz já trocaram de dono em intervalos de seis meses. Por isso o que vale memorizar não é o ranking, e sim o que tecnicamente determina a força de cada modalidade. Com esses eixos na cabeça, você mesmo consegue avaliar o próximo modelo que aparecer.
① Densidade de amostragem de quadros (de quantos em quantos segundos ele olha um quadro) ② Contexto capaz de reter material longo ③ Raciocínio causal ao longo do tempo. Um vídeo de 1 hora a 1 fps são 3.600 quadros — centenas de milhares de tokens. Capacidade de vídeo e comprimento de contexto andam juntos: modelos fortes em vídeo têm, sem exceção, janelas grandes.
① Latência de ida e volta ② Se é full duplex (dá para interromper enquanto ele ainda está falando?) ③ Preservação da prosódia e da emoção. É aqui que a diferença entre costurado e nativo da §3 mais aparece: transcrever a fala para texto e só depois processar é estruturalmente mais lento e perde informação.
① Precisão de OCR ② Preservação do layout (tabelas, colunas e notas de rodapé continuam de pé?) ③ Se ele consegue devolver coordenadas. O item ③ passa despercebido, mas é decisivo para agentes que operam a tela: saber que existe um botão não adianta se ele não souber dizer onde o botão está — sem isso, não há clique.
① Se é omnimodal ou uma costura de modalidade em modalidade ② Disponibilidade dos pesos e licença. Não é raro que um modelo se chame "aberto" e ainda assim imponha condições ao uso comercial. Se o plano é rodar por conta própria, leia a licença antes dos benchmarks.
A tabela abaixo é uma avaliação aproximada nossa, de maio de 2026, baseada no que cada fornecedor tinha publicado sobre as entradas aceitas — não são medições de benchmark. As posições mudam, então consulte a lista de modelos atuais para saber o que dá para escolher hoje, e o comparativo entre GPT-5.6 Sol e Gemini ou os model cards de cada fornecedor para a comparação direta. Aqui, leia a tabela como exemplo de como os quatro eixos acima aparecem na prática como diferença.
| Modelo | Texto | Imagem | Áudio | Vídeo | Ponto forte |
|---|---|---|---|---|---|
| GPT-5.5 | ◎ | ◎ | × | × | Lê texto + imagens; a API não aceita entrada de áudio nem de vídeo |
| Gemini 3.1 Pro | ◎ | ◎ | ◎ | ◎◎ | Forte em compreensão de vídeo, inclusive vídeo longo |
| Claude Opus 4.7 | ◎ | ◎ | × | × | Análise de UI/documentos; forte para cargas de agente |
| Qwen3.5-Omni | ◎ | ◎ | ◎ | ◎ | Omnimodal: um só modelo recebe as quatro entradas. Oferecido via API (pesos não publicados até setembro de 2026) |
| DeepSeek V4-Pro | ◎ | × | × | × | Só texto e barato (a entrada de imagens chegou com a linha Flash a partir de agosto de 2026) |
× = a API não aceita essa entrada (não contam recursos dos apps que passam por outro modelo ou por transcrição, como a conversa por voz). O suporte foi verificado em fontes primárias: a página do modelo GPT-5.5 da OpenAI, a página do modelo Gemini 3.1 Pro do Google, a página do modelo Claude Opus 4.7 da Anthropic, o relatório técnico do Qwen3.5-Omni, o registro de mudanças da API da DeepSeek (consultadas em setembro de 2026).
O que a tabela mostra é que os quatro eixos agem separadamente, cada um por conta própria:
- Em vídeo, a diferença se abre pela duração: o Video-MME pontua vídeos de 11 segundos a uma hora em três faixas (curta, média e longa), e todos os modelos do seu placar oficial caem na faixa longa. Em material longo, ① a densidade de quadros e ② o comprimento de contexto viram gargalo. Se você só lida com vídeos curtos, o ranking de vídeo longo não diz respeito a você
- Em áudio, quem decide é a arquitetura: responder rápido e ainda captar emoção fica muito mais fácil quando a fala é tratada nativamente, sem passar por texto (a transcrição acrescenta sua própria espera e apaga a entonação). Mesmo que a tabela do fornecedor traga uma fila de "áudio ◎", a experiência é outra se o caminho for via transcrição
- Em documentos, a divisão está nas coordenadas: a leitura de PDFs e de capturas de tela ser bem avaliada em usos de agente como o Cursor tem menos a ver com a precisão em si e mais com conseguir devolver a posição de cada elemento
- Nos abertos, o valor muda conforme seja omnimodal ou não: um único modelo que cobre todas as modalidades é muito mais leve de operar do que uma montagem com um modelo diferente para cada uma. E já existem opções de qualidade próxima da fronteira comercial a um custo drasticamente menor
5. Benchmarks que importam — MMMU / Video-MMMU / OCR / Áudio
Você escolherá o modelo errado se não souber o que cada benchmark realmente testa. Quatro benchmarks para conhecer em 2026:
Como medimos a IA multimodal
"MMMU alto = bom em tudo" está errado.
Para vídeo, verifique Video-MMMU; para documentos, DocVQA; para áudio, AudioBench — caso contrário a escolha falha.
6. Por caso de uso: com que critério escolher
Cinco padrões comuns, com "o que conferir antes de decidir" em cada um. Não cito nomes de modelos aqui — esta seção envelheceria em seis meses. Em vez disso, deixei tudo no formato de um procedimento que continua funcionando com qualquer modelo que apareça.
- ① Perguntas/diagnóstico com foto do celular (foto de refeição → nutrição, tela de erro → correção, foto de produto → busca)
→ praticamente qualquer um dá conta. Teste dois nos planos gratuitos e fique com o que responde no nível de detalhe que você prefere. É o uso em que a distância entre modelos é menor, e gastar tempo com a escolha rende pouco - ② Análise de PDF / documentos (recibos, contratos, especificações técnicas, artigos)
→ teste com os seus próprios arquivos. Os critérios são três: as tabelas continuam de pé? Ele segue a ordem de leitura em textos em colunas? Ele aguenta uma página digitalizada em má qualidade? Mais rápido que qualquer ficha técnica de OCR é jogar nele a sua própria página de pior qualidade - ③ Transcrição e resumo de vídeo (reuniões, palestras, YouTube)
→ o critério se divide pela duração do material. Em torno de 10 minutos, a diferença é pequena. Se for jogar uma hora inteira de uma vez, entram ① a densidade de quadros e ② o comprimento de contexto da §4 — então confira os benchmarks de vídeo longo e o tamanho da janela - ④ Conversa por voz / interpretação / prática de entrevista
→ confirme primeiro se o processamento é nativo. Mesmo com "suporte a áudio" escrito na ficha, o caminho via transcrição traz atraso e perda de entonação. O teste é simples: veja se dá para interromper enquanto ele ainda está falando - ⑤ Custo em primeiro lugar / processamento em massa
→ olhe além do preço unitário: desconto para lote e se rodar por conta própria é realista. E, se a opção for um modelo aberto, leia as condições comerciais da licença antes de olhar desempenho
7. Limites rígidos — Use, não confie cegamente
A IA multimodal é forte, mas três limites vão te morder se ignorados.
Limite ①: Não leia "palpites" derivados de fotos como fatos
Pedir "faça OCR do valor neste recibo" parece simples, mas se a imagem tiver baixa resolução, estiver escura ou inclinada, a IA fabrica números plausíveis. Mesmo um modelo acima de 80% no MMMU-Pro ainda erra quase uma em cada cinco respostas. Valores, datas, nomes próprios — sempre revise com um humano. Especialmente em jurídico, finanças, saúde.
Limite ②: A precisão em vídeo cai no meio
Mesmo para o modelo que lidera os benchmarks de vídeo, recuperar informações do meio de um vídeo de 1 hora é difícil — o mesmo problema do "Lost in the Middle" do problema da janela de contexto. Para trechos importantes, especifique timestamps: "analise especificamente o trecho de 30:00–35:00" rende resultados muito melhores.
Limite ③: O áudio tem dificuldade com dialetos e jargão
Fala padrão em inglês / japonês é precisa, mas dialetos regionais, vocabulário especializado, conversas cruzadas de múltiplos falantes e ambientes ruidosos aumentam os erros. Para registros de reunião e outros usos críticos, combine com ferramentas especializadas (Otter.ai, Notta, etc.) ou limpe o áudio antes de enviar para a IA.
Resumo
Recapitulando:
- 2026: GPT-5.5 e Gemini 3.1 Pro passaram de 80% no MMMU-Pro (números de cada empresa; valores e fontes na §1). A IA multimodal passou de "bom ter" para "obrigatório"
- A arquitetura vem passando de cadeias de modelos separados (costurado) para modelos nativos que recebem várias entradas diretamente. Mas receber as quatro em um só modelo é coisa do Gemini, da linha Omni do Qwen e de poucos outros; o modelo principal da OpenAI e a API do Claude vão até a imagem (em setembro de 2026)
- A força é determinada por quatro eixos: vídeo = densidade de quadros e comprimento de contexto / áudio = processamento nativo ou via transcrição / documentos = conseguir devolver coordenadas / abertos = ser omnimodal e a licença. O ranking troca de dono; esses eixos não
- Benchmarks: MMMU-Pro / Video-MMMU / DocVQA / AudioBench — verifique os quatro eixos antes de escolher
- Para escolher por caso de uso, o caminho mais curto é testar com os seus próprios arquivos — em PDF, sobretudo, jogar nele a sua página de pior qualidade responde mais rápido que qualquer número de catálogo. Na combinação, um principal + um que cubra o ponto fraco é o arranjo mais estável
- Três limites: palpites de imagens de baixa qualidade / queda de precisão no meio do vídeo / áudio com dialetos e jargões. Revise duplamente as saídas críticas
Em 2026, o trabalho com IA que se resolve "só com texto" está encolhendo rápido. Fotos do celular, gravações de reuniões, vídeos do YouTube, PDFs — entregá-los à IA já virou rotina (se um só modelo aceita todos, depende do modelo). Saber usar o multimodal não é mais "um recurso útil"; é o mínimo da alfabetização em IA de 2026. Comece hoje mandando uma foto do celular para a IA — já basta para começar.
FAQ
Sim. O plano gratuito do ChatGPT (entrada de imagem OK), o Google AI Studio (nível gratuito, vídeo incluído) e o plano gratuito do Claude.ai (imagens OK) permitem testar. Atenção: no Google AI Studio e no nível gratuito da API do Gemini, o que você envia é usado para melhorar produtos do Google e pode ser lido por revisores humanos (termos da API do Gemini); por isso, não envie imagens nem áudios sensíveis. Mas os modelos atribuídos aos planos gratuitos mudam a cada geração; em vez de decorar nomes, verifique na tela de cada serviço quais entradas ele aceita (imagem, áudio, vídeo) e quanto dá para usar por dia. Alguns recursos, como os limites de conversa por voz e de vídeo longo, aumentam nos planos pagos. Veja o Guia de ferramentas de IA gratuitas.
São termos diferentes. Ferramentas como Midjourney e Stable Diffusion se especializam em gerar imagens a partir de texto — um fluxo unidirecional texto→imagem. A IA multimodal refere-se a entender imagens (e outras modalidades) como entradas. Alguns serviços, como ChatGPT e Gemini, fazem ambos, mas entender e gerar são capacidades diferentes: ser bom em uma não garante ser bom na outra, então teste cada uma separadamente para o seu uso. Veja Comparativo de ferramentas de geração de imagens por IA.
A API do Gemini (a API para desenvolvedores do ai.google.dev) aceita vídeo como está. Para vídeos longos ou que você vai reutilizar, o recomendado é enviar pela Files API e passar a referência; vídeos pequenos podem ir embutidos na própria requisição. Também dá para passar uma URL pública do YouTube ou registrar arquivos do Cloud Storage na Files API (documentação para desenvolvedores do Google). Pelo Vertex AI do Google Cloud, você indica em fileData uma URI gs:// do Cloud Storage (documentação do Google Cloud). As APIs da OpenAI e do Claude não aceitam vídeo diretamente em 26 de setembro de 2026 (a página de modelo do GPT-6 Astra marca vídeo como "Not supported"; a Anthropic informa que todos os modelos atuais aceitam entrada de texto e imagem). Nos dois casos, o procedimento é extrair quadros do vídeo e enviá-los como imagens; a OpenAI tem um exemplo no seu Cookbook oficial. Veja o Guia para iniciantes em APIs de IA.
Imagens, áudio e vídeo frequentemente contêm dados sensíveis. O uso para treinamento muda entre os apps para pessoas físicas e a API ou os planos empresariais. Nos apps pessoais, o ChatGPT pode usar suas conversas para treinar, e dá para impedir isso desligando "Improve the model for everyone" nas configurações (central de ajuda da OpenAI). O Claude (Free, Pro, Max) usa seus chats para treinamento se você permitir (central de privacidade da Anthropic). Os apps do Gemini usam seus chats — inclusive com revisão humana — para melhorar os serviços do Google enquanto "Keep Activity" está ligado, e desligá-lo interrompe isso (central de privacidade dos apps do Gemini). Já a API da OpenAI e o ChatGPT Business/Enterprise, a API e os planos empresariais da Anthropic e o nível pago da API do Gemini não são usados para treinamento por padrão (explicação da Anthropic para empresas, termos da API do Gemini). A exceção: no nível gratuito da API do Gemini e no Google AI Studio, suas entradas são usadas para melhorar produtos do Google. Para rostos, imagens médicas ou documentos internos, escolha uma API paga ou um plano empresarial. Para sigilo total, rode no seu próprio equipamento um modelo de pesos abertos (na família Qwen com todas as modalidades, isso é a geração anterior, Qwen3-Omni; o Qwen3.5-Omni mais recente só é oferecido via API e não tem pesos publicados até setembro de 2026).
Imagens e vídeos são cobrados por conversão em tokens. Uma imagem ≈ algumas centenas até ~1.000 tokens (depende da resolução e do modelo); em vídeo, a API do Gemini conta cerca de 100 tokens por segundo na configuração padrão e cerca de 300 em alta resolução (documentação para desenvolvedores do Google, consultada em setembro de 2026). Uma hora na configuração padrão dá 100 × 3.600 s ≈ 360.000 tokens. As técnicas de custo em Economia de custos com tokens de IA (envio apenas de trechos, cache) também funcionam para vídeo.