Índice
- 1. Visão Geral do Lançamento -- Data, Preço e Onde Usar
- 2. O Que Há de Novo
- 3. Suporte a Imagens em Alta Resolução -- Primeiro no Claude
- 4. Níveis de Esforço -- Chega o xhigh
- 5. Task Budgets (Beta)
- 6. Impacto do Novo Tokenizador
- 7. Mudanças de Comportamento -- O Que Mudou desde o 4.6
- 8. Breaking Changes
- 9. Benchmarks
- 10. Comparativo com Opus 4.6 / 4.5 / 4.1
- 11. Quando Usar
- 12. Novidades no Claude Code -- /ultrareview e Max
- FAQ
Em 16 de abril de 2026 a Anthropic lançou oficialmente o Claude Opus 4.7, seu modelo flagship. O ID do modelo e claude-opus-4-7 e o preço e $5 / $25 por MTok para entrada/saída -- mantido em relação ao 4.6. Mas o conteúdo e recheado de mudanças que reescrevem a experiência de usar um modelo de fronteira: imagens em alta resolução, novo nível de esforço xhigh, task budgets (beta), novo tokenizador é muito mais.
Por outro lado, existem breaking changes importantes: o fim do extended thinking via API, a remoção dos parâmetros temperature / top_p / top_k e a remoção do prefill. Portanto, migrar o código existente é obrigatório.
Neste artigo, com olhar de engenheiro, passamos por tudo: novidades, diferenças em relação ao 4.6 e quando faz sentido usar.
Claude Opus 4.7
Novo flagship -- recursos, melhorias e mudanças incompativeis
model id: claude-opus-4-7
1. Visão Geral do Lançamento -- Data, Preço e Onde Usar
| Item | Conteúdo |
|---|---|
| Data de lançamento | 16 de abril de 2026 |
| ID do modelo | claude-opus-4-7 |
| Preço (entrada) | $5 por 1M tokens (igual ao 4.6) |
| Preço (saída) | $25 por 1M tokens (igual ao 4.6) |
| Janela de contexto | 1.000.000 tokens (preço padrão, sem adicional para contexto longo) |
| Saída máxima | 128.000 tokens |
| Plataformas | claude.ai, Anthropic API, AWS Bedrock, Google Vertex AI, Microsoft Foundry |
Destaque: "preço mantido + janela de 1M tokens no preço padrão". Em modelos anteriores, contextos longos (acima de 200K, por exemplo) costumavam ter cobrança adicional. No 4.7, você usa 1M de tokens sem pagar extra.
O Opus 4.7 já está disponível nos apps web/mobile do claude.ai para usuários pagos e, na API, basta trocar o ID do modelo. Também é lançado em AWS Bedrock, Google Vertex AI e Microsoft Foundry simultaneamente, o que permite uso imediato em ambientes multicloud.
2. O Que Há de Novo
Principais recursos adicionados/alterados no Opus 4.7:
Novidades do Opus 4.7 em detalhe
Imagens HD / esforço xhigh / task budgets / novo tokenizador
- Suporte a imagens em alta resolução (inédito no Claude) -- até 2576px / 3,75 megapixels (antes: 1568px / 1,15 MP, cerca de 3x mais)
- Melhor percepção de baixo nível -- maior precisão em pointing, medição, contagem e detecção de bounding boxes
- Novo nível de esforço xhigh -- entre high e max. Ótimo para coding e agentes
- Task budgets (beta) -- novo recurso para estimar o uso de tokens do loop inteiro de um agente
- Novo tokenizador -- consome 1,0 a 1,35x mais tokens que o anterior (até 35% a mais em alguns casos)
- Adaptive thinking -- agora vem OFF por padrão (precisa de opt-in explícito)
- Melhorias em memória baseada em sistema de arquivos -- scratchpads e notas entre várias sessões funcionam melhor
- Melhoria no trabalho com documentos (.docx, .pptx) -- edição com track changes, layouts de slides, melhor análise de gráficos e diagramas
- Integração com o Claude Code -- novo slash command
/ultrareview; no plano Max, o effort padrão sobe para xhigh; Auto mode se estende a usuários Max - Proteção em tempo real para cibersegurança -- novas recusas em tópicos de alto risco
- Mudanças de comportamento -- mais literal, tom mais direto, menos chamadas de tool
Em especial, o suporte a imagens em HD e o nível xhigh tem valor prático real para análise de documentos, Computer Use e agentes de código. Vamos ver cada um a seguir.
3. Suporte a Imagens em Alta Resolução -- Primeiro no Claude
O Opus 4.7 e o primeiro Claude a processar imagens em alta resolução diretamente.
Mudança na resolução
| Item | Opus 4.6 e anteriores | Opus 4.7 |
|---|---|---|
| Resolução máxima (lado maior) | 1568px | 2576px |
| Megapixels máximos | 1,15 MP | 3,75 MP |
| Tokens por imagem em HD | ~1.600 tokens | ~4.784 tokens (~3x) |
| Escala de coordenadas | Coordenadas da imagem reduzida | 1:1 com pixels reais (sem conversão) |
Qual o ganho
- Análise de documentos -- letras pequenas, linhas de tabela e escalas de gráficos de documentos escaneados ficam legíveis
- Computer Use -- screenshots em Full HD ou mais podem ser enviadas direto
- Entender capturas de UI -- imagens de telas 4K e displays high-DPI são analisadas sem downsampling
- Coordenadas 1:1 -- se o modelo retorna coordenadas de clique, você não precisa mais converter escala
Atenção: uma imagem em HD consome cerca de 4.784 tokens. Agentes que trocam muitas screenshots podem ver o custo de imagem disparar. Se não precisa da resolução máxima, avalie reduzir antes de enviar.
4. Níveis de Esforço -- Chega o xhigh
Ao "nível de esforço (effort level)" que controla a profundidade do extended thinking do Claude, chegou o xhigh.
Como escolher o nível de esforço (Effort Level)
No Opus 4.7 surge o "xhigh" -- 5 níveis para controlar a profundidade
Na dúvida, comece com xhigh; se faltar, suba para max. Para tarefas leves, medium já basta
5 níveis e quando usar
| Nível | Características | Casos indicados |
|---|---|---|
| low | Pensamento mínimo. Resposta rápida | Perguntas curtas, classificação, resumo simples, chat |
| medium | Raciocínio moderado | QA padrão, extração de info, gerações leves |
| high | Raciocínio profundo | Decisões de design, análise complexa, textos longos |
| xhigh (novo) | Entre high e max. Otimizado para coding e agentes | Implementação de código, agentes multi-passos, refatoração |
| max | Profundidade máxima | Problemas matemáticos difíceis, pesquisa |
Até o 4.6 existia o gap "high não basta, mas max e demais" em coding e agentes. O xhigh foi criado para ocupar exatamente esse meio, e a Anthropic o recomenda para coding e agentes.
Dicas para escolher
No 4.7 a calibração de esforço foi endurecida. Principalmente em low é medium, o modelo respeita o escopo com mais rigidez. Então, se uma tarefa que rodava em medium parece "cortada demais", considere subir para high ou xhigh.
5. Task Budgets (Beta)
O Opus 4.7 traz Task Budgets, um recurso em beta para estimar antecipadamente quantos tokens o loop inteiro de um agente vai consumir.
Especificações
- Beta header:
task-budgets-2026-03-13 - Valor mínimo: 20.000 tokens
- Escopo: loop inteiro do agente, incluindo pensamento, chamadas de tool e saída
- Comportamento: é um limite consultivo (referência), não um limite rígido -- se estourar, não para a execução a força
Por que existe
O max_tokens tradicional controla somente o limite de saída de uma única resposta. Mas na execução real de um agente, pensamento + idas e voltas de chamadas de tool + saída de vários passos se misturam, e fica difícil prever "quantos tokens a tarefa toda vai usar".
Ao definir um task budget, o modelo usa esse orçamento como guia para planejar o trabalho com profundidade e velocidade adequadas. Da para sinalizar "não aprofunde muito, termine logo" ou "pense com calma" a partir do lado do custo.
Como e consultivo, se você precisa garantir parada ao estourar o orçamento, mantenha um contador próprio na aplicação.
6. Impacto do Novo Tokenizador
O Opus 4.7 usa um novo tokenizador e consome 1,0 a 1,35x mais tokens que modelos anteriores no mesmo texto. Em casos extremos, até 35% a mais.
Efeito em custo e contexto
- Mesmo prompt pode custar mais -- preço mantido, mas como são mais tokens, o total sobe
- Cabe menos informação em 1M -- 1M tokens ainda são 1M, mas o mesmo documento ocupa mais tokens
- Estimativas e alertas precisam ser recalibrados -- se você tinha orçamentos ou rate limits baseados na contagem antiga, recalcule
Ações na prática
Ao migrar uma aplicação existente para o 4.7, reavalie:
- Previsão mensal de custo -- considere até 35% a mais com o mesmo tráfego
- Uso da janela de contexto -- cuidado se antes você ficava "quase em 1M"
- Rate limit e limite de tokens por minuto -- revise a folga em relação ao TPM da organização
- Estratégia de cache -- taxa de hit do prompt caching pode mudar
O passo a passo para migrar do 4.6 ao 4.7 está detalhado no artigo do guia de migração, mais adiante.
7. Mudanças de Comportamento -- O Que Mudou desde o 4.6
O Opus 4.7 não é apenas ganhos de funcionalidade -- o próprio estilo de resposta mudou em relação ao 4.6.
Principais mudanças
- Mais literal -- especialmente em esforço baixo a médio, segue a instrução sem adicionar comentários supercifluos
- Tom mais direto -- menos "validation phrases" ("ótima pergunta!"), menos formalidades em excesso, menos emojis
- Comprimento adaptado a tarefa -- perguntas simples recebem respostas curtas, tarefas complexas recebem respostas longas; acabou o "one-size-fits-all" verboso
- Menos chamadas de tool por padrão -- se da para resolver no raciocínio, resolve; evita uso desnecessário de tools
- Menos sub-agentes disparados -- em vez de paralelizar rapidamente, prefere pensar primeiro
- Calibração rígida do effort -- em low / medium, mantém escopo apertado e evita interpretações expansivas
Impacto em prompts existentes
Prompts escritos em 4.6 assumindo que o modelo "complementa gentilmente" ou agentes que assumiam "usar tools várias vezes para validar" podem mudar de comportamento no 4.7.
- Se quer comentário adicional, pesa: "explique motivos e alternativas também"
- Se quer mais uso de tools: "para confirmar fatos, use WebSearch obrigatoriamente"
- Se quer resposta mais longa: "escreva pelo menos 500 caracteres"
No geral, o modelo "não faz o que não foi pedido" -- um comportamento mais previsível onde instruções explícitas geram o que você esperou.
Salvaguardas de cibersegurança e segurança
O Opus 4.7 incorpora salvaguardas de cibersegurança em tempo real. Pentest, pesquisa de vulnerabilidade, red teaming e outras atividades legítimas de segurança podem ser recusadas dependendo do contexto. Se você usa para segurança em produção, considere se inscrever no programa de verificação cibernética da Anthropic.
Em termos de segurança, a Anthropic destaca:
- Maior honestidade -- tende a dizer "não sei" quando não sabe, evita afirmações sem base
- Maior robustez a prompt injection -- defesa contra injecoes maliciosas foi reforçada
- Mythos Preview continua sendo o melhor em alignment -- o Opus 4.7 tem capacidade geral maior, mas a precisão de alignment ainda é maior no Mythos Preview
Por outro lado, foi reportado que as respostas de redução de danos em tópicos como substancias reguladas ficaram um pouco mais verbosas (confirmado pela Anthropic). Em chatbots de farmácia/saúde, adicione filtros de saída.
8. Breaking Changes
O Opus 4.7 tem vários breaking changes em relação ao 4.6. Código feito para o 4.6 pode dar erro 400 do jeito que está.
Parâmetros e funções descontinuados
| Função | Comportamento no 4.6 | Comportamento no 4.7 |
|---|---|---|
| Extended thinking | thinking: {type: "enabled", budget_tokens: N} ativa extended thinking | Mesmo payload gera erro 400. Migrou para adaptive thinking |
| Adaptive thinking | ON por padrão | OFF por padrão. Opt-in explícito com thinking: {type: "adaptive"} |
| Exibição do thinking | Retornado por padrão | Omitido por padrão. Para ver, use display: "summarized" |
| temperature | Ajustável entre 0.0 e 1.0 | Valor não-padrão gera erro 400 |
| top_p / top_k | Controle de sampling disponível | Valor não-padrão gera erro 400 |
| Prefill de assistant | Colocar mensagem assistant no início para continuar a geração | Erro 400 (herdado do 4.6) |
O que precisa arrumar
- Código usando extended thinking: trocar
thinking.typepara"adaptive"e, se precisar, adicionardisplay - Código ajustando temperature etc.: remover esses parâmetros. Se precisar determinismo, resolva via prompt
- Código usando prefill do assistant: incorporar o que era prefill na mensagem do usuário ou usar instruções de formato de saída
- UI exibindo o thinking: sem
display: "summarized", o conteúdo de pensamento não volta
O procedimento detalhado está no guia de migração.
9. Benchmarks
Até o momento, os números detalhados foram divulgados de forma parcial. A Anthropic informa que houve melhorias significativas em coding, agentes e visão.
Benchmarks oficiais divulgados
Os principais números divulgados pela Anthropic:
| Benchmark | Opus 4.6 | Opus 4.7 | Área |
|---|---|---|---|
| CursorBench | 58% | 70% | Coding |
| CursorBench (visão) | 54,5% | 98,5% | Entendimento de UI |
| Rakuten-SWE-Bench | baseline | 3x mais tarefas resolvidas | Mudanças em código real |
| CyberGym | 73,8 | -- (não divulgado) | Segurança |
| Finance Agent | -- | state-of-the-art | Agentes financeiros |
| GDPval-AA | -- | top-tier | Trabalho de conhecimento de alto valor |
Relatos de terceiros e usuários
- Benchmark de coding com 93 tarefas: cerca de +13% vs Opus 4.6
- OfficeQA Pro (raciocínio com documentos): cerca de -21% em erros
- Factory Droids (tarefas reais em produção): +10 a +15% em taxa de sucesso
Avaliação prática
Os números acima vem da Anthropic e de parceiros. Mesmo assim, medir no seu próprio workload e o indicador mais confiável. Como o novo tokenizador muda a contagem no mesmo texto, benchmarks previos de custo e latência são obrigatórios.
Pontos-chave da avaliação:
- Mandar a mesma entrada para 4.6 e 4.7 e comparar qualidade de saída, tempo e consumo de tokens
- Em coding, avaliar objetivamente por "funcionou de primeira?" e "os testes passam?"
- Em agentes, avaliar em dois eixos: "taxa de conclusão" e "número de chamadas de tool" (o 4.7 usa menos tools, então se a taxa sobe, é melhoria real)
- Em visão, comparar com casos reais em alta resolução (screenshots de UI, scans de documentos)
Como fica o Mythos Preview
No anúncio oficial, a Anthropic diz que o modelo não divulgado "Mythos Preview" e, por enquanto, o modelo com maior precisão de alignment e menor taxa de falha. O Opus 4.7 tem capacidade geral mais ampla, mas em capacidade cibernética o Mythos Preview ainda leva (a política e testar segurança em modelos mais capazes antes de expandir). Para o usuário comum, o flagship disponível hoje é o Opus 4.7.
10. Comparativo com Opus 4.6 / 4.5 / 4.1
| Item | Opus 4.1 | Opus 4.5 | Opus 4.6 | Opus 4.7 |
|---|---|---|---|---|
| Preço (entrada) | $15 | $5 | $5 | $5 |
| Preço (saída) | $75 | $25 | $25 | $25 |
| Contexto máximo | 200K | 200K | 1M | 1M |
| Saída máxima | 32K | 64K | 128K | 128K |
| Resolução max de imagem | 1568px | 1568px | 1568px | 2576px |
| Níveis de esforço | low/medium/high | low/medium/high/max | low/medium/high/max | low/medium/high/xhigh/max |
| Extended thinking | Sim | Sim | Adaptive thinking | Adaptive thinking (OFF por padrão) |
| Task budgets | Não | Não | Não | Sim (beta) |
| temperature etc. | Disponível | Disponível | Disponível | Descontinuado |
| Prefill | Disponível | Disponível | Descontinuado | Descontinuado |
| Tokenizador | Antigo | Antigo | Antigo | Novo (1,0-1,35x) |
Valores baseados nas informações oficiais de 16 de abril de 2026. O maior destaque em 4.6 -> 4.7 e ganho de funcionalidade com preço mantido.
11. Quando Usar
O Opus 4.7 e flagship, mas nem todo caso de uso pede Opus.
Quando o Opus 4.7 e a melhor opção
- Coding complexo -- refatoração grande, decisões de design, mudanças em vários arquivos
- Loops longos de agentes -- automação multi-passo, em combinação com task budgets
- Tarefas de visão com imagens HD -- Computer Use, análise de UI, OCR de documentos
- Processamento com 1M de tokens -- entender grandes codebases, analisar documentos longos
- Raciocínio difícil -- matemática, pesquisa, estratégia
Quando considerar Sonnet
- QA padrão, classificação, extração de info
- Batch em grande volume mantendo custo baixo com qualidade "boa o suficiente"
- Experiência em tempo real onde latência curta e crítica
Quando considerar Haiku
- Classificação / tradução / filtragem simples, com mínimo custo em grande volume
- IoT / edge onde velocidade de resposta e prioridade absoluta
Na prática: para a parte que o usuário vê (código gerado, raciocínio complexo, núcleo do agente) use Opus 4.7; para batch no backend (classificação de logs, extração de dados, filtro primário) use Sonnet ou Haiku. Essa combinação costuma ter o melhor custo-benefício.
12. Novidades no Claude Code -- /ultrareview
O Claude Code (CLI oficial da Anthropic) também foi atualizado para o lançamento do Opus 4.7, incluindo o novo slash command /ultrareview.
Características do /ultrareview
- Faz review do código modificado com profundidade equivalente a xhigh
- Vai além do review comum -- reutilização, tratamento de erro, armadilhas de concorrência, riscos de segurança
- Não foca só em "bugs", mas também em "decisões de design indesejaveis"
Enquanto o /review equivale a um review de PR, o /ultrareview equivale a um review de design feito por engenheiro senior. Ideal antes e depois de um recurso grande ou em um check final antes de release.
Como usá thinking em xhigh, consome mais tempo e tokens que um review normal. Recomendado: usar /review no dia a dia e /ultrareview em pontos-chave.
Effort padrão elevado no plano Max
Para usuários do plano Max do Claude Code, o effort padrão ao usar Opus 4.7 sobe para xhigh. Tarefas do dia a dia passam a rodar automaticamente com raciocínio mais profundo. Dentro do limite de tokens, você tem mais qualidade; por outro lado, o consumo sobe -- monitore.
Auto mode disponível para usuários Max
O Auto mode, antes restrito a alguns planos, agora também atende usuários Max do Claude Code. Ele alterna entre Opus/Sonnet/Haiku conforme o tipo de tarefa, combinando otimização de custo e velocidade.
FAQ
P. Meu app em 4.6 roda em 4.7 só trocando o nome do modelo?
Muitos apps funcionam apenas com a troca do ID do modelo, mas precisam de ajuste se: (1) usam thinking: {type: "enabled"}; (2) definem temperature/top_p/top_k com valores não-padrão; (3) usam prefill de assistant; (4) exibem thinking na UI. Esses casos podem gerar erro 400 ou mudança de comportamento. Veja o guia de migração.
P. O novo tokenizador realmente faz o custo subir?
Como o consumo pode subir 1,0 a 1,35x no mesmo texto, no pior caso o custo aumenta cerca de 35%. Por outro lado, o 4.7 também reduz chamadas de tool e encurta respostas por padrão, então o total varia conforme o app. Para apps com bastante tráfego, rode 4.6 e 4.7 em paralelo por algum tempo e meça o custo mensal real antes de migrar.
P. Como escolher entre xhigh e max?
A Anthropic recomenda xhigh para coding e agentes. Max e para "raciocínio extremamente difícil". Implementação, refatoração, escrita de testes, planejamento multi-passo de agentes -- para isso, xhigh tem ótimo custo-benefício. Problemas matemáticos difíceis, pesquisa avançada, estratégia -- para isso, max. Na dúvida, comece em xhigh e suba para max se não for suficiente.
P. Por que o task_budget não é um limite rígido?
No loop de um agente, às idas e voltas das chamadas de tool fazem o consumo de tokens oscilar de forma imprevisível. Se fosse limite rígido, tarefas prestes a terminar seriam abortadas com frequência. Por isso, a Anthropic desenhou como limite consultivo. O modelo ajusta o plano pensando no orçamento, mas pode ultrapassar um pouco se precisar. Para parada certa, implemente contador no lado da app.
P. O suporte a imagem HD liga automaticamente?
Sim. Basta usar o ID do modelo 4.7 que as imagens enviadas são processadas com resolução até 2576px. Sem opt-in especial. Lembre: cada imagem em HD consome cerca de 4.784 tokens, e agentes que recebem muitas imagens podem ter um salto de custo. Se a resolução máxima não é necessária, reduza antes de enviar.
P. Sem temperature, da para garantir determinismo?
No 4.7, valores não-padrão de temperature/top_p/top_k dão erro 400. Para determinismo, especifique o formato de saída com rigor no prompt (ex.: "retorne em JSON seguindo estritamente este schema"). Combinar com saída estruturada (algo como response_format) aumenta a estabilidade.
P. Por que o conteúdo do thinking não aparece por padrão?
No 4.7, o conteúdo do thinking fica omitido por padrão. Para ver, use display: "summarized". A política mudou: "o pensamento é parte do processamento interno; a resposta final e o produto principal para o usuário". Se você depurava com isso ou mostrava "pensando..." na UI, explicite o summarized.
P. Qual a diferença entre /ultrareview e /review do Claude Code?
/review é um review de PR tradicional: aponta qualidade do código, bugs e estilo. /ultrareview roda com profundidade equivalente a xhigh e aponta problemas de design, armadilhas de concorrência, riscos de segurança, reutilização e tratamento de erro. Consome mais tempo e tokens, mas é ótimo em checks finais. No dia a dia, /review; em pontos-chave, /ultrareview.
P. Quanto o benchmark melhorou?
Resumo dos números da Anthropic e parceiros: CursorBench: 58% -> 70% (coding), CursorBench em visão: 54,5% -> 98,5% (UI screenshots), Rakuten-SWE-Bench: 3x mais tarefas de produção resolvidas. Em relatos de terceiros: ~+13% em 93 tarefas de coding, ~-21% em erros no OfficeQA Pro, +10 a +15% em Factory Droids. Em Finance Agent e GDPval-AA, aparece como state-of-the-art / top-tier.
P. O que é o Mythos Preview? E mais forte que Opus 4.7?
Mythos Preview e um modelo interno não divulgado da Anthropic. No anúncio, ela diz que o Mythos Preview "tem a maior precisão de alignment e a menor taxa de falha" atualmente, mas é uma liberação gradual com capacidade cibernética intencionalmente contida. Em capacidade geral, o Opus 4.7 e hoje o melhor modelo amplamente disponível. O Mythos supera o 4.7 em parte dos benchmarks, mas a disponibilidade e limitada e a polica e expandir so após confirmar segurança.
P. Estou sendo recusado em trabalho de segurança (pentest). O que fazer?
O 4.7 adiciona salvaguardas de cibersegurança em tempo real. Pentest, pesquisa de vulnerabilidade e red teaming, mesmo legítimos, podem ser recusados conforme o contexto. Para manter o uso em produção, inscreva-se no Cyber Verification Program da Anthropic. Aprovado, você passa a ter configurações menos restritivas.
P. Quero ver os scores de benchmark do 4.7. Onde encontro?
Até agora, os números detalhados foram divulgados parcialmente. A Anthropic informa grandes ganhos em coding, agentes e visão. Para padrões como SWE-bench, acompanhe o blog oficial, a model card e avaliações de terceiros. Como foi dito, o mais confiável e medir no seu próprio workload -- recomendo comparações A/B antes de colocar em produção.
Este artigo foi escrito com base nas informações oficiais de 16 de abril de 2026. Como especificações, preços e disponibilidade podem mudar, confira a documentação oficial da Anthropic antes de usar em produção. Para o passo a passo de migração, veja o guia de migração.