A forma como o Claude "pensa" mudou de figura drasticamente no último ano. O antigo pensamento estendido (extended thinking) funcionava com um humano especificando quantos tokens o modelo podia gastar raciocinando. A geração atual o substitui pelo pensamento adaptativo (adaptive thinking) — é o próprio modelo que decide se pensa e com que profundidade. E, com o Claude Opus 5, o pensamento passou a vir ligado por padrão, então até a velha premissa de que "sem configuração não há pensamento" ficou no passado.

Este artigo percorre o que de fato separa o pensamento estendido do pensamento adaptativo, como o comportamento varia de modelo para modelo e as armadilhas que pegam quem migra código — erros 400, saída truncada e contas que sobem sem avisar. Tudo se apoia na documentação oficial da Anthropic.

THINKING: EXTENDED → ADAPTIVE

De "o humano define a profundidade" para "o modelo decide"

A troca de geração em três passos

PENSAMENTO ESTENDIDO (ANTIGO)
budget_tokens: 10000
Um humano especifica o orçamento de pensamento
PENSAMENTO ADAPTATIVO (ATUAL)
type: "adaptive"
Pensar ou não, e quanto, é decisão do modelo
OPUS 5 EM DIANTE
Pensamento ligado por padrão
A profundidade agora se ajusta com effort
Fonte: documentação da Anthropic, "Thinking" e "Extended thinking" (em agosto de 2026)

1. O que é o pensamento

O pensamento é a etapa em que o Claude trabalha o problema com as próprias palavras antes de começar a escrever a resposta final. Ele reformula a pergunta, testa várias abordagens, confere resultados intermediários e abandona caminhos que não se sustentam — e esse processo é gerado como blocos de conteúdo thinking antes da resposta. O ganho é maior nas tarefas em que a qualidade do trabalho intermediário decide a qualidade da resposta: matemática, programação, análise e trabalho agêntico de longa duração.

Mas nada disso sai de graça. Como a documentação "Thinking" da Anthropic afirma sem rodeios, os tokens que o Claude gasta raciocinando são cobrados como tokens de saída e contam para o max_tokens — e a cobrança é a mesma até nas configurações em que o texto do pensamento nunca chega até você (veja a seção 6). Desenhar sua configuração de pensamento é tanto uma questão de custo e latência quanto de qualidade.

2. A era do pensamento estendido — você define budget_tokens

A primeira encarnação foi o pensamento estendido. Você anexa thinking: {"type": "enabled", "budget_tokens": N} à requisição, e o Claude raciocina dentro desse orçamento antes de responder. Um humano especifica quanto pensar, em cada requisição. Segundo a documentação oficial, as regras são estas:

  • Mínimo de 1.024 tokens. A API rejeita valores menores
  • Precisa ser menor que max_tokens — o pensamento conta dentro dele, então é preciso deixar espaço para a resposta
  • O orçamento é uma meta, não um teto rígido. O uso real varia com a tarefa, e o Claude muitas vezes termina de pensar bem antes de o orçamento acabar
  • Para orçamentos de pensamento acima de 32.000, a Anthropic recomenda processamento em lote para evitar timeouts

O problema desse desenho é direto: o orçamento certo muda de tarefa para tarefa, e um humano não tem como adivinhá-lo de antemão. Perguntas simples podem torrar o orçamento reservado; problemas difíceis podem ficar à míngua com ele. E mudar o valor do orçamento invalida o cache de prompt — a documentação demonstra isso com um exemplo medido.

3. A virada para o pensamento adaptativo — o modelo decide

É isso que o pensamento adaptativo, introduzido em 2026, veio substituir. A configuração é uma única linha: thinking: {"type": "adaptive"}. Pensar ou não, e com que profundidade, é decisão do próprio Claude, baseada em quão difícil a requisição parece. Entradas fáceis recebem resposta na hora, com o pensamento pulado; problemas difíceis recebem raciocínio profundo.

A migração seguiu o cronograma descrito na documentação "Extended thinking" da Anthropic: o budget_tokens foi descontinuado no Claude Opus 4.6 / Sonnet 4.6 (lá ainda funciona) e os modelos do Claude Opus 4.7 em diante o rejeitam com erro 400. Aponte um código antigo para um modelo novo e ele para com isto:

# Antigo: pensamento estendido (erro 400 no Opus 4.7 em diante)
"thinking": {"type": "enabled", "budget_tokens": 10000}
→ 400: "thinking.type.enabled" is not supported ...

# Novo: pensamento adaptativo (a profundidade se define via effort)
"thinking": {"type": "adaptive"},
"output_config": {"effort": "high"}

A reescrita em si é pequena — apagar o budget_tokens, trocar para adaptive e entregar o controle de profundidade ao effort. Mas, como a documentação avisa, trata-se de uma mudança de comportamento, não só de sintaxe. Com orçamento fixo, o Claude pensava em toda requisição; com o pensamento adaptativo, em níveis de effort mais baixos ele pode pular o pensamento por completo em entradas fáceis.

4. Como cada modelo lida com o pensamento, em uma tabela

A parte traiçoeira é que "vem ligado por padrão?" e "dá para desligar?" variam de modelo para modelo. Aqui está a documentação oficial condensada em uma tabela.

Modelo Se você não configurar nada Desligar o pensamento budget_tokens
Claude Fable 5 / Mythos 5 Pensamento ligado (sempre) Impossível (400) Impossível (400)
Claude Opus 5 Pensamento ligado (adaptativo) Só com effort high ou abaixo
Combinado com xhigh / max: 400
Impossível (400)
Claude Sonnet 5 Pensamento ligado (adaptativo) Permitido Impossível (400)
Claude Opus 4.8 / 4.7 Sem pensamento (ative com adaptive explícito) Permitido Impossível (400)
Claude Opus 4.6 / Sonnet 4.6 Sem pensamento (ative com adaptive explícito) Permitido Descontinuado (ainda funciona)
Sonnet 4.5 / Haiku 4.5 e anteriores Sem pensamento — (desligado já é o padrão) Obrigatório (único modo de pensamento; adaptive retorna 400)

Fonte: Anthropic, "Thinking" e "Extended thinking" (em agosto de 2026)

Duas coisas importam na prática. Primeira: o padrão virou "pensamento ligado" com a geração Opus 5 — se você rodava um job barato no Opus 4.8 com o pensamento desligado e troca só o ID do modelo, os tokens de saída crescem na fatia do pensamento, e as respostas passam a ser cortadas no max_tokens ou a conta sobe (tratamos disso em detalhe no nosso guia das mudanças incompatíveis do Opus 5). Segunda: só os modelos legados continuam usando budget_tokens — enquanto você ficar no Sonnet 4.5 ou anterior, não há nada para migrar; reescreva quando passar para um modelo mais novo.

5. A profundidade agora se ajusta com effort

Sem o "orçamento", a profundidade do pensamento passou a ser ajustada por output_config: {"effort": ...} — cinco níveis, low / medium / high / xhigh / max, com high como padrão da API. O effort molda mais do que a profundidade do pensamento: também afeta o quanto as chamadas de ferramenta são consolidadas e quanto preâmbulo você recebe, ou seja, o gasto total de tokens.

low / medium

Trabalho rotineiro, classificação, subagentes. Pode pular o pensamento em entradas fáceis = rápido e barato

high (padrão) a xhigh

high para o trabalho geral; xhigh é o ponto de partida que a Anthropic recomenda para programação e agentes

max

Para problemas em que acertar vale mais do que o custo. Nem sempre dá o melhor resultado, então não o deixe cravado

O que cada um dos cinco níveis significa, o slider do Claude Code e como as configurações persistem estão no nosso guia da configuração de effort. Uma nota de cache vinda da documentação: no modo adaptativo, o valor de effort é renderizado no prompt, então mudá-lo invalida o cache de prompt — o mesmo formato do "mudar o orçamento estoura o cache" da era do pensamento estendido. Não fique alternando no meio da conversa.

6. Você paga pelo pensamento mesmo sem vê-lo

Como o pensamento aparece do lado de fora é controlado pelo campo display. Ele aceita dois valores:

  • "summarized" — o bloco thinking traz um resumo legível do raciocínio. Padrão no Claude Opus 4.6 / Sonnet 4.6 e anteriores
  • "omitted" — o bloco thinking volta com uma string vazia dentro. Padrão no Fable 5 / Mythos 5 / Opus 5 / Sonnet 5 / Opus 4.8 / 4.7

Duas armadilhas moram aqui. Primeira: quanto mais novo o modelo, mais o padrão pende para "não mostrar" — mova para um modelo novo um app que transmitia o raciocínio aos usuários, e a experiência vira um longo silêncio seguido de uma resposta repentina. Se quiser visível, peça explicitamente: thinking: {"type": "adaptive", "display": "summarized"}. Segunda: o display muda só a visibilidade — a cobrança é idêntica. A documentação é explícita: com omitted você continua pagando pelos tokens de pensamento inteiros; o que você economiza é latência, não custo. E em nenhuma configuração você recebe a cadeia de raciocínio bruta — o que o summarized mostra é um resumo.

Para medir quanto o pensamento custa: o campo de resposta usage.output_tokens_details.thinking_tokens informa quantos dos tokens de saída cobrados foram raciocínio interno. No streaming, ele aparece só no evento message_delta final. "Não vejo o pensamento" nunca significa "ele não está acontecendo" — confira esse campo depois de migrar.

Mais uma coisa que importa na prática: o manuseio dos blocos de pensamento. Em conversas de múltiplos turnos e no uso de ferramentas, devolva os blocos de pensamento da resposta anterior completamente inalterados. Editá-los dispara um 400 — o erro "invalid signature in thinking block" que usuários do Claude Code encontram nasce exatamente desse mecanismo.

7. As armadilhas de desligar o pensamento

"Aqui o que importa é velocidade, vamos desligar o pensamento" é uma decisão legítima — mas no Opus 5 ela vem com condições. Segundo a documentação oficial:

✅ Permitido

Pensamento desligado + effort low / medium / high

❌ Erro 400

Pensamento desligado + effort xhigh / max (verificado a cada requisição)

🔧 Recomendado

Não desligue — em vez disso, abaixe o effort para low / medium

Mesmo quando a requisição passa, há efeitos colaterais. A Anthropic documenta que, com o pensamento desligado, o Opus 5 pode escrever chamadas de ferramenta como texto do corpo (a ferramenta nunca roda, embora o turno ainda pareça bem-sucedido) e pode vazar tags XML internas na saída. Se você constrói agentes, manter o pensamento ligado e abaixar o effort é o caminho seguro — e, de todo modo, corta custo mais ou menos na mesma direção.

8. Pensamento entre chamadas de ferramenta — interleaved thinking

O pensamento não acontece só "uma vez, antes da resposta". Com o pensamento intercalado (interleaved thinking), o Claude também raciocina entre as chamadas de ferramenta, pesando cada resultado antes de decidir o próximo passo — revisando o plano depois de ler resultados de busca, escolhendo o próximo comando depois de ler a saída do anterior. É a engrenagem por trás do bom comportamento agêntico.

Aqui também há uma diferença de geração. No velho mundo do pensamento estendido, isso exigia o header beta interleaved-thinking-2025-05-14; com o pensamento adaptativo, é automático e o header é desnecessário (a documentação afirma que "o pensamento adaptativo intercala automaticamente" e diz que o header pode ser removido depois da migração). Migrar para o pensamento adaptativo simplifica seu código em mais uma configuração.

9. Quando você precisa de velocidade: fast mode

Se você quer a qualidade do pensamento com menos espera, a opção é o fast mode. Segundo a documentação do Claude Code sobre o fast mode, isso não é um rebaixamento para outro modelo: é o mesmo Claude Opus rodando em uma configuração que prioriza velocidade. A saída fica até cerca de 2,5x mais rápida e o preço dobra ($10 de entrada / $50 de saída por milhão de tokens, tanto no Opus 5 quanto no Opus 4.8). Está disponível só no Opus 5 e no Opus 4.8; o fast mode do Opus 4.7 foi removido em 24 de julho de 2026.

No Claude Code: /fast

Digite /fast no CLI para alternar (a extensão do VS Code não oferece suporte). A orientação oficial: ligado para iteração rápida interativa, desligado quando o custo pesa mais que a latência.

Na API: research preview

Só na API do Claude — não está disponível no Amazon Bedrock, no Google Cloud nem no Microsoft Foundry. Note também que alternar a velocidade invalida o cache de prompt.

Pensamento, effort e fast mode cumprem papéis diferentes: pensamento = o mecanismo que decide se há raciocínio, effort = com que profundidade raciocinar, fast mode = com que rapidez o mesmo raciocínio é entregue. Antes de partir para o "está lento, mate o pensamento", lembre que você tem outras duas cartas na mão: abaixar o effort ou ligar o fast mode.

Resumo

  • O pensamento estendido (budget_tokens) é o jeito antigo. Descontinuado no Opus 4.6 / Sonnet 4.6, erro 400 do Opus 4.7 em diante — e ainda o único modo de pensamento nos modelos legados (Sonnet 4.5 / Haiku 4.5 etc.)
  • O pensamento adaptativo é o jeito atual. O modelo decide se pensa e quanto; a profundidade se ajusta com effort (cinco níveis, padrão high)
  • Opus 5 / Sonnet 5 / Fable 5 vêm com o pensamento ligado por padrão. O Fable 5 não permite desligar; o Opus 5, só com effort high ou abaixo
  • Você paga pelo pensamento mesmo quando ele é invisível. O padrão da nova geração é display: "omitted" (blocos de pensamento vazios). Meça com usage.output_tokens_details.thinking_tokens
  • Desligar o pensamento tem efeitos colaterais (chamadas de ferramenta como texto, vazamento de tags). Abaixar o effort é mais seguro do que desativar
  • O pensamento intercalado é automático no adaptativo — o header beta não é mais necessário
  • Precisa de velocidade? Fast mode (cerca de 2,5x, preço 2x, Opus 5/4.8; alterne com /fast no Claude Code)

FAQ

Q. Defini budget_tokens e recebi um erro 400.

A. Os modelos do Opus 4.7 em diante (incluindo Opus 5 / Sonnet 5 / Fable 5) não aceitam thinking: {"type": "enabled", "budget_tokens": N}. Reescreva como thinking: {"type": "adaptive"} e controle a profundidade com output_config: {"effort": ...}. Se você permanecer em modelos legados como Sonnet 4.5 / Haiku 4.5, não é preciso reescrever nada.

Q. Depois de mudar para o pensamento adaptativo, as respostas são cortadas no meio da frase.

A. Os tokens de pensamento contam para o max_tokens. O Opus 5, em particular, vem com o pensamento ligado por padrão, então um código que dimensionava o max_tokens no limite justo para um modelo antigo agora perde orçamento para o pensamento e trunca a resposta. Dê mais folga ao max_tokens ou abaixe o effort.

Q. Os blocos de pensamento voltam vazios. Algo quebrou?

A. É a especificação. No Opus 5 / Sonnet 5 / Fable 5 / Opus 4.8 / 4.7, o padrão do display é "omitted" (blocos de pensamento vazios). Para ver o resumo, defina explicitamente thinking: {"type": "adaptive", "display": "summarized"}. A cobrança é idêntica nos dois casos.

Q. Se eu desligar o pensamento, economizo esse dinheiro?

A. Você economiza os próprios tokens de pensamento. Mas no Opus 5 isso não pode ser combinado com effort xhigh/max (erro 400) e, mesmo quando funciona, a Anthropic documenta efeitos colaterais: chamadas de ferramenta escritas como texto comum e tags internas vazando na saída. Para cargas de agente, manter o pensamento ligado e baixar o effort para low / medium corta custo com mais segurança.

Q. Preciso configurar o pensamento no Claude Code (ou nos apps de chat)?

A. Não — o Claude Code e o claude.ai gerenciam o pensamento por você, então não há parâmetros de API para definir. O que fica ao seu alcance é a configuração de effort e o /fast (o alternador do fast mode); a mecânica de ligar/desligar o pensamento nunca aparece.

Observação: as especificações e os números deste artigo se baseiam na documentação da Anthropic "Thinking", em "Extended thinking" e na documentação do Claude Code "Fast mode" (todas em agosto de 2026). Especificações mudam; confira a redação atual nos documentos oficiais antes de construir em cima delas.