Pensamento adaptativo vs estendido no Claude: o que mudou
O jeito de pensar do Claude passou por uma troca de geração. O antigo pensamento estendido (extended thinking) exigia que você especificasse um orçamento de tokens em cada requisição — thinking: {"type": "enabled", "budget_tokens": N} —, mas o orçamento certo muda de tarefa para tarefa, não dá para adivinhá-lo de antemão, e alterá-lo invalida o cache de prompt. O pensamento adaptativo atual é uma única linha, type: "adaptive": pensar ou não, e com que profundidade, é decisão do próprio modelo com base em quão difícil a requisição parece. A migração foi escalonada: budget_tokens foi descontinuado no Opus 4.6 / Sonnet 4.6 e é rejeitado com erro 400 do Opus 4.7 em diante. Este artigo condensa as regras por modelo em uma tabela — o Fable 5 pensa sempre (não dá para desligar), Opus 5 e Sonnet 5 vêm com o pensamento ligado por padrão (no Opus 5, desligar só é permitido com effort high ou abaixo), Opus 4.8 / 4.7 exigem adaptive explícito, e modelos legados como Sonnet 4.5 / Haiku 4.5 ainda usam budget_tokens como único modo. O controle de profundidade passou para output_config: {"effort": ...}, com cinco níveis (padrão high), e mudar o effort estoura o cache do mesmo jeito que mudar o orçamento estourava. A visibilidade é governada por display: o padrão da nova geração é "omitted" (blocos de pensamento vazios), e você paga pelos tokens de pensamento inteiros de qualquer forma — meça com usage.output_tokens_details.thinking_tokens; nenhuma configuração devolve a cadeia de raciocínio bruta. Desligar o pensamento no Opus 5 tem efeitos colaterais documentados (chamadas de ferramenta escritas como texto comum, tags internas vazando na saída), então abaixar o effort é a alavanca de custo mais segura. O pensamento intercalado — raciocinar entre as chamadas de ferramenta — é automático no adaptativo, sem o velho header beta. E, quando a velocidade importa, o fast mode roda o mesmo Opus a cerca de 2,5x pelo dobro do preço (só Opus 5/4.8, alternado com /fast no Claude Code). Tudo se apoia na documentação oficial da Anthropic: Thinking, Extended thinking e Fast mode.