Conteúdo
- 1. Por que sua conta de IA infla silenciosamente
- 2. Decomposição de custo — entrada, saída, cache, batch
- 3. Escolha do plano e seu impacto na economia
- 4. Prompt caching — a alavanca que mais rende
- 5. Gestão de contexto — /compact e divisão
- 6. Seleção de modelo — roteamento por tarefa
- 7. Gerenciando seu orçamento de saída
- 8. Processamento em lote — metade do preço para o que pode esperar
- 9. A armadilha multiagente — 15x tokens
- 10. Monitoramento e alertas de cobrança
- 11. Sete padrões comuns de desperdício
- Resumo
- FAQ
- Correções à versão anterior
Atualizado em 26 de setembro de 2026: removemos os números do título e do gráfico de abertura — "comprimir para 20-30% do custo não otimizado", "-60 a 90% com cache", "US$ 30 mil/mês caindo para US$ 6-9 mil", "oito em cada dez trabalhos ficam bem com um modelo mais barato" — porque não tínhamos como indicar a fonte. No lugar deles entram exemplos que dá para calcular com os preços unitários e multiplicadores das páginas oficiais de preços da Anthropic e da OpenAI, com a fórmula à vista. Também corrigimos o ponto de equilíbrio do cache (com 5 minutos, uma leitura já compensa; com 1 hora, duas) e o preço da saída (5x a entrada), e acrescentamos um capítulo sobre processamento em lote. As mudanças estão resumidas no fim do artigo.
Ao passar de um plano de preço fixo como o ChatGPT Plus (US$ 20 por mês) para a cobrança por token — o Claude Code com chave de API, ou um app de IA feito por você —, sua conta pode mudar de ordem de grandeza conforme o uso. Cobrança por uso não tem teto.
A boa notícia é que as medidas que mais pesam se resumem a três: prompt caching, escolha de modelo e orçamento de saída. O efeito de cada uma é definido por multiplicadores publicados nas tabelas de preços oficiais, então dá para calculá-lo para o seu próprio uso. Este artigo usa a documentação oficial da Anthropic e da OpenAI para mostrar esses multiplicadores e como fazer as contas.
A economia se calcula com os preços oficiais
— pelas tabelas de preços oficiais da Anthropic e da OpenAI em 26 de setembro de 2026
Exemplo: envie ao Opus 5.5 o mesmo prefixo de 100 mil tokens dez vezes, com menos de 5 minutos entre uma e outra, e o custo de entrada vai de US$ 4,00 sem cache para US$ 0,68 com o cache de 5 minutos (uma gravação, US$ 0,50, mais nove leituras, US$ 0,18).
O que pode esperar custa metade, na entrada e na saída, pela API de lote — e os multiplicadores do cache se somam.
Fontes: Claude Platform Docs, "Pricing" e OpenAI API Pricing (consultado em 26 de setembro de 2026; cálculos nossos)
1. Por que sua conta de IA infla silenciosamente
As ferramentas de IA vêm em duas trilhas de cobrança: planos pessoais (taxa fixa) e cobrança por API (baseada em uso). A conta que explode é principalmente a segunda.
- Planos pessoais: ChatGPT Plus US$ 20/mês, Claude Pro US$ 20/mês (US$ 17/mês no plano anual), Max a partir de US$ 100/mês. Custo fixo, então mesmo o uso intenso tem teto (com limites de uso).
- Cobrança por API: por token, baseada em uso. Aqui entram o Claude Code com chave de API e os apps de IA que você mesmo desenvolve. O total do mês pode variar muito conforme o uso.
A cobrança por uso incha porque (1) tokens de saída custam 5x os de entrada, (2) quanto mais cresce seu contexto, mais você reenvia por inteiro a cada requisição, (3) subagentes são invocados repetidas vezes nos bastidores e (4) quando algo entra em loop, não para — esses fatores se somam. Quando você entende a mecânica, todos eles têm conserto.
2. Decomposição de custo — entrada, saída, cache, batch
Usando como exemplo os preços da API do Claude Opus (Opus 5.5 em setembro de 2026; fica abaixo do Fable, o topo da linha, e é o nível que a Anthropic recomenda como ponto de partida), eis para onde vai o dinheiro.
| Item | Preço unitário (por 1M tokens) | Descrição |
|---|---|---|
| Tokens de entrada | US$ 4 | O que você envia: prompt + histórico da conversa + arquivos, etc. |
| Tokens de saída | US$ 20 | O que a IA retorna. 5x a entrada. |
| Gravação no cache (5 min) | US$ 5 (1,25x a entrada) | Guardar um prefixo no cache. Cada leitura dentro de 5 minutos o prolonga sem custo extra. |
| Gravação no cache (1 h) | US$ 8 (2x a entrada) | Resiste a intervalos de mais de 5 minutos, com uma gravação mais cara. |
| Leitura do cache | US$ 0,20 (0,05x a entrada) | 0,1x na maioria dos modelos, 0,05x no Opus 5.5. Esta é a estrela do show da economia. |
| Processamento em lote | Entrada US$ 2, saída US$ 10 (metade do preço) | Processa de forma assíncrona as requisições que podem esperar. Soma-se aos multiplicadores do cache. |
| Chamadas de ferramentas | Contam como entrada | As definições das ferramentas fazem parte do contexto. Passar qualquer ferramenta também acrescenta um system prompt de uso de ferramentas (286 tokens no Opus 5.5). |
Em resumo, um prefixo que está no cache é lido por um décimo do preço de entrada ou menos. Os multiplicadores de gravação (1,25x para 5 minutos, 2x para 1 hora) e a saída a 5x a entrada são iguais em todos os modelos atuais do Claude; só o multiplicador de leitura muda conforme o modelo (0,025x no Fable 5.1). Vale lembrar também que o Claude Opus 4.7 e posteriores usam um tokenizador novo que, segundo a Anthropic, gera cerca de 30% mais tokens para o mesmo texto — algo a considerar ao comparar preços entre gerações. Fonte: Claude Platform Docs, "Pricing" (consultado em 26 de setembro de 2026).
3. Escolha do plano e seu impacto na economia
No momento em que você consegue prever como vai usar, troque para o plano certo primeiro.
| Uso | Plano recomendado | Meta mensal | Ressalvas |
|---|---|---|---|
| Hobby, aprendizado, algumas vezes por semana | Claude Free / ChatGPT Free | US$ 0 | Limites de uso; não use com dados de trabalho. |
| Pessoal, algumas horas por dia | Claude Pro / ChatGPT Plus | US$ 20 | Plano pessoal; não use com dados de trabalho. |
| Uso pessoal intenso | Claude Max | A partir de US$ 100 | 5x ou 20x o uso do Pro; para quem roda o Claude Code por horas. |
| Trabalho em equipe | Claude Team / ChatGPT Business | Assento padrão do Claude Team: US$ 20 (anual) a US$ 25/usuário | OK para dados de trabalho; dados não são usados para treinamento. |
| Grande organização | Enterprise | Cotação comercial | SSO, logs de auditoria, SLA. |
| Desenvolvimento com IA embutida | API direta (Anthropic / OpenAI) | Baseado em uso | Use cache e batch. |
Fontes: página de preços do Claude e OpenAI Help, "What is ChatGPT Plus?" (consultado em 26 de setembro de 2026).
Se você usa o Claude Code muitas horas por dia e bate com frequência nos limites do Pro, considere o plano Max. Como o preço é fixo, a conta não dispara como pode acontecer com uma chave de API. O Cursor começa em US$ 20 por mês no plano individual Pro, com Pro+ e Ultra acima.
4. Prompt caching — a alavanca que mais rende
Se você chama a API diretamente e reenvia o mesmo prefixo repetidas vezes, quase não há motivo para não usar prompt caching. O que é lido do cache é cobrado a uma pequena fração do preço base de entrada.
Como funciona
Quando você reutiliza o mesmo system prompt ou os mesmos documentos em várias requisições, a primeira chamada os grava no cache (1,25x a entrada no cache de 5 minutos). Cada chamada seguinte lê do cache a 0,1x a entrada (0,05x no Opus 5.5 e 0,025x no Fable 5.1). Mas um prefixo curto demais não vai para o cache: o mínimo é de 512 tokens no Opus 5.5, 1.024 no Sonnet 5 e 4.096 no Haiku 4.5 (Claude Platform Docs, "Prompt caching").
Ponto de equilíbrio — uma leitura no cache de 5 minutos, duas no de 1 hora
Tomando o preço de entrada como 1, compare o custo de enviar o mesmo prefixo (calculado com os multiplicadores oficiais da Anthropic):
- Cache de 5 minutos: gravação 1,25 + uma leitura 0,1 = 1,35. Enviar duas vezes sem cache custa 2, então uma única leitura já compensa.
- Cache de 1 hora: gravação 2 + duas leituras 0,2 = 2,2. Enviar três vezes sem cache custa 3, então duas leituras compensam (com só uma leitura fica 2,1, um pouco acima dos 2 sem cache).
A página de preços da Anthropic diz o mesmo: o cache se paga após uma leitura na duração de 5 minutos e após duas na de 1 hora. O Opus 5.5 lê a 0,05x, então a diferença cresce ainda mais com o mesmo número de leituras.
Exemplo — um prefixo de 100 mil tokens enviado 10 vezes
| Modelo | Sem cache | Cache de 5 minutos | Diferença |
|---|---|---|---|
| Claude Opus 5.5 (entrada US$ 4, gravação US$ 5, leitura US$ 0,20) | 0,1 × US$ 4 × 10 = US$ 4,00 | 0,1 × US$ 5 + 0,1 × US$ 0,20 × 9 = US$ 0,68 | Cerca de 83% a menos |
| Claude Sonnet 5 (entrada US$ 2, gravação US$ 2,50, leitura US$ 0,20) | 0,1 × US$ 2 × 10 = US$ 2,00 | 0,1 × US$ 2,50 + 0,1 × US$ 0,20 × 9 = US$ 0,43 | Cerca de 79% a menos |
Conta apenas a entrada do prefixo (system prompt, documentos de referência etc.); 100 mil tokens = 0,1 em unidades de um milhão. Supõe que as dez requisições chegam com menos de 5 minutos de intervalo, que a primeira grava o cache e as outras nove o leem. Preços de Claude Platform Docs, "Pricing" (consultado em 26 de setembro de 2026). Não inclui a saída nem a parte de cada requisição que muda.
Os modelos GPT-6 da OpenAI funcionam de modo parecido. A entrada em cache custa 0,1x e a gravação 1,25x, e o guia da OpenAI faz a mesma conta: gravar um prefixo uma vez e reutilizá-lo uma vez custa 1,35x, contra 2x para processá-lo duas vezes sem cache. O cache dura 30 minutos a partir do último uso e vem ativado por padrão nos modelos compatíveis (OpenAI, "Prompt caching").
A validade padrão é de 5 minutos
Na API da Anthropic, a validade (TTL) do prompt cache é de 5 minutos por padrão. Cada leitura a renova sem custo extra, mas depois de um intervalo de mais de 5 minutos ela expira e a próxima requisição grava tudo de novo (1,25x a entrada). Dá para escolher a validade de 1 hora, mas aí a gravação custa 2x a entrada (fonte: Claude Platform Docs, "Prompt caching").
O Claude Code roda sobre o mesmo mecanismo. Dentro do uso incluído numa assinatura do Claude, ele dá à conversa principal a validade de 1 hora, mas com uma chave de API, ou quando você passa do limite do plano e entra nos créditos de uso, ela cai para 5 minutos. A partir da v2.1.242 você mesmo escolhe 5m ou 1h com a configuração promptCacheTtl (fonte: Claude Code Docs, "Prompt caching", consultado em 26 de setembro de 2026). Se você trabalha com pausas, qual das duas vale muda quantas vezes o cache é regravado.
Como escolher entre 5 minutos e 1 hora
A orientação da documentação oficial:
- Prefixo reutilizado com frequência maior que a cada 5 minutos: fique no cache de 5 minutos. Cada leitura o renova de graça, então você não precisa da gravação mais cara de 1 hora.
- Prefixo reutilizado com intervalos de 5 minutos a uma hora (esperando a resposta de um usuário, uma chamada que vem depois de uma tarefa de mais de 5 minutos): o cache de 1 hora é o adequado.
- Misturando os dois: coloque o cache de 1 hora antes do de 5 minutos — a mesma ordem de pôr primeiro o system prompt e as definições de ferramentas, que não mudam.
Para confirmar que o cache está funcionando, veja cache_read_input_tokens (leituras) e cache_creation_input_tokens (gravações) no usage da resposta. Se as leituras continuam em zero, o prefixo muda em algum ponto a cada requisição ou não chega ao mínimo de tokens.
5. Gestão de contexto — /compact e divisão
Use o Claude Code ou o Cursor por um tempo e, no meio de uma conversa longa, você se vê reenviando a cada turno uma grande quantidade de conversa passada. Não é a saída que incha — é a entrada (= conversa passada).
Tática 1: use ativamente o /compact
O Claude Code tem um comando /compact. Ele resume a conversa até ali para liberar contexto (Claude Code Docs, "Commands"), e você pode dizer o que o resumo deve manter. Use-o nas pausas naturais do trabalho.
Tática 2: divida sessões por tarefa
Não faça "implementar Funcionalidade A", "corrigir Bug B" e "gerar Doc C" em uma única conversa longa — comece sessões novas. Feche a sessão quando cada tarefa terminar. Se precisa de memória de longo prazo, escreva em um arquivo de memória.
Tática 3: corte ruído com Hooks
O Claude Agent SDK / Claude Code oferecem Hooks, que permitem transformar a saída da ferramenta antes que ela chegue à IA. Exemplo: comprimir um log longo de npm install para apenas "sucesso/falha" via Hook. Quanto mais longo o log, mais leve fica a entrada de cada turno.
6. Seleção de modelo — roteamento por tarefa
"Sempre Opus" é estratégia de milionário. Trabalho rotineiro, como classificar e extrair, costuma ir bem com Sonnet ou Haiku. O preço é definido pelo nível do modelo (alto, intermediário, leve); os preços oficiais em 26 de setembro de 2026 (por milhão de tokens) são estes. Entre as versões, a relação — quanto mais alto o nível, mais caro, e o nível leve custa uma fração do alto — não mudou.
| Modelo | Entrada | Saída | Melhor em |
|---|---|---|---|
| Claude Opus 5.5 (alto) | US$ 4 | US$ 20 | Design complexo, raciocínio, tarefas autônomas longas |
| Claude Sonnet 5 (intermediário) | US$ 2 | US$ 10 | Codificação diária, análise, sumarização |
| Claude Haiku 4.5 (leve) | US$ 1 | US$ 5 | Classificação, extração, conversão curta, resposta em tempo real |
| GPT-6 Sol (modelo equilibrado da OpenAI) | US$ 2 | US$ 10 | Programação complexa e trabalho agêntico |
| GPT-6 Luna (modelo de baixo custo da OpenAI) | US$ 0,10 | US$ 0,50 | Trabalho leve, focado e em grande volume |
Fontes: Claude Platform Docs, "Pricing" e OpenAI API Pricing (consultado em 26 de setembro de 2026; preços da OpenAI para contexto curto). Acima deles estão o Fable 5.1 da Anthropic (US$ 10 / US$ 50) e o carro-chefe da OpenAI, GPT-6 Astra (US$ 10 / US$ 50). Os modelos atuais de cada empresa estão na lista de modelos atuais e datas de corte.
Trocar o Opus, de nível alto, pelo leve Haiku reduz o preço por token a um quarto (em setembro de 2026). Para um trabalho de classificação que consome 2 milhões de tokens de entrada e 200 mil de saída por dia, os preços oficiais dão:
- Opus 5.5: 2 × US$ 4 + 0,2 × US$ 20 = US$ 12
- Sonnet 5: 2 × US$ 2 + 0,2 × US$ 10 = US$ 6
- Haiku 4.5: 2 × US$ 1 + 0,2 × US$ 5 = US$ 3
- Haiku 4.5 em lote: US$ 3 × 0,5 = US$ 1,50 (capítulo 8)
Se a qualidade se mantém depende do trabalho, então compare os resultados com a mesma entrada antes de trocar por um modelo mais barato (FAQ, Q4). Critérios de referência:
- Use Opus para: refatorações complexas, designs que abrangem muitos arquivos, raciocínio profundo, exploração de domínio desconhecido
- Use Sonnet para: codificação diária, análise, sumarização, revisão, adicionar testes
- Use Haiku para: classificação, extração, conversão de formato, sugestões em tempo real, geração de mensagens de commit
7. Gerenciando seu orçamento de saída
Tokens de saída custam 5x os de entrada — tanto nos modelos atuais do Claude quanto no GPT-6 Astra, Sol e Luna. Uma resposta do Opus 5.5 com 2.000 tokens de entrada e 1.000 de saída custa US$ 0,008 + US$ 0,020 = US$ 0,028. Limite a saída a 500 tokens e fica em US$ 0,018, cerca de 36% a menos (calculado com os preços oficiais).
Três abordagens
- Ajuste
max_tokensà tarefa: na Messages API da Anthropic,max_tokensé um parâmetro obrigatório, e o número que você coloca ali é o teto da saída (referência da API, "Messages"). Não deixe um valor grande por inércia; use um que caiba no uso, comomax_tokens: 1000. - Adicione "responda de forma breve" ou "cinco bullets" ao seu prompt: a IA escuta. Suprima introduções, resumos e despedidas redundantes.
- Saída estruturada (modo JSON): JSON é mais curto que prosa. Se seu app consome o resultado, é o caminho.
Para situações em que você não precisa de uma "resposta longa e bonita" (classificação, extração, decisões), cortar com firmeza acaba sendo mais eficiente em custo.
8. Processamento em lote — metade do preço para o que pode esperar
O trabalho que não precisa de resposta imediata — classificação em massa durante a noite, resumos em bloco, rodadas de avaliação — custa metade, na entrada e na saída, por uma API de lote. A Message Batches API da Anthropic aceita até 100 mil requisições por lote; a maioria termina em menos de uma hora, mas um lote pode levar até 24 horas (Claude Platform Docs, "Batch processing"). A Batch API da OpenAI também dá 50% de desconto, com prazo de conclusão de 24 horas (OpenAI, "Batch API").
Segundo a página de preços da Anthropic, os multiplicadores do cache se somam ao desconto de lote. Uma leitura de cache no Haiku 4.5 dentro de um lote, por exemplo, sai por US$ 1 × 0,1 × 0,5 = US$ 0,05 por milhão de tokens.
9. A armadilha multiagente — 15x tokens
A tendência de 2026, configurações multiagente (orquestrador + subagentes paralelos), é poderosa, mas a Anthropic publicou dados do seu próprio recurso Research: agentes usam cerca de 4x os tokens de um chat comum, e sistemas multiagente cerca de 15x (Anthropic, "How we built our multi-agent research system", junho de 2025). O 15x é medido contra o chat, não contra um único agente.
Critérios de decisão para economia
- Tarefas claras e sequenciais (edição de um arquivo, sumarização, revisão de código) → um único agente basta
- Paralelismo que reduz tempo total de forma significativa → multiagente se justifica
- "Multiagente por padrão" é economicamente errado. Comece com um único agente e divida apenas os gargalos que você realmente consegue ver.
Detalhes: veja O que é um multiagente?
10. Monitoramento e alertas de cobrança
Para que uma conta por uso não te pegue de surpresa, monitoramento rotineiro + alertas são indispensáveis.
Usuários de API
- Verifique o consumo diário de tokens no Claude Console / OpenAI Dashboard
- Defina um limite de uso: parar ao exceder US$ 200/mês, por exemplo. Sem limite = perigo.
- Alertas de cobrança: e-mail em US$ 50, Slack em US$ 100 — limiares escalonados.
Usuários do Claude Code
- Use
/usagepara verificar o custo da sessão atual e o uso do seu plano (/costagora é um alias de/usage) - Faça do hábito verificar
/usageao final de cada dia
Administradores de organização
- Relatórios de uso por usuário (console de admin do Anthropic Team / Enterprise)
- Detecção de anomalias (sinalize quem consome muito mais do que o normal)
- Compartilhamento trimestral em toda a empresa de "padrões de desperdício"
11. Sete padrões comuns de desperdício
| Padrão | O que está errado | Correção |
|---|---|---|
| Reanexar todos os arquivos a cada turno | O cache não entra; a entrada incha | Ponha os documentos imutáveis no prefixo e use cache |
| Fazer a mesma pergunta no ChatGPT e no Claude | Pagando duas vezes pela mesma entrada em planos separados | Escolha um |
Continuar uma conversa longa sem /compact | Histórico inteiro enviado a cada turno | /compact nas pausas naturais |
| Usar Opus para classificação ou extração simples | Pagando 4x o que o Haiku custa pelo mesmo resultado | Combine modelo e tarefa |
| Repetir "mais polido" / "um pouco mais longo" | Tokens de saída se acumulam | Indique o tamanho desejado de antemão |
| Definir muitas ferramentas desnecessárias | Definições de ferramentas viajam no contexto | Defina apenas o que vai usar |
| Apelar para multiagente sem critério | Cerca de 15x os tokens de um chat (um agente sozinho, cerca de 4x) | Apenas quando há necessidade clara |
Resumo
- As três alavancas da otimização de custo de IA: prompt caching, escolha de modelo, orçamento de saída. O efeito de cada uma é definido por multiplicadores oficiais, e os multiplicadores se combinam.
- Leitura do cache = 0,1x a entrada (0,05x no Opus 5.5). O cache de 5 minutos se paga após uma leitura; o de 1 hora, após duas. Um prefixo de 100 mil tokens enviado dez vezes ao Opus 5.5 vai de US$ 4,00 para US$ 0,68.
- Escolha de modelo: do Opus 5.5 para o Haiku 4.5, o preço por token cai a um quarto; com o Sonnet 5, à metade (em setembro de 2026).
- Orçamento de saída: a saída custa 5x a entrada. Defina
max_tokensexplicitamente e peça "breve". - Processamento em lote: o que pode esperar custa metade na entrada e na saída, e se soma ao desconto do cache.
- Gestão de contexto:
/compactnas pausas naturais, divida por tarefa, comprima saída com Hooks. - Armadilha multiagente: cerca de 15x os tokens de um chat. Use apenas com necessidade clara.
- Monitoramento: limites de uso, alertas de cobrança e checagem de
/usagedevem todos virar hábito.
FAQ
Q1. Uso o Claude Code diariamente — Pro (US$ 20) ou Max, qual vale mais a pena?
Se você bate com frequência nos limites do Pro, considere o Max. A central de ajuda da Anthropic orienta usuários Pro que batem nos limites com frequência e precisam de mais capacidade para repositórios grandes a considerar o Max 5x (Claude Help Center, "Using Claude Code with your Pro or Max plan"). Se não chega aos limites, fique no Pro.
Q2. Preciso de configuração especial para usar prompt caching?
Na API da Anthropic é preciso especificar cache_control — uma vez no nível superior da requisição (cache automático) ou em blocos específicos (pontos de quebra explícitos). Na OpenAI ele vem ativado por padrão nos modelos compatíveis. O Claude Code usa o cache automaticamente. Veja a documentação oficial da Anthropic para detalhes.
Q3. ChatGPT vs. Claude — qual é mais eficiente em custo?
Depende do caso de uso. Só pelo preço unitário, o Claude Sonnet 5, de nível intermediário, e o GPT-6 Sol empatam: US$ 2 de entrada e US$ 10 de saída. Para perguntas e respostas curtas e tarefas rotineiras em grande volume, o modelo de baixo custo da OpenAI (GPT-6 Luna em setembro de 2026, US$ 0,10 de entrada) custa um décimo do Haiku 4.5 (US$ 1 de entrada). Em trabalhos longos que reenviam o mesmo prefixo, as leituras de cache pesam, e isso coloca o Opus 5.5 (0,05x) também na disputa. "Assinar os dois e escolher a ferramenta certa" também é prático.
Q4. Como julgo "Haiku é suficiente"?
Faça um experimento de três passos. (1) Faça funcionar no Opus. (2) Envie o mesmo prompt para o Sonnet e compare a qualidade. (3) Se o Sonnet parece comparável, teste o Haiku também. Quanto mais rotineira a tarefa, menor costuma ser a diferença. Reserve Opus para casos que realmente precisam de julgamento ou raciocínio profundo.
Q5. Usuários individuais devem chamar a API diretamente?
Depende. Se o seu uso é principalmente codificação interativa, o plano Max mantém a conta fixa e é mais cômodo. Para embutir IA em seu próprio app, processamento em lote ou automação, você precisa da API direta. Muita gente faz os dois.
Q6. Que limiar devo definir para alertas de cobrança?
Não há resposta única, mas uma forma de escalonar é um primeiro alerta em 1,5x seu gasto mensal típico e uma parada em 3x. Se você costuma gastar US$ 30/mês, alerte em US$ 50 e pare em US$ 100. No início, use alertas diários pequenos para pegar o jeito do seu consumo e depois afrouxe.
Q7. Nos disseram que "o orçamento de IA da empresa cresceu demais." O que fazer primeiro?
Três coisas em ordem. (1) Olhe o uso por usuário e veja onde o consumo se concentra. (2) Converse com quem mais consome sobre o fluxo de trabalho e identifique padrões de desperdício. (3) Distribua um guia interno sobre "cache, escolha de modelo, orçamento de saída" em toda a empresa e relate o progresso mensalmente.
Correções à versão anterior
Em 26 de setembro de 2026 corrigimos o seguinte.
| Versão anterior | Agora |
|---|---|
| Três alavancas comprimem o custo para 20-30% do não otimizado (título, abertura, imagem) | Removido por não termos como citar a fonte. Substituído por exemplos calculados com preços e multiplicadores oficiais. |
| -60 a 90% com cache, -50 a 80% com escolha de modelo, -30 a 60% com orçamento de saída, US$ 30 mil/mês caindo para US$ 6-9 mil | Idem. Substituído por exemplos como "um prefixo de 100 mil tokens enviado dez vezes: US$ 4,00 → US$ 0,68". |
| Oito em cada dez trabalhos ficam bem com um modelo mais barato | Removido; sem fonte. |
| O cache de 5 minutos compensa com duas leituras | Compensa com uma leitura (gravação 1,25 + leitura 0,1 = 1,35 < 2). |
| O cache de 1 hora compensa com cinco leituras | Compensa com duas leituras (2 + 0,2 = 2,2 < 3). |
| Tokens de saída custam 5-6x mais que os de entrada | 5x (em todos os modelos atuais do Claude e nos três do GPT-6). |
| Taxa de acerto de cache abaixo de 60% deixa espaço; em produção, mire 80%+ | Removido; sem fonte. Substituído por conferir os tokens de leitura e gravação em usage. |
/compact encolhe 200 mil tokens para 5 mil | Números removidos; sem fonte. |