Índice
- 1. Suporte a 1M virou regra — mas "ler até o fim" é outra história
- 2. O que é contexto? — Separe o recipiente do conteúdo
- 3. O tamanho do recipiente se lê em três números
- 4. Três razões pelas quais "maior é melhor" não se sustenta
- 5. A armadilha de custo — modelos cuja tarifa dispara com entradas longas e modelos cuja tarifa não muda
- 6. Cinco táticas de economia — ranqueadas por impacto real para devs solo
- Resumo
- FAQ
Em 2023, uma janela de contexto de 32K tokens parecia "espaçosa". Hoje, uma janela na classe de 1 milhão de tokens (1M) já é pressuposto nos modelos de ponta. Em setembro de 2026, Anthropic, OpenAI e Google publicam nas especificações oficiais dos seus modelos de topo um limite de entrada de cerca de um milhão de tokens. Os nomes e números específicos mudam a cada lançamento, então deixo isso para a lista de modelos atuais e datas de corte e para as páginas oficiais de cada fornecedor. Este artigo foca no que sobrevive a uma troca de geração: como ler os números e como trabalhar com eles.
"Um milhão de tokens" se traduz aproximadamente em 8 a 10 livros de bolso em inglês, ou dezenas de milhares de linhas de código-fonte. Agora podemos manter tudo isso "à vista" em uma única sessão. Mas um documento caber no recipiente não é o mesmo que o modelo ler tudo. As pontuações que a OpenAI publica no seu benchmark multi-agulha de contexto longo (MRCR) mostram que o mesmo modelo pontua menos quanto mais longa é a entrada, e o tamanho da queda varia muito por modelo e geração (tratado no §1 e no §4).
Vou adiantar minha opinião: a era de escolher um modelo apenas pelo tamanho do recipiente acabou. O que importa é o trio "contexto efetivo × custo × forma de alimentar". Este artigo percorre o que é contexto de fato, como ler uma ficha técnica, por que tamanho não basta, como medir o alcance efetivo no seu próprio caso de uso, como o preço dispara com entradas longas e cinco táticas de economia que devs solo e equipes pequenas podem aplicar hoje — com números oficiais e dados de benchmarks publicados.
Em três anos, o recipiente cresceu 250 vezes
— Linha do tempo de como 1M passou de luxo a ponto de partida
Mas "suportar" e "ler até o fim" são coisas diferentes. No MRCR (8 agulhas), o benchmark de contexto longo da OpenAI, o GPT-5.5 vai de 98,1% em 4K–8K para 74,0% em 512K–1M.
O tamanho da queda depende do modelo e da geração (tabela de avaliação de "Introducing GPT-5.5", da OpenAI, 23 de abril de 2026; detalhes no §1 e no §4).
1. Suporte a 1M virou regra — mas "ler até o fim" é outra história
O suporte a 1M se espalhou rápido nos últimos dois anos. Em abril de 2025, o GPT-4.1 da OpenAI saiu com cerca de 1,05 milhão de tokens; em agosto de 2025, o Claude Sonnet 4 da Anthropic chegou a 1 milhão (em beta); e em setembro de 2026 os modelos de topo de Anthropic, OpenAI e Google publicam cerca de um milhão de tokens nas especificações oficiais. Em 2023, 32K parecia espaçoso — são mais de 30 vezes em apenas três anos. A corrida pelo tamanho do recipiente parecia encerrada.
Mas, olhando as pontuações de contexto longo que os próprios fornecedores publicam, o quadro fica mais complicado. O benchmark com resultados completos por comprimento é o MRCR v2 (8 agulhas) da OpenAI. Ele esconde oito pedidos do mesmo tipo — por exemplo, "escreva um poema sobre antas" — numa conversa longa com uma IA e depois pede exatamente um deles, como "devolva o 2º poema". Como o modelo precisa distinguir itens quase idênticos, inclusive a ordem, é um teste de needle-in-a-haystack multi-agulha. A pontuação mede o quanto o texto devolvido coincide com o correto. Os resultados por comprimento:
- GPT-5.5: 98,1% em 4K–8K, 87,5% em 128K–256K e 74,0% em 512K–1M
- GPT-5.4 (a geração anterior, na mesma tabela): 97,3% → 79,3% → 36,6% nas mesmas três faixas
- Claude Opus 4.7 (números que a OpenAI incluiu na mesma tabela): 59,2% em 128K–256K e 32,2% em 512K–1M
- GPT-6 Astra (anunciado em setembro de 2026): 100,0% em 256K–512K e 96,3% em 512K–1M (o GPT-5.6 Sol, na mesma tabela: 91,5% e 73,8%)
Fontes (consultadas em 26 de setembro de 2026): tabelas de avaliação de "Introducing GPT-5.5" (23 de abril de 2026) e "GPT-6 Astra" (3 de setembro de 2026), da OpenAI. Como o benchmark funciona: descrição do conjunto de dados OpenAI MRCR. Os nomes dos modelos são os da época de cada anúncio.
Duas coisas chamam a atenção. Primeiro, o mesmo modelo pontua menos quanto mais longa é a entrada. Segundo, a inclinação da queda varia muito por modelo e geração: na faixa mais próxima de 1M, o GPT-5.4 caiu para menos de 40%, enquanto o GPT-6 Astra, anunciado em setembro de 2026, ficou acima de 90%. O ranking muda a cada geração, então esses números envelhecem rápido. O que fica é a lição: o limite anunciado e o alcance em que a precisão realmente se mantém são dois números diferentes.
Não me entenda mal. Não é "Claude ou GPT são ruins". Casos de uso que realmente precisam de todo o 1M são mais raros do que parece. Se um modelo lê de forma estável até 300K (uns 2–3 livros), quase toda tarefa de programação, pesquisa e resumo cabe. O problema é escolher só pelo número "suporta 1M" — é assim que você acaba com critérios de decisão errados.
2. O que é contexto? — Separe o recipiente do conteúdo
Terminologia rápida. Três palavras se misturam nesse espaço.
Token, janela, contexto
Resumindo: "janela = tamanho do recipiente", "contexto = conteúdo", "token = unidade".
Um recipiente grande com conteúdo bagunçado ainda dá respostas bagunçadas.
E também: não confunda "contexto" com "memória". O contexto vive dentro da sessão — feche o chat e ele desaparece. Recursos como o ChatGPT Memory ou o Claude Memory, por outro lado, são um mecanismo separado de retenção entre sessões. O conteúdo da memória acaba sendo injetado na janela de contexto, mas, da perspectiva do usuário, é armazenamento persistente vs. espaço de trabalho efêmero.
3. O tamanho do recipiente se lê em três números
Ao olhar a ficha técnica de um modelo, em relação a contexto só há três coisas para conferir. Dominando isso, você compara qualquer modelo com o mesmo procedimento.
O número mais visível do catálogo. Só que ele diz o que cabe, não o que é realmente lido — como veremos na próxima seção, o valor efetivo fica bem abaixo disso.
Muitas vezes ignorado, mas é uma ordem de grandeza menor que o limite de entrada. Mesmo nos principais modelos em setembro de 2026, você envia 1 milhão de tokens mas recebe só uns 65K–128K. Em tarefas como "reescreva este documento longo inteiro", é esse o limite que trava primeiro.
Tarifa única em toda a janela, ou um limiar a partir do qual o preço unitário dispara? É o que mais pesa em produção e, ainda assim, é o que mais falta nas fichas técnicas. A §5 faz as contas.
Abaixo estão os números das páginas oficiais de cada fornecedor em 29 de setembro de 2026. Os números mudam a cada geração, então leia isto como um exemplo prático de como os três eixos acima viram diferenças reais. Para os nomes específicos de hoje, veja a lista de modelos atuais e datas de corte; para os números, as páginas oficiais de cada fornecedor.
| Família (exemplos de set. de 2026) | Limite de entrada | Limite de saída | Preço com entradas longas |
|---|---|---|---|
| Anthropic, topo (Claude Fable 5.1, Opus 5.5, Sonnet 5.5) | 1.000.000 | 128.000 | Mesma tarifa até o limite |
| Anthropic, leve (Claude Haiku 4.5) | 200.000 | 64.000 | — |
| OpenAI (GPT-6 Astra, Sol) | 1.050.000 | 128.000 | Entradas acima de 272K: a requisição inteira a 2x na entrada e 1,5x na saída |
| Google (Gemini 3.1 Pro, preview) | 1.048.576 | 65.536 | Acima de 200K: entrada US$ 2→US$ 4, saída US$ 12→US$ 18 |
Fontes (consultadas em 29 de setembro de 2026): Anthropic Models overview e Pricing / páginas de modelo da OpenAI para GPT-6 Astra e GPT-6 Sol / Google Gemini 3.1 Pro Preview e Gemini API pricing
Na tabela, os limites de entrada são quase idênticos entre fornecedores; as diferenças estão nos limites de saída e no formato do preço. Com limites iguais, o tamanho da janela deixa de ser motivo de escolha. O que muda de fato: a Anthropic mantém a mesma tarifa até o limite, enquanto OpenAI e Google sobem a tarifa a partir de certo comprimento. Sob o mesmo rótulo "suporta 1M", a liberdade para enviar entradas longas é diferente. Não é só um detalhe de preço: reflete abordagens distintas para cargas de contexto longo. O capítulo de custos faz as contas.
Na prática, a escolha fica assim. Decida pelo tamanho dos documentos que você usa no dia a dia. Se cabem abaixo de uns 200K, escolha pela estabilidade da precisão nessa faixa e por ficar abaixo de um limiar de preço, não pelo tamanho da janela. Só se você lida rotineiramente com documentos gigantes acima de 300K é que a largura do alcance efetivo e a tarifa para entradas longas passam a decidir. Não se prenda a um único modelo — divida por caso de uso. Essa forma de decidir vale seja qual for a geração atual.
Onde conferir os limites
Confira os números nas páginas oficiais de cada fornecedor, não em sites de compilação nem em tabelas de artigos (esta incluída). Onde olhar é bem constante:
- Anthropic: a tabela comparativa da página de visão geral dos modelos tem as linhas "Context window" e "Max output". O preço para entradas longas está na seção "Long context pricing" da página de preços
- OpenAI: a página de cada modelo na documentação da API mostra "context window" e "max output tokens", além de uma nota sobre o preço de prompts longos
- Google: a página do modelo na Gemini API mostra "Input token limit" e "Output token limit", e a página de preços tem uma faixa "prompts > 200k tokens"
Outro ponto fácil de deixar passar: o mesmo limite comporta quantidades diferentes de texto conforme o modelo. Os limites são contados em tokens, então quando o tokenizador (o esquema que divide o texto em tokens) muda, a contagem de tokens do mesmo documento também muda (veja a nota do §5). Ao trocar de modelo, reconte com os seus próprios documentos para confirmar que ainda há folga.
4. Três razões pelas quais "maior é melhor" não se sustenta
A tabela do capítulo anterior mostra apenas o tamanho físico do recipiente. Mas o modelo usa de fato o recipiente que anuncia? Resumindo: não suponha que ele lê com a mesma precisão até o limite. Há três razões.
Razão ①: Lost in the Middle (perdido no meio)
É o fenômeno que pesquisadores de Stanford e de outras instituições (Liu et al.) relataram em 2023 no artigo "Lost in the Middle". Em tarefas como procurar uma resposta entre vários documentos, os modelos acertavam mais quando a resposta estava no início ou no fim da entrada e perdiam bastante precisão quando ela estava no meio — até modelos feitos para contexto longo mostraram o mesmo padrão.
Na prática, é assim: "Você cola um PDF longo inteiro, pergunta 'Qual é o número de X?' e ele troca um número bem no meio." Isso é Lost in the Middle. A intensidade varia de modelo para modelo, mas o seguro é assumir que informação no meio do documento se perde com mais facilidade — e ajustar a forma de entregá-la.
Razão ②: Context Rot (apodrecimento do contexto)
Quanto mais a conversa se estende, mais as instruções iniciais se diluem. Você pediu um tom formal no início e, 20 turnos depois, o modelo voltou ao tom informal — isso é Context Rot.
Duas causas. ① As instruções iniciais passam a ser tratadas como relativamente antigas e leves dentro do histórico. ② O histórico longo dispersa a atenção, tornando mais difícil referenciar tokens específicos. Na sua documentação para desenvolvedores, a Anthropic chama de "context rot" a queda de precisão e de recuperação conforme o número de tokens cresce, e escreve que escolher o que entra no contexto importa tanto quanto o quanto cabe. Em setembro de 2025, ela organizou como lidar com o problema como uma habilidade deliberada num artigo técnico intitulado "Effective context engineering for AI agents".
Razão ③: Contexto anunciado ≠ contexto efetivo
Tomando dos números do §1 só a faixa mais próxima de 1M (512K–1M), fica assim. Todos vêm das tabelas de avaliação dos anúncios da OpenAI e usam o mesmo benchmark, OpenAI MRCR v2 (8 agulhas).
Perto de 1M, o modelo devolve exatamente o item pedido?
Fontes: tabelas de avaliação de "Introducing GPT-5.5" (23 de abril de 2026; GPT-5.5, GPT-5.4, Claude Opus 4.7) e "GPT-6 Astra" (3 de setembro de 2026; GPT-6 Astra, GPT-5.6 Sol), da OpenAI. Os nomes dos modelos são os da época de cada anúncio.
Na faixa curta da mesma tabela (4K–8K), o GPT-5.5 marcou 98,1% e o GPT-5.4, 97,3%. São números que a OpenAI publicou nos próprios anúncios, não medições de terceiros.
Isso não quer dizer que "os modelos com pontuação baixa são ruins". Na faixa curta da mesma tabela, o GPT-5.5 e o GPT-5.4 passam dos 97%, e a maior parte do trabalho real — revisão de código, redação longa, resumo de atas, síntese de pesquisa — termina bem antes de 1M. O problema é a lógica de "tem 1M, então joga 1M". Lembre também que são números que a OpenAI publicou nos próprios anúncios, comparáveis só dentro de uma mesma tabela. O Google também traz resultados do MRCR v2 (8 agulhas) na ficha do modelo Gemini 3.1 Pro (fevereiro de 2026) — 84,9% em 128K (média) contra 26,3% em 1M —, mas divide os comprimentos de outro jeito, por isso não está entre as barras acima. As páginas de anúncio da Anthropic para o Claude Opus 5.5 e seus outros modelos atuais não trazem pontuações desse tipo por comprimento. Para saber do que o modelo que você usa hoje é capaz, teste-o no seu próprio caso de uso com o método a seguir.
Meça o "alcance efetivo" no seu próprio caso de uso
Os números de benchmark vêm de tipos de documento e formas de perguntar diferentes dos seus. O mais confiável é montar um pequeno needle-in-a-haystack com os seus próprios documentos.
- Pegue o tipo de documento que você realmente usa (código, atas, contratos etc.) e coloque 3–5 fatos com resposta clara no início, no meio e no fim (fatos que já estão no documento também servem)
- Peça que "liste todos e diga onde cada um aparece", para que ele tenha de recuperar vários fatos ao mesmo tempo. Perguntar por um só faz o modelo parecer melhor do que é (a diferença entre uma agulha e várias)
- Repita a mesma pergunta com comprimentos diferentes — por exemplo 50K, 200K e 500K — e anote o comprimento em que as respostas começam a falhar
- Inclua perguntas que combinem fatos, não só que os recuperem ("compare A e B"). Perguntas que exigem síntese tendem a falhar antes
Logo abaixo do comprimento em que as falhas começam está o "contexto efetivo" daquele modelo para aquele caso de uso. Meça de novo ao trocar de modelo. Leva algumas dezenas de minutos e orienta decisões reais melhor do que qualquer número da ficha técnica.
5. A armadilha de custo — modelos cuja tarifa dispara com entradas longas e modelos cuja tarifa não muda
O capítulo anterior disse que o alcance efetivo fica abaixo do limite. Por cima disso vem uma segunda armadilha: enviar entradas longas pode fazer o preço disparar. Cada fornecedor desenhou isso de um jeito.
| Modelo (set. de 2026) | Tarifa padrão (entrada / saída, por 1M de tokens) | Entradas longas |
|---|---|---|
| Claude Opus 5.5 | US$ 4 / US$ 20 | Mesma tarifa em todo o 1M |
| GPT-6 Sol | US$ 2 / US$ 10 | Entradas acima de 272K: a requisição inteira a 2x na entrada e 1,5x na saída |
| GPT-6 Astra | US$ 10 / US$ 50 | Idem |
| Gemini 3.1 Pro (preview) | US$ 2 / US$ 12 | Acima de 200K: entrada US$ 4, saída US$ 18 |
Vamos às contas. Imagine que você envia um documento de 500K tokens e recebe uma resposta de 50K — o caso típico de "resumir de uma vez uma grande base de código ou um relatório anual".
- Claude Opus 5.5 (tarifa fixa): US$ 4,00 × 0,5 + US$ 20,00 × 0,05 = US$ 3,00
- GPT-6 Sol (sobretaxa acima de 272K): US$ 4,00 × 0,5 + US$ 15,00 × 0,05 = US$ 2,75 (US$ 1,50 sem a sobretaxa)
- Gemini 3.1 Pro (tarifa acima de 200K): US$ 4,00 × 0,5 + US$ 18,00 × 0,05 = US$ 2,90 (US$ 1,60 com a tarifa de até 200K)
- GPT-6 Astra (sobretaxa acima de 272K): US$ 20,00 × 0,5 + US$ 75,00 × 0,05 = US$ 13,75
Há duas leituras. Primeira: no momento em que você cruza o limiar, o mesmo modelo passa a custar cerca de 1,8 vez mais. O GPT-6 Sol custa metade do Claude Opus 5.5 em entradas curtas, mas em 500K a diferença quase some — qual modelo é "mais barato" se inverte conforme o comprimento da entrada. Segunda: quando a sobretaxa se soma a um modelo principal de preço alto, o custo muda de escala (o GPT-6 Astra sai por mais de 4 vezes o Opus 5.5). Refaça as contas com os modelos que você está comparando e com o seu comprimento típico de entrada antes de escolher.
Com preço por limiar, divida o que puder ser dividido para que cada parte fique abaixo do limiar. Enviando os 500K como duas requisições de 250K, o GPT-6 Sol não cobra sobretaxa — US$ 1,50 no total (embora isso não sirva para tarefas que precisam ver tudo de uma vez). É a mesma estrutura que abordei em "Economizando custos de tokens e sessões de IA".
6. Cinco táticas de economia — ranqueadas por impacto real para devs solo
"O recipiente é de 1M, mas o alcance efetivo termina bem antes, e usá-lo por muito tempo fica caro." Já cobrimos isso. Então, o que dá para fazer de fato no campo? Eis cinco táticas que uso no dia a dia, ranqueadas pelo que dá o maior retorno.
Economia de contexto — ordem de prioridade
/compact ou inicie uma nova sessão.
Das cinco, a tática ① "Encerre a sessão" dá o maior ganho visível. Só cortar o chat reduz alucinações de forma perceptível.
A tática ④ é para desenvolvedores de API — UIs (claude.ai / ChatGPT) lidam com o caching automaticamente.
Minha melhor prática pessoal: só fazer ① e ② de forma consistente já desloca a precisão percebida de forma notável. Mesmo com o Claude Code, em vez de empurrar uma sessão longa, acionar /compact ou iniciar uma sessão nova a cada mudança de tópico mantém a qualidade do output final estável.
Resumo
Os pontos principais deste artigo:
- Janela de contexto = o número máximo de tokens que uma IA consegue processar numa troca. O tamanho do recipiente
- Em setembro de 2026, os modelos de topo de Anthropic, OpenAI e Google estão todos na classe de 1M tokens. Os limites de entrada quase não diferem; as diferenças estão nos limites de saída e no preço das entradas longas
- O limite anunciado e o alcance efetivo são coisas diferentes. No MRCR (8 agulhas), o benchmark multi-agulha publicado pela OpenAI, o mesmo modelo pontua menos quanto mais longa é a entrada, e perto de 1M os números iam de 32,2% do Claude Opus 4.7 (na tabela da OpenAI) a 96,3% do GPT-6 Astra
- O jeito mais confiável de achar o alcance efetivo é espalhar fatos pelos seus próprios documentos e testar com comprimentos diferentes. Meça de novo ao trocar de modelo
- O preço de entradas longas tem dois formatos: a mesma tarifa até o limite (Anthropic) ou uma sobretaxa a partir de um limiar (272K na OpenAI, 200K no Google). Qual sai mais barato se inverte conforme o comprimento da entrada
- A economia se resume a cinco movimentos: cortar sessões, enviar trechos, repetir instruções no fim, usar cache e explicitar endereços — ① e ② são os que mais pesam
O recipiente cresceu, mas o que fazemos de verdade continua sendo escolher o que entregar e o que deixar de fora. A habilidade central com IA já não é "a capacidade de enfiar tudo". É o discernimento para entregar exatamente o necessário, do jeito certo — uma habilidade que continua útil por mais gerações de modelos que passem. Essa é a minha conclusão agora que 1M virou o normal.
FAQ
A OpenAI tem a biblioteca tiktoken, e a API da Anthropic tem uma função de contagem de tokens (token counting). Como referência aproximada: 1 caractere japonês ≈ 1–1,5 token, 1 palavra em inglês ≈ 1,3–1,8 token — mas isso muda com a geração do tokenizador (veja a nota do §5). Código também varia muito conforme o tipo, então o seguro é medir antes de enviar uma entrada longa.
O contexto vive somente dentro da sessão — feche o chat e ele desaparece. A memória (ChatGPT Memory / Claude Memory) é um mecanismo separado de retenção entre sessões. O conteúdo da memória acaba sendo injetado na janela de contexto, mas, da perspectiva do usuário, é persistente vs. efêmero.
RAG é o padrão de "buscar dinamicamente apenas a informação necessária para o contexto". Mesmo com uma janela de 1M, despejar tudo deixa o sistema lento, pesado e caro, então recuperar e então carregar (RAG) continua sendo a abordagem dominante. Veja O que é RAG para mais.
Vários fatores se somam: o descompasso entre os comprimentos de sequência mais vistos no treino e os usados na inferência, os limites da codificação posicional no mecanismo de atenção e o aumento acentuado de computação necessário para combinar várias informações. "Suportar" e "ser preciso em toda a janela" são problemas separados. Onde a queda começa depende do modelo e da tarefa, então o confiável é medir com os seus próprios documentos usando o método do §4.
Sim. MCP é um mecanismo de busca sob demanda via ferramentas, então você não precisa carregar tudo no contexto de antemão. Mude o modelo mental de "colar o arquivo inteiro" para "deixar que ele vá ler o arquivo".
Decida pelo objetivo. ① Se você quer um resumo do todo, resuma cada capítulo primeiro e depois combine esses resumos numa segunda passada. ② Se procura uma resposta específica, não envie o texto inteiro — extraia só as partes relevantes com busca (RAG). ③ Só quando precisar comparar ao longo do documento inteiro vale enviá-lo de uma vez, num comprimento que caiba no alcance efetivo. Ao dividir, corte nos títulos e sobreponha alguns parágrafos de cada lado para o fio não se perder nas emendas.