Em 2023, uma janela de contexto de 32K tokens parecia "espaçosa". Hoje, uma janela na classe de 1 milhão de tokens (1M) já é pressuposto nos modelos de ponta. Em setembro de 2026, Anthropic, OpenAI e Google publicam nas especificações oficiais dos seus modelos de topo um limite de entrada de cerca de um milhão de tokens. Os nomes e números específicos mudam a cada lançamento, então deixo isso para a lista de modelos atuais e datas de corte e para as páginas oficiais de cada fornecedor. Este artigo foca no que sobrevive a uma troca de geração: como ler os números e como trabalhar com eles.

"Um milhão de tokens" se traduz aproximadamente em 8 a 10 livros de bolso em inglês, ou dezenas de milhares de linhas de código-fonte. Agora podemos manter tudo isso "à vista" em uma única sessão. Mas um documento caber no recipiente não é o mesmo que o modelo ler tudo. As pontuações que a OpenAI publica no seu benchmark multi-agulha de contexto longo (MRCR) mostram que o mesmo modelo pontua menos quanto mais longa é a entrada, e o tamanho da queda varia muito por modelo e geração (tratado no §1 e no §4).

Vou adiantar minha opinião: a era de escolher um modelo apenas pelo tamanho do recipiente acabou. O que importa é o trio "contexto efetivo × custo × forma de alimentar". Este artigo percorre o que é contexto de fato, como ler uma ficha técnica, por que tamanho não basta, como medir o alcance efetivo no seu próprio caso de uso, como o preço dispara com entradas longas e cinco táticas de economia que devs solo e equipes pequenas podem aplicar hoje — com números oficiais e dados de benchmarks publicados.

CONTEXT WINDOW · 2023→2026

Em três anos, o recipiente cresceu 250 vezes

— Linha do tempo de como 1M passou de luxo a ponto de partida

2023
4K–200K
GPT-3.5 e o primeiro GPT-4 tinham 4K–32K — um único artigo científico já enchia. Em novembro, o Claude 2.1 chegou a 200K.
2024
128K–2M
GPT-4 Turbo (128K) e Claude 3 (200K) viraram o padrão. Em junho, o Gemini 1.5 Pro abriu 2M para desenvolvedores.
2025
1M se espalha
GPT-4.1 em abril e Claude Sonnet 4 (beta) em agosto passaram a suportar 1M.
2026
1M = padrão
Os modelos de topo de Claude, GPT e Gemini estão todos na classe de 1M tokens (em setembro).

Mas "suportar" e "ler até o fim" são coisas diferentes. No MRCR (8 agulhas), o benchmark de contexto longo da OpenAI, o GPT-5.5 vai de 98,1% em 4K–8K para 74,0% em 512K–1M.
O tamanho da queda depende do modelo e da geração (tabela de avaliação de "Introducing GPT-5.5", da OpenAI, 23 de abril de 2026; detalhes no §1 e no §4).

1. Suporte a 1M virou regra — mas "ler até o fim" é outra história

O suporte a 1M se espalhou rápido nos últimos dois anos. Em abril de 2025, o GPT-4.1 da OpenAI saiu com cerca de 1,05 milhão de tokens; em agosto de 2025, o Claude Sonnet 4 da Anthropic chegou a 1 milhão (em beta); e em setembro de 2026 os modelos de topo de Anthropic, OpenAI e Google publicam cerca de um milhão de tokens nas especificações oficiais. Em 2023, 32K parecia espaçoso — são mais de 30 vezes em apenas três anos. A corrida pelo tamanho do recipiente parecia encerrada.

Mas, olhando as pontuações de contexto longo que os próprios fornecedores publicam, o quadro fica mais complicado. O benchmark com resultados completos por comprimento é o MRCR v2 (8 agulhas) da OpenAI. Ele esconde oito pedidos do mesmo tipo — por exemplo, "escreva um poema sobre antas" — numa conversa longa com uma IA e depois pede exatamente um deles, como "devolva o 2º poema". Como o modelo precisa distinguir itens quase idênticos, inclusive a ordem, é um teste de needle-in-a-haystack multi-agulha. A pontuação mede o quanto o texto devolvido coincide com o correto. Os resultados por comprimento:

  • GPT-5.5: 98,1% em 4K–8K, 87,5% em 128K–256K e 74,0% em 512K–1M
  • GPT-5.4 (a geração anterior, na mesma tabela): 97,3% → 79,3% → 36,6% nas mesmas três faixas
  • Claude Opus 4.7 (números que a OpenAI incluiu na mesma tabela): 59,2% em 128K–256K e 32,2% em 512K–1M
  • GPT-6 Astra (anunciado em setembro de 2026): 100,0% em 256K–512K e 96,3% em 512K–1M (o GPT-5.6 Sol, na mesma tabela: 91,5% e 73,8%)

Fontes (consultadas em 26 de setembro de 2026): tabelas de avaliação de "Introducing GPT-5.5" (23 de abril de 2026) e "GPT-6 Astra" (3 de setembro de 2026), da OpenAI. Como o benchmark funciona: descrição do conjunto de dados OpenAI MRCR. Os nomes dos modelos são os da época de cada anúncio.

Duas coisas chamam a atenção. Primeiro, o mesmo modelo pontua menos quanto mais longa é a entrada. Segundo, a inclinação da queda varia muito por modelo e geração: na faixa mais próxima de 1M, o GPT-5.4 caiu para menos de 40%, enquanto o GPT-6 Astra, anunciado em setembro de 2026, ficou acima de 90%. O ranking muda a cada geração, então esses números envelhecem rápido. O que fica é a lição: o limite anunciado e o alcance em que a precisão realmente se mantém são dois números diferentes.

Não me entenda mal. Não é "Claude ou GPT são ruins". Casos de uso que realmente precisam de todo o 1M são mais raros do que parece. Se um modelo lê de forma estável até 300K (uns 2–3 livros), quase toda tarefa de programação, pesquisa e resumo cabe. O problema é escolher só pelo número "suporta 1M" — é assim que você acaba com critérios de decisão errados.

2. O que é contexto? — Separe o recipiente do conteúdo

Terminologia rápida. Três palavras se misturam nesse espaço.

Três termos

Token, janela, contexto

① TOKEN — unidade de texto
A menor unidade na qual a IA processa texto. ~4 caracteres em inglês por token (ou ~0,75 de uma palavra); idiomas CJK rodam aproximadamente 1–1,5 tokens por caractere.
② WINDOW — tamanho do recipiente
O número máximo de tokens que um modelo consegue processar numa única troca. Soma de entrada e saída (incluindo o raciocínio). Na API, se só a entrada já ultrapassa o limite, ela retorna um erro; apps de chat e agentes costumam abrir espaço resumindo ou descartando as partes mais antigas.
③ CONTEXT — o conteúdo
O que está atualmente carregado na janela. Inclui o prompt do sistema, histórico da conversa, anexos, saídas de ferramentas — tudo.

Resumindo: "janela = tamanho do recipiente", "contexto = conteúdo", "token = unidade".
Um recipiente grande com conteúdo bagunçado ainda dá respostas bagunçadas.

E também: não confunda "contexto" com "memória". O contexto vive dentro da sessão — feche o chat e ele desaparece. Recursos como o ChatGPT Memory ou o Claude Memory, por outro lado, são um mecanismo separado de retenção entre sessões. O conteúdo da memória acaba sendo injetado na janela de contexto, mas, da perspectiva do usuário, é armazenamento persistente vs. espaço de trabalho efêmero.

Equívoco comum: "Janela de contexto maior = IA mais inteligente" está errado. O tamanho da janela é só o limite superior do que pode estar à vista. Capacidade de raciocínio, profundidade de conhecimento e precisão em seguir instruções são medidas separadamente. Cada lançamento de modelo abre com "1M de contexto!" como manchete, mas isso é só uma faceta da capacidade.

3. O tamanho do recipiente se lê em três números

Ao olhar a ficha técnica de um modelo, em relação a contexto só há três coisas para conferir. Dominando isso, você compara qualquer modelo com o mesmo procedimento.

① Limite de entrada

O número mais visível do catálogo. Só que ele diz o que cabe, não o que é realmente lido — como veremos na próxima seção, o valor efetivo fica bem abaixo disso.

② Limite de saída

Muitas vezes ignorado, mas é uma ordem de grandeza menor que o limite de entrada. Mesmo nos principais modelos em setembro de 2026, você envia 1 milhão de tokens mas recebe só uns 65K–128K. Em tarefas como "reescreva este documento longo inteiro", é esse o limite que trava primeiro.

③ Modelo de cobrança

Tarifa única em toda a janela, ou um limiar a partir do qual o preço unitário dispara? É o que mais pesa em produção e, ainda assim, é o que mais falta nas fichas técnicas. A §5 faz as contas.

Abaixo estão os números das páginas oficiais de cada fornecedor em 29 de setembro de 2026. Os números mudam a cada geração, então leia isto como um exemplo prático de como os três eixos acima viram diferenças reais. Para os nomes específicos de hoje, veja a lista de modelos atuais e datas de corte; para os números, as páginas oficiais de cada fornecedor.

Família (exemplos de set. de 2026)Limite de entradaLimite de saídaPreço com entradas longas
Anthropic, topo (Claude Fable 5.1, Opus 5.5, Sonnet 5.5)1.000.000128.000Mesma tarifa até o limite
Anthropic, leve (Claude Haiku 4.5)200.00064.000—
OpenAI (GPT-6 Astra, Sol)1.050.000128.000Entradas acima de 272K: a requisição inteira a 2x na entrada e 1,5x na saída
Google (Gemini 3.1 Pro, preview)1.048.57665.536Acima de 200K: entrada US$ 2→US$ 4, saída US$ 12→US$ 18

Fontes (consultadas em 29 de setembro de 2026): Anthropic Models overview e Pricing / páginas de modelo da OpenAI para GPT-6 Astra e GPT-6 Sol / Google Gemini 3.1 Pro Preview e Gemini API pricing

Na tabela, os limites de entrada são quase idênticos entre fornecedores; as diferenças estão nos limites de saída e no formato do preço. Com limites iguais, o tamanho da janela deixa de ser motivo de escolha. O que muda de fato: a Anthropic mantém a mesma tarifa até o limite, enquanto OpenAI e Google sobem a tarifa a partir de certo comprimento. Sob o mesmo rótulo "suporta 1M", a liberdade para enviar entradas longas é diferente. Não é só um detalhe de preço: reflete abordagens distintas para cargas de contexto longo. O capítulo de custos faz as contas.

Na prática, a escolha fica assim. Decida pelo tamanho dos documentos que você usa no dia a dia. Se cabem abaixo de uns 200K, escolha pela estabilidade da precisão nessa faixa e por ficar abaixo de um limiar de preço, não pelo tamanho da janela. Só se você lida rotineiramente com documentos gigantes acima de 300K é que a largura do alcance efetivo e a tarifa para entradas longas passam a decidir. Não se prenda a um único modelo — divida por caso de uso. Essa forma de decidir vale seja qual for a geração atual.

Onde conferir os limites

Confira os números nas páginas oficiais de cada fornecedor, não em sites de compilação nem em tabelas de artigos (esta incluída). Onde olhar é bem constante:

  • Anthropic: a tabela comparativa da página de visão geral dos modelos tem as linhas "Context window" e "Max output". O preço para entradas longas está na seção "Long context pricing" da página de preços
  • OpenAI: a página de cada modelo na documentação da API mostra "context window" e "max output tokens", além de uma nota sobre o preço de prompts longos
  • Google: a página do modelo na Gemini API mostra "Input token limit" e "Output token limit", e a página de preços tem uma faixa "prompts > 200k tokens"

Outro ponto fácil de deixar passar: o mesmo limite comporta quantidades diferentes de texto conforme o modelo. Os limites são contados em tokens, então quando o tokenizador (o esquema que divide o texto em tokens) muda, a contagem de tokens do mesmo documento também muda (veja a nota do §5). Ao trocar de modelo, reconte com os seus próprios documentos para confirmar que ainda há folga.

4. Três razões pelas quais "maior é melhor" não se sustenta

A tabela do capítulo anterior mostra apenas o tamanho físico do recipiente. Mas o modelo usa de fato o recipiente que anuncia? Resumindo: não suponha que ele lê com a mesma precisão até o limite. Há três razões.

Razão ①: Lost in the Middle (perdido no meio)

É o fenômeno que pesquisadores de Stanford e de outras instituições (Liu et al.) relataram em 2023 no artigo "Lost in the Middle". Em tarefas como procurar uma resposta entre vários documentos, os modelos acertavam mais quando a resposta estava no início ou no fim da entrada e perdiam bastante precisão quando ela estava no meio — até modelos feitos para contexto longo mostraram o mesmo padrão.

Na prática, é assim: "Você cola um PDF longo inteiro, pergunta 'Qual é o número de X?' e ele troca um número bem no meio." Isso é Lost in the Middle. A intensidade varia de modelo para modelo, mas o seguro é assumir que informação no meio do documento se perde com mais facilidade — e ajustar a forma de entregá-la.

Razão ②: Context Rot (apodrecimento do contexto)

Quanto mais a conversa se estende, mais as instruções iniciais se diluem. Você pediu um tom formal no início e, 20 turnos depois, o modelo voltou ao tom informal — isso é Context Rot.

Duas causas. ① As instruções iniciais passam a ser tratadas como relativamente antigas e leves dentro do histórico. ② O histórico longo dispersa a atenção, tornando mais difícil referenciar tokens específicos. Na sua documentação para desenvolvedores, a Anthropic chama de "context rot" a queda de precisão e de recuperação conforme o número de tokens cresce, e escreve que escolher o que entra no contexto importa tanto quanto o quanto cabe. Em setembro de 2025, ela organizou como lidar com o problema como uma habilidade deliberada num artigo técnico intitulado "Effective context engineering for AI agents".

Razão ③: Contexto anunciado ≠ contexto efetivo

Tomando dos números do §1 só a faixa mais próxima de 1M (512K–1M), fica assim. Todos vêm das tabelas de avaliação dos anúncios da OpenAI e usam o mesmo benchmark, OpenAI MRCR v2 (8 agulhas).

OpenAI MRCR v2 (8 agulhas) × 512K–1M

Perto de 1M, o modelo devolve exatamente o item pedido?

GPT-6 Astra set. 2026 96,3%
GPT-5.5 abr. 2026 74,0%
GPT-5.6 Sol set. 2026 73,8%
GPT-5.4 abr. 2026 36,6%
Claude Opus 4.7 abr. 2026 · tabela da OpenAI 32,2%

Fontes: tabelas de avaliação de "Introducing GPT-5.5" (23 de abril de 2026; GPT-5.5, GPT-5.4, Claude Opus 4.7) e "GPT-6 Astra" (3 de setembro de 2026; GPT-6 Astra, GPT-5.6 Sol), da OpenAI. Os nomes dos modelos são os da época de cada anúncio.
Na faixa curta da mesma tabela (4K–8K), o GPT-5.5 marcou 98,1% e o GPT-5.4, 97,3%. São números que a OpenAI publicou nos próprios anúncios, não medições de terceiros.

Isso não quer dizer que "os modelos com pontuação baixa são ruins". Na faixa curta da mesma tabela, o GPT-5.5 e o GPT-5.4 passam dos 97%, e a maior parte do trabalho real — revisão de código, redação longa, resumo de atas, síntese de pesquisa — termina bem antes de 1M. O problema é a lógica de "tem 1M, então joga 1M". Lembre também que são números que a OpenAI publicou nos próprios anúncios, comparáveis só dentro de uma mesma tabela. O Google também traz resultados do MRCR v2 (8 agulhas) na ficha do modelo Gemini 3.1 Pro (fevereiro de 2026) — 84,9% em 128K (média) contra 26,3% em 1M —, mas divide os comprimentos de outro jeito, por isso não está entre as barras acima. As páginas de anúncio da Anthropic para o Claude Opus 5.5 e seus outros modelos atuais não trazem pontuações desse tipo por comprimento. Para saber do que o modelo que você usa hoje é capaz, teste-o no seu próprio caso de uso com o método a seguir.

Meça o "alcance efetivo" no seu próprio caso de uso

Os números de benchmark vêm de tipos de documento e formas de perguntar diferentes dos seus. O mais confiável é montar um pequeno needle-in-a-haystack com os seus próprios documentos.

  1. Pegue o tipo de documento que você realmente usa (código, atas, contratos etc.) e coloque 3–5 fatos com resposta clara no início, no meio e no fim (fatos que já estão no documento também servem)
  2. Peça que "liste todos e diga onde cada um aparece", para que ele tenha de recuperar vários fatos ao mesmo tempo. Perguntar por um só faz o modelo parecer melhor do que é (a diferença entre uma agulha e várias)
  3. Repita a mesma pergunta com comprimentos diferentes — por exemplo 50K, 200K e 500K — e anote o comprimento em que as respostas começam a falhar
  4. Inclua perguntas que combinem fatos, não só que os recuperem ("compare A e B"). Perguntas que exigem síntese tendem a falhar antes

Logo abaixo do comprimento em que as falhas começam está o "contexto efetivo" daquele modelo para aquele caso de uso. Meça de novo ao trocar de modelo. Leva algumas dezenas de minutos e orienta decisões reais melhor do que qualquer número da ficha técnica.

5. A armadilha de custo — modelos cuja tarifa dispara com entradas longas e modelos cuja tarifa não muda

O capítulo anterior disse que o alcance efetivo fica abaixo do limite. Por cima disso vem uma segunda armadilha: enviar entradas longas pode fazer o preço disparar. Cada fornecedor desenhou isso de um jeito.

Modelo (set. de 2026)Tarifa padrão (entrada / saída, por 1M de tokens)Entradas longas
Claude Opus 5.5US$ 4 / US$ 20Mesma tarifa em todo o 1M
GPT-6 SolUS$ 2 / US$ 10Entradas acima de 272K: a requisição inteira a 2x na entrada e 1,5x na saída
GPT-6 AstraUS$ 10 / US$ 50Idem
Gemini 3.1 Pro (preview)US$ 2 / US$ 12Acima de 200K: entrada US$ 4, saída US$ 18

Vamos às contas. Imagine que você envia um documento de 500K tokens e recebe uma resposta de 50K — o caso típico de "resumir de uma vez uma grande base de código ou um relatório anual".

  • Claude Opus 5.5 (tarifa fixa): US$ 4,00 × 0,5 + US$ 20,00 × 0,05 = US$ 3,00
  • GPT-6 Sol (sobretaxa acima de 272K): US$ 4,00 × 0,5 + US$ 15,00 × 0,05 = US$ 2,75 (US$ 1,50 sem a sobretaxa)
  • Gemini 3.1 Pro (tarifa acima de 200K): US$ 4,00 × 0,5 + US$ 18,00 × 0,05 = US$ 2,90 (US$ 1,60 com a tarifa de até 200K)
  • GPT-6 Astra (sobretaxa acima de 272K): US$ 20,00 × 0,5 + US$ 75,00 × 0,05 = US$ 13,75

Há duas leituras. Primeira: no momento em que você cruza o limiar, o mesmo modelo passa a custar cerca de 1,8 vez mais. O GPT-6 Sol custa metade do Claude Opus 5.5 em entradas curtas, mas em 500K a diferença quase some — qual modelo é "mais barato" se inverte conforme o comprimento da entrada. Segunda: quando a sobretaxa se soma a um modelo principal de preço alto, o custo muda de escala (o GPT-6 Astra sai por mais de 4 vezes o Opus 5.5). Refaça as contas com os modelos que você está comparando e com o seu comprimento típico de entrada antes de escolher.

Com preço por limiar, divida o que puder ser dividido para que cada parte fique abaixo do limiar. Enviando os 500K como duas requisições de 250K, o GPT-6 Sol não cobra sobretaxa — US$ 1,50 no total (embora isso não sirva para tarefas que precisam ver tudo de uma vez). É a mesma estrutura que abordei em "Economizando custos de tokens e sessões de IA".

Nota: o mesmo documento pode ter outra contagem de tokens em outro modelo. Limites e preços são contados em tokens, então um tokenizador novo muda tanto o custo de um documento quanto a folga disponível. Na sua visão geral oficial dos modelos, a Anthropic informa que, no tokenizador atual, usado desde o Claude Opus 4.7, 1M de tokens comporta cerca de 555 mil palavras, contra cerca de 750 mil nos modelos anteriores — aproximadamente 1,35 vez mais tokens para o mesmo texto em inglês. Mesmo que a tarifa por token não mude, compare as faturas reais depois de trocar de modelo.

6. Cinco táticas de economia — ranqueadas por impacto real para devs solo

"O recipiente é de 1M, mas o alcance efetivo termina bem antes, e usá-lo por muito tempo fica caro." Já cobrimos isso. Então, o que dá para fazer de fato no campo? Eis cinco táticas que uso no dia a dia, ranqueadas pelo que dá o maior retorno.

Cinco dicas práticas

Economia de contexto — ordem de prioridade

① Encerre a sessão
Quando o tópico mudar, abra um novo chat. Só impedir que o contexto antigo continue elimina o Context Rot. No Claude Code, use /compact ou inicie uma nova sessão.
② Envie trechos, não textos completos
Colar um PDF de 100 páginas inteiro é a pior jogada. Use grep / busca para extrair as seções relevantes, comprima para 3–5 páginas e então envie. A mentalidade RAG, aplicada solo.
③ Repita instruções-chave no fim
Contramedida ao Lost-in-the-Middle. Reafirme a regra do topo em uma linha no final: "Considerando o acima, gere a saída no formato X."
④ Prompt caching
Se você reutiliza o mesmo prompt de sistema ou o mesmo material, o cache de prompts da Anthropic/OpenAI deixa a tarifa de entrada da parte lida do cache em 10% da base ou menos (preços oficiais de setembro de 2026). Se você usa a API, configure isso primeiro.
⑤ Torne explícitos os endereços de arquivo
Especificar "arquivo N, linha X" aumenta a precisão de recuperação em contextos longos. Pense nisso como entregar à IA um índice com entradas de catálogo.

Das cinco, a tática ① "Encerre a sessão" dá o maior ganho visível. Só cortar o chat reduz alucinações de forma perceptível.
A tática ④ é para desenvolvedores de API — UIs (claude.ai / ChatGPT) lidam com o caching automaticamente.

Minha melhor prática pessoal: só fazer ① e ② de forma consistente já desloca a precisão percebida de forma notável. Mesmo com o Claude Code, em vez de empurrar uma sessão longa, acionar /compact ou iniciar uma sessão nova a cada mudança de tópico mantém a qualidade do output final estável.

Resumo

Os pontos principais deste artigo:

  • Janela de contexto = o número máximo de tokens que uma IA consegue processar numa troca. O tamanho do recipiente
  • Em setembro de 2026, os modelos de topo de Anthropic, OpenAI e Google estão todos na classe de 1M tokens. Os limites de entrada quase não diferem; as diferenças estão nos limites de saída e no preço das entradas longas
  • O limite anunciado e o alcance efetivo são coisas diferentes. No MRCR (8 agulhas), o benchmark multi-agulha publicado pela OpenAI, o mesmo modelo pontua menos quanto mais longa é a entrada, e perto de 1M os números iam de 32,2% do Claude Opus 4.7 (na tabela da OpenAI) a 96,3% do GPT-6 Astra
  • O jeito mais confiável de achar o alcance efetivo é espalhar fatos pelos seus próprios documentos e testar com comprimentos diferentes. Meça de novo ao trocar de modelo
  • O preço de entradas longas tem dois formatos: a mesma tarifa até o limite (Anthropic) ou uma sobretaxa a partir de um limiar (272K na OpenAI, 200K no Google). Qual sai mais barato se inverte conforme o comprimento da entrada
  • A economia se resume a cinco movimentos: cortar sessões, enviar trechos, repetir instruções no fim, usar cache e explicitar endereços — ① e ② são os que mais pesam

O recipiente cresceu, mas o que fazemos de verdade continua sendo escolher o que entregar e o que deixar de fora. A habilidade central com IA já não é "a capacidade de enfiar tudo". É o discernimento para entregar exatamente o necessário, do jeito certo — uma habilidade que continua útil por mais gerações de modelos que passem. Essa é a minha conclusão agora que 1M virou o normal.

FAQ

Q1. Como medir a contagem de tokens com antecedência?

A OpenAI tem a biblioteca tiktoken, e a API da Anthropic tem uma função de contagem de tokens (token counting). Como referência aproximada: 1 caractere japonês ≈ 1–1,5 token, 1 palavra em inglês ≈ 1,3–1,8 token — mas isso muda com a geração do tokenizador (veja a nota do §5). Código também varia muito conforme o tipo, então o seguro é medir antes de enviar uma entrada longa.

Q2. Como a "memória" se diferencia do contexto?

O contexto vive somente dentro da sessão — feche o chat e ele desaparece. A memória (ChatGPT Memory / Claude Memory) é um mecanismo separado de retenção entre sessões. O conteúdo da memória acaba sendo injetado na janela de contexto, mas, da perspectiva do usuário, é persistente vs. efêmero.

Q3. Como o RAG se relaciona com a janela de contexto?

RAG é o padrão de "buscar dinamicamente apenas a informação necessária para o contexto". Mesmo com uma janela de 1M, despejar tudo deixa o sistema lento, pesado e caro, então recuperar e então carregar (RAG) continua sendo a abordagem dominante. Veja O que é RAG para mais.

Q4. Por que a precisão cai bem antes de encher uma janela de 1M?

Vários fatores se somam: o descompasso entre os comprimentos de sequência mais vistos no treino e os usados na inferência, os limites da codificação posicional no mecanismo de atenção e o aumento acentuado de computação necessário para combinar várias informações. "Suportar" e "ser preciso em toda a janela" são problemas separados. Onde a queda começa depende do modelo e da tarefa, então o confiável é medir com os seus próprios documentos usando o método do §4.

Q5. Servidores MCP economizam contexto?

Sim. MCP é um mecanismo de busca sob demanda via ferramentas, então você não precisa carregar tudo no contexto de antemão. Mude o modelo mental de "colar o arquivo inteiro" para "deixar que ele vá ler o arquivo".

Q6. Como dividir ou resumir um documento longo demais para o alcance efetivo?

Decida pelo objetivo. ① Se você quer um resumo do todo, resuma cada capítulo primeiro e depois combine esses resumos numa segunda passada. ② Se procura uma resposta específica, não envie o texto inteiro — extraia só as partes relevantes com busca (RAG). ③ Só quando precisar comparar ao longo do documento inteiro vale enviá-lo de uma vez, num comprimento que caiba no alcance efetivo. Ao dividir, corte nos títulos e sobreponha alguns parágrafos de cada lado para o fio não se perder nas emendas.