Atualização de 29 de setembro de 2026: este artigo explica o lançamento do GPT-5.6 (Luna / Terra / Sol), disponível de forma geral desde julho de 2026. Desde então, a OpenAI lançou o GPT-6 Astra (3 de setembro) e, em 22 de setembro (horário dos EUA), os GPT-6 Sol e GPT-6 Luna, que levam os nomes Sol e Luna para a geração seguinte. Em 30 de setembro de 2026, a lista de modelos da API recomenda o Astra para quem não sabe por onde começar, o GPT-6.1 Sol (lançado em 29 de setembro; no ChatGPT está disponível no Work e no Codex, não no chat) para equilibrar inteligência e custo ($2 de entrada / $10 de saída por milhão de tokens) e o GPT-6 Luna para cargas de alto volume em que o custo pesa mais ($0.10 / $0.50); os modelos GPT-5.6 não aparecem mais entre as recomendações (segundo a ajuda do ChatGPT, o GPT-5.6 Sol, o Terra e o Luna continuam disponíveis durante o período de transição). A Anthropic também lançou o Claude Opus 5 (24 de julho), o Claude Fable 5.1 (1º de setembro) e o Claude Opus 5.5 (22 de setembro). Para o custo, veja nossa comparação medida entre o Astra em low e o GPT-5.6 Sol em high. Expressões como "carro-chefe" e "liderança", assim como os valores de benchmark, referem-se ao momento em que o texto foi escrito. Em 22 de setembro também deixamos claro que a eficiência de custo do Luna no DeepSWE (cerca de 24 pontos por dólar) é uma estimativa de terceiros baseada em números da OpenAI, e indicamos a fonte.
Índice
- 1. Visão geral do lançamento — data, disponibilidade e especificações
- 2. Luna / Terra / Sol — diferenças entre os 3 modelos e como escolher
- 3. Estrutura de preços — o Terra, um nível abaixo, merece atenção
- 4. Benchmarks — comparação direta com o Claude
- 5. O que há de novo — 5 pontos principais
- 6. Disponibilidade por plano do ChatGPT
- 7. Comparação com o Claude (Fable 5 / Opus 4.8)
- 8. Pontos de atenção — benchmarks não divulgados e o ponto fraco em programação
- 9. Recomendações por uso — qual modelo escolher
- FAQ
Em 9 de julho de 2026, a OpenAI disponibilizou de forma geral a nova família de modelos "GPT-5.6" (anúncio oficial da OpenAI, lançamento formal após um preview limitado em 26 de junho). Sua característica mais marcante é o abandono da estrutura de dois níveis ("padrão + Pro") em favor de um sistema de 3 modelos: Luna (rápido e de baixo custo) / Terra (equilibrado) / Sol (carro-chefe).
O carro-chefe Sol assumiu a liderança ao registrar 80 no Artificial Analysis Coding Agent Index, o indicador de desempenho de agentes de programação, e também alcançou 53,6 no Agents' Last Exam, que mede fluxos de trabalho reais e longos, superando o Claude Fable 5 (40,5) por 13,1 pontos (valores publicados pela OpenAI, organizados pela Vellum). Por outro lado, na programação de nível de produção real medida pelo SWE-Bench Pro, o Claude Fable 5 marcou 80,0% e o Sol, 64,6%, mantendo áreas em que perde claramente para o Claude (os dois valores vêm da tabela de avaliação da OpenAI; o system card da Anthropic também dá ao Fable 5 80,0%; os 80,3% da tabela do anúncio da Anthropic são o maior dos dois resultados de uma coluna compartilhada, o do Mythos 5).
Neste artigo, com base no anúncio oficial da OpenAI e em vários relatórios de benchmark independentes, explicamos — apoiados em informações confirmadas — as diferenças entre os 3 modelos, os preços, os benchmarks, os novos recursos, a disponibilidade por plano do ChatGPT, a comparação com o Claude e como escolher conforme o uso do GPT-5.6.
Lançamento do GPT-5.6
Disponibilidade geral em 9 de julho de 2026 / sistema de 3 modelos
1. Visão geral do lançamento — data, disponibilidade e especificações
| Item | Detalhe |
|---|---|
| Nome da família | GPT-5.6 |
| Disponibilidade geral | 9 de julho de 2026 (preview limitado em 26 de junho) |
| Desenvolvedora | OpenAI |
| Geração anterior | GPT-5.5 |
| Composição dos modelos | 3 modelos: Luna (rápido e de baixo custo) / Terra (equilibrado) / Sol (carro-chefe) |
| Janela de contexto | Cerca de 1 milhão de tokens (1.050.000) * comum aos 3 modelos |
| Saída máxima | 128.000 tokens |
| Corte de conhecimento | 16 de fevereiro de 2026 |
| Preço da API (Sol) | $5 (entrada) / $30 (saída) per 1M tokens |
| Preço da API (Terra) | $2 (entrada) / $12 (saída) per 1M tokens |
| Preço da API (Luna) | $0.20 (entrada) / $1.20 (saída) per 1M tokens |
| Esforço de raciocínio | 6 níveis: none / low / medium / high / xhigh / max |
| Canais de disponibilização | ChatGPT / ChatGPT Work / Codex / OpenAI API |
| Anúncios simultâneos | ChatGPT Work (agente de trabalho), novo aplicativo de desktop com Codex integrado, modelo de voz GPT-Live |
O ponto central é que os 3 modelos compartilham a mesma janela de contexto de cerca de 1 milhão de tokens e a saída máxima de 128K. A diferença está em "inteligência", "velocidade" e "preço"; o volume de documentos que conseguem tratar é o mesmo. O design permite escolher verticalmente conforme o uso e o custo.
2. Luna / Terra / Sol — diferenças entre os 3 modelos e como escolher
A maior mudança do GPT-5.6 é a reorganização de "dois níveis (padrão/Pro)" para "três níveis". Vamos organizar o posicionamento de cada um.
O modelo mais barato e rápido. Ideal para classificação simples, resumo, chat e processamento em lote de grande volume. Com base nas pontuações do DeepSWE v1.1 e nos custos estimados de API que a OpenAI mostrou nos gráficos do lançamento, a Trilogy AI Center of Excellence (10 de julho de 2026) calculou que, em sua pontuação máxima, o Luna entrega cerca de 24 pontos por dólar estimado de API, bem acima dos 3,2 do Claude Fable 5 (os custos são estimativas simuladas pela própria OpenAI).
Usos indicados: tarefas de alta frequência e baixo custo unitário, ferramentas internas
A "aposta certa para o uso cotidiano", que entrega desempenho comparável ao da geração anterior GPT-5.5 por um preço bem mais baixo. No TerminalBench 2.1 marcou 87,4%, chegando bem perto do Sol, com preço unitário equivalente a 40% do Sol (após o corte de preços de 30 de julho de 2026). Muitas cargas de trabalho reais são posicionadas como bem atendidas pelo Terra.
Usos indicados: programação, redação e agentes do dia a dia
O modelo mais inteligente da família GPT-5.6. Nível máximo em capacidade geral de agente, tarefas longas e segurança. Segundo a OpenAI, a eficiência de tokens em programação melhorou 54%, alcançando "desempenho de fronteira com menos tokens".
Usos indicados: agentes complexos, tarefas autônomas de longa duração
O princípio para escolher é simples. Defina o Terra como padrão, suba para o Sol se a precisão não bastar e desça para o Luna se o custo unitário e a velocidade forem prioridade máxima — essa abordagem "partindo do Terra" facilita equilibrar custo e qualidade.
3. Estrutura de preços — o Terra, um nível abaixo, merece atenção
| Modelo | Entrada / 1M tokens | Saída / 1M tokens | Posicionamento |
|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 | Máximo desempenho |
| GPT-5.6 Terra | $2.00 | $12.00 | Equivalente ao GPT-5.5 por 40% do preço unitário do Sol |
| GPT-5.6 Luna | $0.20 | $1.20 | Mais barato e mais rápido |
O que merece atenção é a relação preço-desempenho do Terra. A OpenAI explica que "o Terra oferece desempenho comparável ao da geração anterior GPT-5.5 por cerca de metade do preço". Ou seja, muitas tarefas que antes exigiam o Sol (equivalente ao antigo modelo padrão) podem passar a rodar por metade do custo.
Por outro lado, os $5/$30 do Sol têm entrada com o mesmo valor do Claude Opus 4.8 ($5/$25) e saída um pouco mais cara. Os preços unitários entre carros-chefe estão praticamente se nivelando entre as empresas, e a diferença passou a aparecer no "desempenho" e na "eficiência de tokens".
4. Benchmarks — comparação direta com o Claude
Benchmarks do GPT-5.6 (4 itens principais)
Sol / Terra / Luna vs Claude Fable 5
Fonte: tabela de avaliação do anúncio do GPT-5.6 da OpenAI (Coding Agent Index da Artificial Analysis; o Agents' Last Exam do Sol vem do texto do anúncio). Os valores do Claude Fable 5 também vêm da tabela da OpenAI; o próprio anúncio da Anthropic dá SWE-Bench Pro 80,3% e TerminalBench 2.1 88,0% (em ambos os casos, o maior dos dois resultados de uma coluna compartilhada com o Mythos 5; o system card dá ao Fable 5 sozinho 80,0% e 84,3%)
| Benchmark | Sol | Terra | Luna | Claude Fable 5 |
|---|---|---|---|---|
| TerminalBench 2.1 | 88.8% | 87.4% | 84.7% | 83.1% |
| SWE-Bench Pro | 64.6% | 63.4% | 62.7% | 80.0% |
| Agents' Last Exam | 53.6 | 50.4 | 50.3 | 40.5 |
| Coding Agent Index | 80 | 77.4 | 74.6 | 77.2 |
| MRCR (recall de texto longo) | 91.5% | 89.6% | 41.3% | — |
Conclusão: forte como agente, mas o Claude é superior em programação de nível de produção real
O GPT-5.6 Sol assumiu o primeiro lugar em capacidade geral de agente (Agents' Last Exam) e no indicador de agente de programação. No TerminalBench, pela tabela da OpenAI, também supera o Claude Fable 5 (83,1%). Contudo, no SWE-Bench Pro (correção de bugs de nível de produção em repositórios reais), ele perde por mais de 15 pontos, com 64,6% do Sol contra 80,0% do Claude Fable 5 (Terra 63,4%, Luna 62,7%). A leitura franca é que "a capacidade de agir de forma autônoma como agente" e "a capacidade de corrigir com precisão uma base de código real" são coisas distintas.
Além disso, o recall de texto longo (MRCR) do Luna é de 41,3%, caindo muito em relação a Sol/Terra. Mesmo tendo uma janela de 1 milhão de tokens, o Luna não é adequado para tratar com precisão textos muito longos. Para textos longos, escolha Terra ou superior.
5. O que há de novo — 5 pontos principais
① De uma estrutura de dois níveis para um sistema de 3 modelos
A maior mudança. A antiga estrutura de "padrão + Pro caro" foi reorganizada em três níveis: Luna / Terra / Sol. O Terra, em especial, torna-se protagonista do dimensionamento de custos com sua relação preço-desempenho de "equivalente ao GPT-5.5 por 40% do preço unitário do Sol".
② Melhoria na eficiência de tokens (54% em programação)
O CEO da OpenAI, Sam Altman, afirmou que o Sol é 54% mais eficiente em tokens em tarefas de programação agêntica (em entrevista à CNBC; a base de comparação não foi informada). Se o mesmo trabalho consome menos tokens, o custo total cai mesmo que o preço unitário seja o mesmo. É por isso que a comparação deve considerar não só a tabela de preços, mas o "custo real por tarefa".
③ Programmatic Tool Calling (Responses API)
Como novo recurso para desenvolvedores, o "Programmatic Tool Calling", em que o modelo gera e executa JavaScript para orquestrar chamadas de ferramentas, foi adicionado à Responses API (análise de Simon Willison). Ele permite executar agentes complexos que percorrem várias ferramentas com menos idas e voltas. O esforço de raciocínio tem 6 níveis: none / low / medium / high / xhigh / max.
④ ChatGPT Work e novo aplicativo de desktop
Junto com o GPT-5.6 foram anunciados o agente para trabalho "ChatGPT Work", um novo aplicativo de desktop com o Codex integrado e um serviço de hospedagem para clientes. É um movimento para expandir o ChatGPT de "apenas um chat" para uma "plataforma que executa trabalho".
⑤ Modelo de voz GPT-Live (conversa full-duplex)
No lado da voz, surge a nova série GPT-Live. Em vez do tradicional sistema por turnos (responder somente após terminar de falar), ela viabiliza conversas em full-duplex, capazes de interromper e dar retorno como um humano. Usuários pagos recebem o GPT-Live-1 e usuários gratuitos, o GPT-Live-1 mini.
6. Disponibilidade por plano do ChatGPT
| Plano | Mensalidade aproximada | Uso do GPT-5.6 | Seleção de modelo |
|---|---|---|---|
| Free | $0 | △ Apenas Terra dentro do ChatGPT Work / Codex | Indisponível (fixo em Terra) |
| Go | $8/mês | △ Apenas Terra dentro do ChatGPT Work / Codex | Indisponível (fixo em Terra) |
| Plus | $20/mês | ✅ Sol / Terra / Luna | Disponível (também configura o esforço) |
| Pro | $100~$200/mês | ✅ Sol / Terra / Luna | Disponível (também configura o esforço) |
| Business | $25/assento~ | ✅ Sol / Terra / Luna | Disponível (também configura o esforço) |
| Enterprise | Sob consulta | ✅ Sol / Terra / Luna | Disponível (também configura o esforço) |
Uma característica é que usuários Free / Go também podem usar o Terra dentro do ChatGPT Work e do Codex. Porém, escolher livremente entre os modelos e ajustar o esforço de raciocínio só é possível a partir do Plus. O GPT-Live de voz tem a versão mini disponível até no plano gratuito. (A composição dos planos e os preços baseiam-se em diversas reportagens no momento do lançamento. Para o mais recente, consulte a página oficial de preços do ChatGPT.)
7. Comparação com o Claude (Fable 5 / Opus 4.8)
GPT-5.6 Sol vs Claude Fable 5 vs Claude Opus 4.8
Como usar cada um no nível carro-chefe
Resumindo — para "operar amplamente e de forma autônoma como agente", o GPT-5.6 Sol; para "corrigir com precisão uma base de código real ou programar por longos períodos", o Claude. Em termos de preço, o Claude Opus 4.8 ($5/$25) tem saída mais barata que a do Sol ($5/$30) e também alta qualidade de programação, de modo que, para usos de programação, o custo-benefício do lado Claude se destaca.
8. Pontos de atenção — benchmarks não divulgados e o ponto fraco em programação
① Há benchmarks que a OpenAI não divulgou
A análise independente (Vellum) apontou logo após o lançamento que a OpenAI não havia divulgado SWE-bench Verified, GPQA Diamond, AIME, MMLU, ARC-AGI-2 nem FrontierMath. No entanto, a tabela de avaliação da página de anúncio da OpenAI, consultada em 22 de setembro de 2026, inclui GPQA Diamond (Sol 94,6%) e FrontierMath (89% nos níveis 1–3 e 83% no nível 4). Não constam SWE-bench Verified, AIME nem MMLU, e o valor do Sol no ARC-AGI-2 (92,5%) só apareceu na tabela comparativa do anúncio do GPT-6 Astra, em 3 de setembro. O foco recai sobre indicadores de agente, e a escassez de valores de comparação em raciocínio geral e matemática é algo a considerar na avaliação. É preciso ler descontando a possibilidade de que apenas os bons números estejam sendo exibidos.
② Mesmo o Sol é fraco em programação de nível de produção real
Como dito, no SWE-Bench Pro o Sol tem 64,6% contra 80,0% do Claude Fable 5 (ambos da tabela de avaliação da OpenAI). Se o objetivo principal é corrigir bugs em repositórios de produção ou criar PRs, vale mais considerar o Claude do que o GPT-5.6. Vale notar que, embora coloque esse valor na tabela, a OpenAI publicou à parte uma análise segundo a qual cerca de 30% das tarefas do SWE-Bench Pro têm falhas (como aponta a Vellum).
③ O Luna não é bom com textos longos
O Luna é barato e rápido, mas seu recall de texto longo (MRCR) é baixíssimo, de 41,3%. Evite entregar especificações, logs ou bases de código longas inteiras ao Luna e delegue textos longos ao Terra ou superior.
④ O corte de conhecimento é 16 de fevereiro de 2026
Acontecimentos posteriores a essa data não foram aprendidos. Tarefas que exigem informações atuais pressupõem o uso conjunto de ferramentas de busca na web.
9. Recomendações por uso — qual modelo escolher
- Programação, redação e resumos do dia a dia
- Foco no equilíbrio entre custo e qualidade
- O modelo "para usar como padrão primeiro"
- Operação de agentes autônomos complexos
- Tarefas de longa duração e trabalho de segurança
- Situações em que a precisão importa mais que o custo
- Processamento em massa de alta frequência e baixo custo
- Classificação, extração e chats curtos
- Foco em textos curtos (evite textos longos)
- Correção de bugs e PRs em repositórios de produção
- Programação autônoma de longa duração
- Precisão e segurança como prioridade máxima
FAQ
Q1. A partir de quando o GPT-5.6 pode ser usado?
A disponibilidade geral começou em 9 de julho de 2026 (o preview limitado foi em 26 de junho). Ele pode ser usado no ChatGPT, ChatGPT Work, Codex e OpenAI API.
Q2. Qual a diferença entre Luna / Terra / Sol?
São modelos alinhados verticalmente em três eixos: inteligência, velocidade e preço. Luna = mais barato e rápido; Terra = equilibrado (equivalente ao GPT-5.5 por 40% do preço unitário do Sol); Sol = máximo desempenho. O contexto (cerca de 1 milhão de tokens) e a saída máxima (128K) são comuns aos 3 modelos. Recomenda-se definir o Terra como padrão e mover para Sol/Luna conforme a necessidade.
Q3. É possível usar o GPT-5.6 no plano gratuito?
No chat comum não, mas dentro do ChatGPT Work e do Codex, mesmo Free / Go podem usar o Terra. Para escolher livremente entre os modelos e ajustar o esforço de raciocínio é preciso o Plus ($20/mês) ou superior. O GPT-Live de voz tem a versão mini disponível até no gratuito.
Q4. Entre GPT-5.6 e Claude, qual é mais forte em programação?
Depende do indicador. Na operação de terminal (TerminalBench 2.1), o Sol com 88,8% supera os 83,1% do Claude Fable 5, mas no nível de produção real do SWE-Bench Pro, o Claude Fable 5 tem 80,0% e o Sol, 64,6%, com o Claude bem à frente (todos os valores da tabela de avaliação da OpenAI; o system card da Anthropic também dá ao Fable 5 80,0% no SWE-Bench Pro). Se o objetivo principal é corrigir bugs em repositórios de produção, o realista é usar o Claude; para agentes autônomos amplos, o Sol.
Q5. Como ficam os preços?
Por 1M de tokens: Sol $5/$30, Terra $2/$12, Luna $0.20/$1.20 (entrada/saída), em agosto de 2026. Em 30 de julho de 2026, o Luna ficou 80% mais barato e o Terra, 20%, enquanto o Sol permaneceu inalterado. O Terra se posiciona como oferecendo desempenho equivalente à geração anterior GPT-5.5 por cerca de 40% do preço unitário do Sol, tornando-se protagonista do dimensionamento de custos. Vale notar que o Sol passou a ter preço promocional em 21 de agosto de 2026 (entrada $4 / saída $20, anunciado para valer por três meses). Se isso sai mais barato que o GPT-6 Astra é o que comparamos com valores medidos em O GPT-6 Astra em low é mesmo mais barato?
Q6. Qual é a janela de contexto e o corte de conhecimento?
Os 3 modelos têm contexto de cerca de 1 milhão de tokens (1.050.000) e saída máxima de 128K. O corte de conhecimento é 16 de fevereiro de 2026.
Q7. Há novos recursos para desenvolvedores?
Foi adicionado à Responses API o Programmatic Tool Calling (recurso em que o modelo gera JavaScript para montar chamadas de ferramentas). O esforço de raciocínio pode ser controlado em 6 níveis: none / low / medium / high / xhigh / max.
Q8. O que é o GPT-Live?
É uma nova série de modelos de voz anunciada junto com o GPT-5.6. Em vez do sistema por turnos, ela é full-duplex, permitindo conversas naturais com interrupções e retornos. A versão paga é o GPT-Live-1 e a gratuita, o GPT-Live-1 mini.
Q9. Há benchmarks que a OpenAI não divulgou?
Sim. A tabela de avaliação do anúncio não inclui SWE-bench Verified, AIME nem MMLU. A análise independente (Vellum) apontou logo após o lançamento que GPQA Diamond e FrontierMath também faltavam, mas a tabela consultada em 22 de setembro de 2026 inclui GPQA Diamond (Sol 94,6%) e FrontierMath. Como o foco recai sobre indicadores de agente, o desempenho em raciocínio geral e matemática precisa ser avaliado à parte.
Q10. Os aplicativos GPT existentes continuam funcionando normalmente?
A API é amplamente compatível e a migração é possível apenas trocando o ID do modelo. Porém, como agora há um sistema de 3 modelos, redesenhar a qual tarefa atribuir Luna/Terra/Sol permite otimizar custo e qualidade. Em muitos casos, partir do Terra é eficaz.
Conclusão: rumo à era de "escolher verticalmente" com o sistema de 3 modelos
O GPT-5.6 chegou não como um único modelo de destaque, mas com uma estrutura de três níveis: Luna / Terra / Sol. O Sol assumiu a liderança em capacidade geral de agente e no indicador de agente de programação; o Terra tornou-se o protagonista do trabalho real com sua relação preço-desempenho de "equivalente ao GPT-5.5 por 40% do preço unitário do Sol"; e o Luna assume o papel de custo-benefício no processamento em massa — cada um com seu papel bem definido.
Por outro lado, ele perde por larga margem para o Claude na programação de nível de produção real (SWE-Bench Pro), e há elementos que impedem chamá-lo de melhor incondicionalmente: a tabela de avaliação da OpenAI traz poucos valores de comparação em raciocínio geral e matemática, e o Luna é fraco no tratamento de textos longos.
A operação inteligente em 2026 continua sendo "usar os 3 modelos do GPT-5.6 e o Claude conforme a tarefa". Terra para o dia a dia, Sol para agentes complexos, Luna para processamento em massa e Claude para programação de produção — vamos otimizar custo e qualidade partindo do princípio do multimodelo.
Artigos relacionados
- GPT-6 Astra: guia completo do lançamento — o carro-chefe que sucede ao GPT-5.6
- GPT-5.5: guia completo do lançamento — detalhes da geração anterior GPT-5.5
- Claude Opus 4.8: guia completo do lançamento — o modelo concorrente direto
- Claude Fable 5: guia completo do lançamento — o modelo líder no SWE-Bench Pro
- Claude vs ChatGPT: comparação de preços — a estrutura de planos de ambos
- O que é o ChatGPT Work? O agente de trabalho do GPT-5.6 — o agente que cria documentos, planilhas e slides
- GPT-5.6 vs GPT-5.5: o que mudou e para qual modelo migrar — os 3 modelos Luna/Terra/Sol e Terra a 40% do preço
- O que é o Kimi K3? O modelo de 2,8 trilhões de parâmetros por trás do "terceiro lugar" — preço, pesos abertos e impacto no mercado