Índice
- 1. O que é o Kimi K3 — especificações centrais e a empresa
- 2. O que "terceiro lugar" significa de fato — qual ranking e em que data
- 3. Quem mediu os benchmarks — separando os números do fabricante dos de terceiros
- 4. Preço: o veredito muda conforme aquilo com que você compara
- 5. Ninguém consegue baixar ainda — em que pé estão os pesos abertos
- 6. Quanto caíram as ações americanas — os números variam conforme o veículo
- 7. A acusação de destilação e a réplica
- 8. Pontos fracos — velocidade, alucinação e a avaliação da própria Moonshot
- 9. Como testar hoje
- 10. Separando as afirmações por grau de certeza
- FAQ
Em 16 de julho de 2026, a chinesa Moonshot AI lançou o Kimi K3. Com 2,8 trilhões de parâmetros no total, ele é apresentado como o maior modelo aberto já feito, e poucos dias depois do lançamento as ações de semicondutores dos EUA eram vendidas em massa enquanto um funcionário da Casa Branca acusava publicamente a empresa de destilar os modelos da Anthropic.
O problema é que os números, e até os rótulos, divergem dependendo de quem os informa. Este artigo cruza as casas que publicam os benchmarks, a imprensa financeira, os anúncios da própria Moonshot e a página real no Hugging Face, e diz quem produziu cada número ao longo do caminho.
57 pontos, terceiro lugar na Artificial Analysis no lançamento. Primeiro no Frontend Code Arena, da Arena.ai. No conjunto, porém, não alcança o Fable 5 nem o GPT-5.6 Sol.
A US$ 3 de entrada e US$ 15 de saída, é claramente mais barato que o Opus 4.8 ou o GPT-5.6 Sol. Ainda assim, é o mais caro dos modelos chineses — o triplo do GLM-5.2.
A liberação está marcada para 27 de julho. Até a redação deste texto, o Hugging Face ainda exibe uma contagem regressiva e a licença não foi anunciada.
1. O que é o Kimi K3 — especificações centrais e a empresa
O Kimi K3 é o modelo carro-chefe da Moonshot AI, e a API entrou no ar em 16 de julho de 2026 (informação consistente entre ITmedia NEWS, OpenRouter e outros). A empresa foi fundada em 2023, é financiada por Alibaba e Tencent e, segundo a Forbes, sua rodada de captação mais recente levou a avaliação a mais de US$ 20 bilhões (contra US$ 4,3 bilhões e depois US$ 10 bilhões), com ARR de US$ 200 milhões em abril de 2026.
Fontes: o anúncio da Moonshot AI (conforme noticiado pelo ITmedia NEWS, citando o texto de npaka) e o artigo prático da Northflank. O tamanho do contexto e o tamanho dos pesos são medições da Northflank.
Duas adições arquiteturais ganharam nome próprio. A Kimi Delta Attention (KDA) acelera a decodificação em contextos de um milhão de tokens; a AINews a descreve como até 6,3x mais rápida. E os Attention Residuals (AttnRes) puxam seletivamente as representações necessárias de camadas anteriores; o mesmo artigo estima o ganho em cerca de 25% de eficiência a mais no treinamento por menos de 2% de custo adicional. Os pesos são MXFP4 e as ativações MXFP8, e, em vez de aplicar a quantização depois, o treinamento foi conduzido com a quantização embutida a partir do SFT.
🟡 Não existe número oficial de parâmetros ativos. A notação "2.8T-A50B" (cerca de 50 bilhões ativos) circula por aí, mas é uma estimativa derivada da proporção 16/896, não um número publicado pela Moonshot — a Northflank observa explicitamente que a Moonshot nunca informou a contagem de parâmetros ativos. Vale lembrar também que nem a OpenAI nem a Anthropic divulgam a contagem de parâmetros dos próprios modelos, de modo que "2,8 trilhões, o maior do mundo" só vale entre os modelos cujo tamanho é público.
2. O que "terceiro lugar" significa de fato — qual ranking e em que data
Dizer que ele fica em "terceiro, atrás dos modelos mais recentes da OpenAI e da Anthropic" está em linhas gerais correto. Mas, sem fixar a fonte, os números deixam de fechar mais adiante.
A base é o Intelligence Index da Artificial Analysis. Em sua análise de 17 de julho de 2026, a empresa atribuiu 57 pontos ao Kimi K3, colocando-o em terceiro atrás do Claude Fable 5 e do GPT-5.6 Sol, e avaliou sua inteligência como equivalente à do Opus 4.8 e do GPT-5.5. Como referência, o mesmo índice dá 51 ao GLM-5.2 e 44 ao DeepSeek v4 Pro.
⚠️ Os mesmos 57 pontos são reportados como 3º, 4º e 7º
O próprio anúncio da Artificial Analysis diz terceiro, a contagem da Northflank diz quarto entre 189 modelos e a página ao vivo da empresa mostra sétimo entre 190. A pontuação (57) nunca mudou, então a diferença vem do que entra na comparação — se variantes com esforço de raciocínio diferente contam separadamente — e de quando a contagem foi feita. Os rankings se mexem todo dia, e "terceiro" deve ser lido como um retrato datado de 17 de julho de 2026.
Em métricas mais próximas do trabalho real, a ordenação fica mais nítida. Veja o GDPval-AA v2 da Artificial Analysis, que pontua tarefas práticas numa escala Elo com a linha de base humana fixada em 1.000.
| Modelo | GDPval-AA v2 (Elo) | Onde se posiciona |
|---|---|---|
| Claude Fable 5 | 1760 | 1º |
| Kimi K3 | 1668 | Atrás do Fable 5 e do Sol |
| Claude Opus 4.8 | 1600 | O K3 supera |
| GLM-5.2 | 1514 | O melhor da geração chinesa anterior |
| GPT-5.5 | 1494 | — |
| Kimi K2.6 (geração anterior) | 1190 | O K3 está 478 pontos acima |
Fonte: Artificial Analysis (artigo da empresa publicado em 17 de julho de 2026). No AA-Briefcase, sua avaliação agêntica privada, o K3 também fica em segundo atrás do Fable 5, com Elo 1547, 732 pontos a mais que a geração anterior K2.6. No AutomationBench-AA ele fica em primeiro lugar, com 53%.
O número que realmente importa não é o "terceiro", e sim o tamanho do salto em relação à geração anterior. De 1190 para 1668 no GDPval-AA v2, e +732 pontos no AA-Briefcase. O que moveu o mercado foi o fato de um modelo aberto chinês ter chegado a um passo da fronteira americana em uma única geração.
3. Quem mediu os benchmarks — separando os números do fabricante dos de terceiros
Os números de benchmark têm peso muito diferente conforme tenham sido medidos pela própria Moonshot ou por um terceiro. O ITmedia noticiou os dois grupos separadamente, e este artigo faz o mesmo.
- Program Bench: K3 77,8% (GPT-5.6 Sol 77,6%, Fable 5 76,8%)
- SWE Marathon: K3 42,0% (segundo, com o Opus 4.8 em 40,0%)
- BrowseComp: K3 91,2% (GPT-5.6 Sol 90,4%)
Todas as vitórias são apertadas, e todas vêm de testes do próprio fabricante — leia os números com isso em mente.
- Frontend Code Arena (Arena.ai): K3 em primeiro, com 1679 (Fable 5 1631, GPT-5.6 Sol 1618). Ele lidera seis dos sete subdomínios, subindo 17 posições em relação ao 18º lugar do K2.6
- GDPval-AA v2: K3 em terceiro, com 1668 (Artificial Analysis)
- FrontierSWE: Fable 5 86,6% > K3 81,2% ← aqui o K3 perde
- Vals Index: 74,70% (segundo entre 38 modelos, segundo a contagem da Northflank)
O resultado que merece atenção é que ele fica 5,4 pontos atrás do Fable 5 no FrontierSWE. As manchetes sobre liderar certos benchmarks são exatas, mas ele não está vencendo em toda a linha. A própria Moonshot admite ficar aquém do Fable 5 e do GPT-5.6 Sol no conjunto (mais sobre isso adiante).
🟡 O método de pontuação foi contestado. O autor do Program Bench apontou que a Moonshot usou uma taxa média de implementação em vez do número de programas que rodaram até o fim. A empreendedora de IA Bindu Reddy defendeu, separadamente, que é preciso verificação em avaliações privadas não contaminadas, como o LiveBench. Vitórias apertadas informadas pelo fabricante devem ser descontadas na mesma medida.
4. Preço: o veredito muda conforme aquilo com que você compara
O Kimi K3 custa US$ 3,00 de entrada e US$ 15,00 de saída por milhão de tokens (US$ 0,30 para entrada em cache). Como a avaliação se inverte completamente conforme a comparação, olhar só para um dos lados leva à conclusão errada.
- Kimi K3: US$ 3 / US$ 15
- Claude Opus 4.8: US$ 5 / US$ 25
- GPT-5.6 Sol: US$ 5 / US$ 30
Cerca de 40% mais barato na entrada e 40% a 50% mais barato na saída. Desempenho de fronteira abaixo do preço ocidental sempre foi o discurso da Kimi, e nesse ponto ele se sustenta.
- Kimi K3: US$ 3 / US$ 15
- GLM-5.2: cerca de um terço do custo por tarefa do K3
- DeepSeek V4 Pro: cerca de um vinte e três avos do custo por tarefa do K3
Simon Willison, chamando o valor de um aumento acentuado em relação aos modelos anteriores da empresa, o descreve como o modelo mais caro já lançado por um laboratório de IA chinês.
Uma coisa precisa ficar clara: este não é um novo choque DeepSeek. O que tornou o DeepSeek de janeiro de 2025 tão perturbador foi um preço uma ordem de grandeza abaixo do ocidental. O K3 é 40% a 50% mais barato que os modelos ocidentais, mas na mesma ordem de grandeza. Isso não é ruptura de preço; é desempenho alcançando os líderes, com um desconto moderado.
E o que você paga de fato não é definido apenas pela tarifa por token. A Artificial Analysis mediu o custo real de concluir uma tarefa enquanto rodava seu Intelligence Index.
Custo por tarefa medido pela Artificial Analysis (durante a execução do Intelligence Index)
Fonte: Artificial Analysis. Nas medições da empresa, o Kimi K3 precisou de cerca de 132 milhões de tokens de saída para concluir o Intelligence Index, menos que os cerca de 166 milhões consumidos pela geração anterior K2.6. A tarifa é mais alta, mas um raciocínio menos prolixo derruba o total.
Mais barato que o Opus 4.8 tanto no preço de tabela quanto no custo medido, e o mais caro dos modelos chineses — esse é o quadro completo do preço. O enquadramento "é chinês, logo é baratíssimo" não se aplica, e descartá-lo como caro é igualmente errado assim que você o compara com o Ocidente.
5. Ninguém consegue baixar ainda — em que pé estão os pesos abertos
Os veículos nem sequer concordam sobre como chamá-lo. A VentureBeat o anuncia como o "maior modelo de código aberto já feito" e o SCMP como o "maior modelo de IA de código aberto do mundo", enquanto a Reuters escreve "de pesos abertos". Este último é o termo tecnicamente correto, e eis por quê.
O repositório moonshotai/Kimi-K3 no Hugging Face ainda mostra uma contagem regressiva, sem um único arquivo safetensors listado. A página do modelo na Artificial Analysis também o marca como proprietário. Verificado em 27 de julho de 2026 — que é a própria data prevista para a liberação, então a situação muito provavelmente já mudou quando você ler isto. Siga o link acima para ver o estado atual.
Em 17 de julho, a Northflank afirma sem rodeios que a licença não foi anunciada. Uma publicação da comunidade no Hugging Face igualmente a lista como indefinida até os pesos chegarem. A afirmação de que será "Modified MIT" é uma inferência de segunda mão a partir da geração K2 e não está resolvida.
O que foi prometido são os pesos treinados, não os dados nem o código de treinamento. O nome correto para esse arranjo é pesos abertos, que é coisa diferente de código aberto tal como a OSI o define.
Mesmo depois que sair, isso não é algo que uma pessoa física consiga rodar. Em 4 bits (MXFP4), só os pesos somam cerca de 1,4 TB e, com folga para o cache KV e as ativações, a Northflank estima que é preciso algo da ordem de oito nós com oito GPUs de 80 GB cada, enquanto a Moonshot recomenda um supernó de 64 aceleradores ou mais. Ele não cabe em uma única H100, H200 ou B200, um cluster distribuído é obrigatório e a implantação em produção é, na prática, só Linux com NVIDIA. Isso não tem nada a ver com as montagens pessoais tratadas em os requisitos de hardware para LLMs locais.
Dito isso, ainda assim importa muito. Quando pesos de nível de fronteira descem à terra, organizações que não podem deixar os dados saírem de suas paredes — setores regulados, órgãos públicos — passam a poder rodá-los internamente. A simples existência de um modelo público em pé de igualdade muda o poder de barganha das APIs fechadas. As premissas por trás de como escolher um modelo aberto precisam ser atualizadas por causa deste lançamento.
6. Quanto caíram as ações americanas — os números variam conforme o veículo
As ações de semicondutores dos EUA realmente foram vendidas em massa durante a semana do lançamento. Mas os percentuais de queda noticiados conflitam entre os veículos, então aqui eles aparecem como faixas, e não como fatos assentados.
| O que se moveu | Movimento noticiado | Fonte e observações |
|---|---|---|
| Nasdaq | -1,5% na sexta-feira (seu pior pregão da semana) | Yahoo Finance |
| Mercado de Taiwan | Mais de -6% | Idem |
| Mercado japonês | Fechou a -4% | Idem |
| ETF de semicondutores (SMH) | Queda de mais de 20% em relação à máxima do fim de junho | Idem |
| Índice de Semicondutores da Filadélfia (SOX) | -9% a -12,5% na semana | ⚠️ O número difere conforme o veículo ("12,5%, pior semana em 15 meses", "mais de 9%", "cerca de 10%, a mais acentuada desde abril de 2025") |
| Ações individuais (17 de julho) | AMD -5%, Intel -4%, NVIDIA -3% (todas no intradiário, com recuperação depois) | 24/7 Wall St. |
| Empresas chinesas de IA listadas em Hong Kong | Zhipu -28,4%, MiniMax -15,6% (17 de julho) | Forbes. As chinesas apanharam mais |
Para efeito de comparação, no choque DeepSeek de janeiro de 2025, ao qual todo mundo recorre, o Yahoo Finance noticiou que só a NVIDIA perdeu cerca de US$ 590 bilhões de valor de mercado em um único pregão. A queda da NVIDIA desta vez foi de 3% no intradiário — uma escala completamente diferente.
🟡 A queda já foi recuperada desde então
O Yahoo Finance noticiou depois que compradores de oportunidade entraram e as ações de chips reduziram as perdas, e o Bank of America adotou a visão serena de que aquilo foi apenas uma correção de verão. Os analistas também estão divididos. Robin Zhu, da Bernstein, enquadrou o K3 como confirmatório — mais um dado dentro da tendência já conhecida de os laboratórios chineses estarem encurtando a distância. Já Gary Yu, do Morgan Stanley, disse que o K3 teve recepção favorável no mundo todo e mostra que os LLMs chineses estão alcançando os líderes americanos em escala, desempenho e preço igualmente.
Circula também um número segundo o qual US$ 470 bilhões em valor ligado a IA evaporaram em três dias, mas ele remonta a uma nota rápida de um veículo de criptomoedas e não pôde ser corroborado na grande imprensa financeira, de modo que este artigo não o utiliza.
7. A acusação de destilação e a réplica
Entre 22 e 23 de julho, a história saiu da tecnologia e entrou na geopolítica. Michael Kratsios, diretor do Escritório de Política Científica e Tecnológica da Casa Branca (OSTP), fez duas afirmações sobre a Moonshot, conforme noticiado por CNBC, The Hill, Yahoo News e outros.
Que a Moonshot obteve servidores equipados com NVIDIA GB300 e também teve acesso a GB300 na Tailândia, possivelmente usando-os para treinar os próprios modelos. A GB300 é uma peça da geração Blackwell e não pode ser vendida legalmente para a China.
Que a empresa realizou destilação encoberta em escala industrial contra o Fable, da Anthropic, e chegou a montar uma plataforma dedicada que alternava métodos de acesso para escapar da detecção. Jacob Helberg, que o acompanhava, chamou aquilo de roubo de valiosa propriedade intelectual americana.
O funcionário da Moonshot Randy Xian respondeu com ironia no X que o Fable veio a público em 1º de julho e o K3 saiu em 15 de julho, então aparentemente treinamos um modelo de fronteira do zero em 15 dias — um feito para os livros. O pesquisador de IA Braden Hancock disse ao TechCrunch que o Fable só estava disponível desde 1º de julho e que destilar tantos dados, treinar com eles e lançar em duas semanas é impossível.
🔴 Nenhuma evidência foi tornada pública. Segundo o SCMP, vários especialistas em IA chamaram a acusação de política e imprudente, e observaram que as saídas de um modelo, para começo de conversa, não são protegidas por direitos autorais. A Reuters, citando telegramas diplomáticos, noticiou que o Departamento de Estado havia instruído embaixadas ainda em abril a informar os governos anfitriões sobre violação de propriedade intelectual por empresas chinesas de IA, com a Moonshot entre as citadas. Ou seja, essas acusações são anteriores ao lançamento do K3, e nenhuma evidência específica sobre o K3 foi apresentada.
Nem o lado americano está unido nisso. A NVIDIA criticou publicamente a Anthropic pelo nome, dizendo, a respeito das afirmações da Anthropic sobre brechas no controle de exportações, que as empresas americanas deveriam focar em inovação e encarar o desafio, em vez de contar histórias da carochinha.
8. Pontos fracos — velocidade, alucinação e a avaliação da própria Moonshot
Ficaram para trás das manchetes de desempenho três pontos fracos que mordem em produção.
As medições ao vivo da Artificial Analysis mostram 33 tokens por segundo (145º entre 190 modelos) e 177 segundos até o primeiro token. Já a Northflank relata 62 tokens por segundo e 1,99 segundo. A maior parte dessa diferença é aperto de capacidade por causa da demanda avassaladora — o OpenRouter mantém um aviso no modelo de que a capacidade upstream está limitada e erros 429 podem ser frequentes.
A Artificial Analysis relata que, embora a precisão tenha melhorado, a taxa de alucinação subiu de 39% para 51%. Uma pontuação de inteligência mais alta não é a mesma coisa que factualidade, e este não é um modelo que se possa usar sem verificação.
A empresa diz que há uma diferença clara de experiência de uso entre o seu modelo e tanto o Claude Fable 5 quanto o GPT-5.6 Sol. A leitura dela mesma é que margens apertadas em benchmark e a sensação de usar um modelo no dia a dia são duas coisas distintas.
9. Como testar hoje
Antes de os pesos chegarem, há três formas de experimentá-lo.
| Caminho | Detalhes | Para quem serve |
|---|---|---|
| App / web oficial do Kimi | Em kimi.com. Há um plano gratuito | Quem só quer avaliar a qualidade |
| API da Moonshot | US$ 3 de entrada, US$ 15 de saída, US$ 0,30 em acertos de cache (por milhão de tokens) | Times que vão embuti-lo no próprio produto |
| Via OpenRouter | OpenRouter. O mesmo endpoint pelo qual você já chama outros modelos | Quem está comparando vários modelos |
| Auto-hospedagem | Depois da liberação dos pesos (marcada para 27 de julho). A recomendação é de 64 aceleradores ou mais, e você precisa de agendamento ciente de MoE em vLLM, TensorRT-LLM ou SGLang | Organizações cujos dados não podem sair de casa |
Tenha em mente, porém, que, como observado acima, a capacidade está apertada e os 429 são comuns. Antes de mover uma carga de produção inteira para lá, a abordagem realista — o mesmo raciocínio de escolher entre nuvem e local — é direcionar uma fatia do tráfego para ele com um plano de contingência pronto.
10. Separando as afirmações por grau de certeza
- API lançada em 16 de julho de 2026; 2,8 trilhões de parâmetros totais; 16 dos 896 especialistas ativos; 1 milhão de tokens
- Preço de API de US$ 3 de entrada, US$ 15 de saída, US$ 0,30 em cache
- 57 pontos no Artificial Analysis Intelligence Index
- 1668 no GDPval-AA v2 (Fable 5 = 1760, Opus 4.8 = 1600)
- Primeiro lugar com 1679 no Frontend Code Arena
- Custo por tarefa de US$ 0,94, abaixo dos US$ 1,80 do Opus 4.8
- Taxa de alucinação subindo de 39% para 51%
- Sua colocação no Intelligence Index (3º, 4º e 7º, todos em circulação)
- A queda semanal do SOX (-9% a -12,5%)
- A velocidade de saída (33 tok/s contra 62 tok/s)
- Parâmetros ativos de "cerca de 50 bilhões" (uma estimativa, não um número oficial)
- Uma licença "Modified MIT" (inferida do K2)
- A acusação de destilação — sem evidência pública, e pesquisadores a rejeitam pela cronologia
- Acesso a chips embargados — afirmação de um funcionário do governo dos EUA; nem a resposta formal da Moonshot nem qualquer evidência são públicas
- Pesos e licença — não liberados até a redação deste texto (previstos para 27 de julho)
- "US$ 470 bilhões em valor de IA perdidos em três dias" — não pôde ser corroborado na grande imprensa financeira
Em resumo, a história real do Kimi K3 é o fato de um modelo aberto chinês ter chegado ao alcance da fronteira. Ele chegou lá 40% a 50% abaixo do preço de fronteira ocidental, ainda que não com um desconto de uma ordem de grandeza; fica atrás do Fable 5 e do GPT-5.6 Sol no conjunto; é lento; e alucina mais. Mesmo assim, empurrou o GDPval-AA v2 em 478 pontos em uma única geração e se comprometeu a publicar seus pesos — e foi a isso que o mercado reagiu.
FAQ
Q1. O Kimi K3 é código aberto?
Não. O que está previsto é a liberação dos pesos treinados, ou seja, pesos abertos, e não a liberação dos dados nem do código de treinamento. Além disso, até a redação deste texto os próprios pesos ainda não saíram — a página moonshotai/Kimi-K3 no Hugging Face ainda exibe uma contagem regressiva e nenhuma licença foi anunciada. A liberação está marcada para 27 de julho de 2026.
Q2. Ele está mesmo em terceiro nos benchmarks?
A base são 57 pontos e o terceiro lugar no Intelligence Index da Artificial Analysis, atrás do Claude Fable 5 e do GPT-5.6 Sol, e, em 17 de julho de 2026, essa leitura está correta. Mas também existem contagens que colocam os mesmos 57 pontos em quarto e em sétimo, porque o resultado muda conforme se define o conjunto de comparação e quando a contagem foi feita. Leia "terceiro" como um retrato datado. No Frontend Code Arena, voltado a código, ele fica em primeiro, enquanto no FrontierSWE perde para o Fable 5.
Q3. Ele é mesmo barato?
A resposta se inverte conforme a comparação. A US$ 3 de entrada e US$ 15 de saída por milhão de tokens, ele é cerca de 40% mais barato na entrada e de 40% a 50% mais barato na saída que o Claude Opus 4.8 (US$ 5/US$ 25) ou o GPT-5.6 Sol (US$ 5/US$ 30), então, diante da fronteira ocidental, é claramente barato. O custo medido concorda: US$ 0,94 por tarefa contra US$ 1,80 do Opus 4.8 (Artificial Analysis). Diante dos rivais chineses, porém, ele é o mais caro do grupo — cerca de três vezes o GLM-5.2 e 23 vezes o DeepSeek V4 Pro. Simon Willison o chama de o modelo mais caro já lançado por um laboratório de IA chinês. Este não é o desconto de uma ordem de grandeza do choque DeepSeek.
Q4. Por que as ações americanas caíram?
Por causa do receio de que modelos chineses baratos reduzam a demanda por computação cara. Na semana do lançamento, o Nasdaq caiu 1,5% na sexta-feira, Taiwan mais de 6%, o Japão 4%, e o ETF de semicondutores (SMH) acumulava queda de mais de 20% em relação à máxima do fim de junho. Dito isso, as ações de chips reduziram as perdas em seguida, com a entrada de compradores de oportunidade, e o Bank of America classificou o episódio como apenas uma correção de verão. A escala é diferente da do choque DeepSeek, quando só a NVIDIA perdeu cerca de US$ 590 bilhões em um único dia, em janeiro de 2025.
Q5. É verdade que eles roubaram o modelo da Anthropic?
Nenhuma evidência foi tornada pública. Michael Kratsios, diretor do OSTP da Casa Branca, alegou destilação em escala industrial do Fable, da Anthropic, mas a Moonshot nega, apontando a janela de 15 dias entre a estreia pública do Fable em 1º de julho e o lançamento do K3 em 15 de julho. O pesquisador de IA Braden Hancock disse igualmente ao TechCrunch que destilar, treinar e lançar em duas semanas é impossível. Segundo o SCMP, vários especialistas criticaram a acusação como política. Não há material suficiente para chegar a um veredito neste momento.
Q6. Dá para rodá-lo no meu próprio PC?
Não. Mesmo com quantização de 4 bits (MXFP4), só os pesos ficam em torno de 1,4 TB, o que não cabe em uma única H100, H200 ou B200. A Northflank estima algo como oito nós com oito GPUs de 80 GB cada, e a Moonshot recomenda 64 aceleradores ou mais. macOS e Windows estão fora de escopo para uso em produção; a premissa é Linux com NVIDIA. Esta é uma escala completamente diferente de rodar um LLM local por conta própria.
Q7. Devo usá-lo em produção?
Migrar tudo de uma vez não é aconselhável, por três motivos: (1) a capacidade está apertada e os erros 429 podem ser frequentes (aviso do próprio OpenRouter); (2) a taxa de alucinação subiu de 39% para 51%; e (3) a própria Moonshot admite uma diferença clara de experiência de uso em relação ao Fable 5 e ao GPT-5.6 Sol. O caminho realista é manter um plano de contingência e direcionar parte do tráfego por ele numa área em que ele se destaca, como geração de código de front-end, e então comparar.
Q8. Quanto ele é melhor que o K2.6 anterior?
O tamanho do salto é a verdadeira história aqui. No GDPval-AA v2 da Artificial Analysis ele foi de 1190 para 1668, um ganho de 478 pontos, e no AA-Briefcase, a avaliação agêntica privada da empresa, ganhou 732 pontos. No Frontend Code Arena da Arena.ai ele subiu 17 posições, do 18º para o 1º. O que o mercado respondeu foi menos à colocação absoluta e mais a quanto terreno ele recuperou em uma geração.
Artigos relacionados
- Análise do lançamento do Claude Fable 5: recursos, benchmarks, preço, a diferença do Mythos e o novo design de segurança
- Lançamento do GPT-5.6 explicado: Luna/Terra/Sol, benchmarks, preços e a comparação com o Claude
- Claude Opus 5 lançado: o que muda em relação ao Opus 4.8 e ao Fable 5 e o que observar na migração
- Os melhores modelos de LLM local comparados [2026]: como escolher por uso e tamanho
- De que specs de PC você precisa para um LLM local? Um guia rápido de VRAM, GPU e RAM [2026]
- O guia completo dos formatos de quantização: GGUF, GPTQ, AWQ e qual arquivo escolher