Em 16 de julho de 2026, a chinesa Moonshot AI lançou o Kimi K3. Com 2,8 trilhões de parâmetros no total, ele é apresentado como o maior modelo aberto já feito, e poucos dias depois do lançamento as ações de semicondutores dos EUA eram vendidas em massa enquanto um funcionário da Casa Branca acusava publicamente a empresa de destilar os modelos da Anthropic.

O problema é que os números, e até os rótulos, divergem dependendo de quem os informa. Este artigo cruza as casas que publicam os benchmarks, a imprensa financeira, os anúncios da própria Moonshot e a página real no Hugging Face, e diz quem produziu cada número ao longo do caminho.

PONTOS-CHAVE
Desempenho
Terceiro no geral, primeiro em código

57 pontos, terceiro lugar na Artificial Analysis no lançamento. Primeiro no Frontend Code Arena, da Arena.ai. No conjunto, porém, não alcança o Fable 5 nem o GPT-5.6 Sol.

Preço
O veredito muda conforme a comparação

A US$ 3 de entrada e US$ 15 de saída, é claramente mais barato que o Opus 4.8 ou o GPT-5.6 Sol. Ainda assim, é o mais caro dos modelos chineses — o triplo do GLM-5.2.

Publicação dos pesos
Pesos abertos, mas ainda não liberados

A liberação está marcada para 27 de julho. Até a redação deste texto, o Hugging Face ainda exibe uma contagem regressiva e a licença não foi anunciada.

1. O que é o Kimi K3 — especificações centrais e a empresa

O Kimi K3 é o modelo carro-chefe da Moonshot AI, e a API entrou no ar em 16 de julho de 2026 (informação consistente entre ITmedia NEWS, OpenRouter e outros). A empresa foi fundada em 2023, é financiada por Alibaba e Tencent e, segundo a Forbes, sua rodada de captação mais recente levou a avaliação a mais de US$ 20 bilhões (contra US$ 4,3 bilhões e depois US$ 10 bilhões), com ARR de US$ 200 milhões em abril de 2026.

2,8 T
Parâmetros totais. No lançamento, descrito como o maior modelo já previsto para publicação
16 / 896
Especialistas MoE. Só 16 dos 896 disparam por token (menos de 2% ativados)
1 M
Tamanho do contexto (1.048.576 tokens, para ser exato)
~1,4 TB
Tamanho real em disco dos pesos em 4 bits (MXFP4). A Moonshot recomenda 64 aceleradores ou mais

Fontes: o anúncio da Moonshot AI (conforme noticiado pelo ITmedia NEWS, citando o texto de npaka) e o artigo prático da Northflank. O tamanho do contexto e o tamanho dos pesos são medições da Northflank.

Duas adições arquiteturais ganharam nome próprio. A Kimi Delta Attention (KDA) acelera a decodificação em contextos de um milhão de tokens; a AINews a descreve como até 6,3x mais rápida. E os Attention Residuals (AttnRes) puxam seletivamente as representações necessárias de camadas anteriores; o mesmo artigo estima o ganho em cerca de 25% de eficiência a mais no treinamento por menos de 2% de custo adicional. Os pesos são MXFP4 e as ativações MXFP8, e, em vez de aplicar a quantização depois, o treinamento foi conduzido com a quantização embutida a partir do SFT.

🟡 Não existe número oficial de parâmetros ativos. A notação "2.8T-A50B" (cerca de 50 bilhões ativos) circula por aí, mas é uma estimativa derivada da proporção 16/896, não um número publicado pela Moonshot — a Northflank observa explicitamente que a Moonshot nunca informou a contagem de parâmetros ativos. Vale lembrar também que nem a OpenAI nem a Anthropic divulgam a contagem de parâmetros dos próprios modelos, de modo que "2,8 trilhões, o maior do mundo" só vale entre os modelos cujo tamanho é público.

2. O que "terceiro lugar" significa de fato — qual ranking e em que data

Dizer que ele fica em "terceiro, atrás dos modelos mais recentes da OpenAI e da Anthropic" está em linhas gerais correto. Mas, sem fixar a fonte, os números deixam de fechar mais adiante.

A base é o Intelligence Index da Artificial Analysis. Em sua análise de 17 de julho de 2026, a empresa atribuiu 57 pontos ao Kimi K3, colocando-o em terceiro atrás do Claude Fable 5 e do GPT-5.6 Sol, e avaliou sua inteligência como equivalente à do Opus 4.8 e do GPT-5.5. Como referência, o mesmo índice dá 51 ao GLM-5.2 e 44 ao DeepSeek v4 Pro.

⚠️ Os mesmos 57 pontos são reportados como 3º, 4º e 7º

O próprio anúncio da Artificial Analysis diz terceiro, a contagem da Northflank diz quarto entre 189 modelos e a página ao vivo da empresa mostra sétimo entre 190. A pontuação (57) nunca mudou, então a diferença vem do que entra na comparação — se variantes com esforço de raciocínio diferente contam separadamente — e de quando a contagem foi feita. Os rankings se mexem todo dia, e "terceiro" deve ser lido como um retrato datado de 17 de julho de 2026.

Em métricas mais próximas do trabalho real, a ordenação fica mais nítida. Veja o GDPval-AA v2 da Artificial Analysis, que pontua tarefas práticas numa escala Elo com a linha de base humana fixada em 1.000.

ModeloGDPval-AA v2 (Elo)Onde se posiciona
Claude Fable 51760
Kimi K31668Atrás do Fable 5 e do Sol
Claude Opus 4.81600O K3 supera
GLM-5.21514O melhor da geração chinesa anterior
GPT-5.51494
Kimi K2.6 (geração anterior)1190O K3 está 478 pontos acima

Fonte: Artificial Analysis (artigo da empresa publicado em 17 de julho de 2026). No AA-Briefcase, sua avaliação agêntica privada, o K3 também fica em segundo atrás do Fable 5, com Elo 1547, 732 pontos a mais que a geração anterior K2.6. No AutomationBench-AA ele fica em primeiro lugar, com 53%.

O número que realmente importa não é o "terceiro", e sim o tamanho do salto em relação à geração anterior. De 1190 para 1668 no GDPval-AA v2, e +732 pontos no AA-Briefcase. O que moveu o mercado foi o fato de um modelo aberto chinês ter chegado a um passo da fronteira americana em uma única geração.

3. Quem mediu os benchmarks — separando os números do fabricante dos de terceiros

Os números de benchmark têm peso muito diferente conforme tenham sido medidos pela própria Moonshot ou por um terceiro. O ITmedia noticiou os dois grupos separadamente, e este artigo faz o mesmo.

Medido pela Moonshot (informado pelo fabricante)
  • Program Bench: K3 77,8% (GPT-5.6 Sol 77,6%, Fable 5 76,8%)
  • SWE Marathon: K3 42,0% (segundo, com o Opus 4.8 em 40,0%)
  • BrowseComp: K3 91,2% (GPT-5.6 Sol 90,4%)

Todas as vitórias são apertadas, e todas vêm de testes do próprio fabricante — leia os números com isso em mente.

Medido por terceiros
  • Frontend Code Arena (Arena.ai): K3 em primeiro, com 1679 (Fable 5 1631, GPT-5.6 Sol 1618). Ele lidera seis dos sete subdomínios, subindo 17 posições em relação ao 18º lugar do K2.6
  • GDPval-AA v2: K3 em terceiro, com 1668 (Artificial Analysis)
  • FrontierSWE: Fable 5 86,6% > K3 81,2%aqui o K3 perde
  • Vals Index: 74,70% (segundo entre 38 modelos, segundo a contagem da Northflank)

O resultado que merece atenção é que ele fica 5,4 pontos atrás do Fable 5 no FrontierSWE. As manchetes sobre liderar certos benchmarks são exatas, mas ele não está vencendo em toda a linha. A própria Moonshot admite ficar aquém do Fable 5 e do GPT-5.6 Sol no conjunto (mais sobre isso adiante).

🟡 O método de pontuação foi contestado. O autor do Program Bench apontou que a Moonshot usou uma taxa média de implementação em vez do número de programas que rodaram até o fim. A empreendedora de IA Bindu Reddy defendeu, separadamente, que é preciso verificação em avaliações privadas não contaminadas, como o LiveBench. Vitórias apertadas informadas pelo fabricante devem ser descontadas na mesma medida.

4. Preço: o veredito muda conforme aquilo com que você compara

O Kimi K3 custa US$ 3,00 de entrada e US$ 15,00 de saída por milhão de tokens (US$ 0,30 para entrada em cache). Como a avaliação se inverte completamente conforme a comparação, olhar só para um dos lados leva à conclusão errada.

Contra os modelos de fronteira ocidentais → claramente mais barato
  • Kimi K3: US$ 3 / US$ 15
  • Claude Opus 4.8: US$ 5 / US$ 25
  • GPT-5.6 Sol: US$ 5 / US$ 30

Cerca de 40% mais barato na entrada e 40% a 50% mais barato na saída. Desempenho de fronteira abaixo do preço ocidental sempre foi o discurso da Kimi, e nesse ponto ele se sustenta.

Contra os rivais chineses → o mais caro do grupo
  • Kimi K3: US$ 3 / US$ 15
  • GLM-5.2: cerca de um terço do custo por tarefa do K3
  • DeepSeek V4 Pro: cerca de um vinte e três avos do custo por tarefa do K3

Simon Willison, chamando o valor de um aumento acentuado em relação aos modelos anteriores da empresa, o descreve como o modelo mais caro já lançado por um laboratório de IA chinês.

Uma coisa precisa ficar clara: este não é um novo choque DeepSeek. O que tornou o DeepSeek de janeiro de 2025 tão perturbador foi um preço uma ordem de grandeza abaixo do ocidental. O K3 é 40% a 50% mais barato que os modelos ocidentais, mas na mesma ordem de grandeza. Isso não é ruptura de preço; é desempenho alcançando os líderes, com um desconto moderado.

E o que você paga de fato não é definido apenas pela tarifa por token. A Artificial Analysis mediu o custo real de concluir uma tarefa enquanto rodava seu Intelligence Index.

Custo por tarefa medido pela Artificial Analysis (durante a execução do Intelligence Index)

US$ 0,94
Kimi K3
US$ 1,04
GPT-5.6 Sol
US$ 1,80
Claude Opus 4.8
US$ 0,32
GLM-5.2
US$ 0,04
DeepSeek V4 Pro

Fonte: Artificial Analysis. Nas medições da empresa, o Kimi K3 precisou de cerca de 132 milhões de tokens de saída para concluir o Intelligence Index, menos que os cerca de 166 milhões consumidos pela geração anterior K2.6. A tarifa é mais alta, mas um raciocínio menos prolixo derruba o total.

Mais barato que o Opus 4.8 tanto no preço de tabela quanto no custo medido, e o mais caro dos modelos chineses — esse é o quadro completo do preço. O enquadramento "é chinês, logo é baratíssimo" não se aplica, e descartá-lo como caro é igualmente errado assim que você o compara com o Ocidente.

5. Ninguém consegue baixar ainda — em que pé estão os pesos abertos

Os veículos nem sequer concordam sobre como chamá-lo. A VentureBeat o anuncia como o "maior modelo de código aberto já feito" e o SCMP como o "maior modelo de IA de código aberto do mundo", enquanto a Reuters escreve "de pesos abertos". Este último é o termo tecnicamente correto, e eis por quê.

1. Não liberado até a redação deste texto

O repositório moonshotai/Kimi-K3 no Hugging Face ainda mostra uma contagem regressiva, sem um único arquivo safetensors listado. A página do modelo na Artificial Analysis também o marca como proprietário. Verificado em 27 de julho de 2026 — que é a própria data prevista para a liberação, então a situação muito provavelmente já mudou quando você ler isto. Siga o link acima para ver o estado atual.

2. A licença também não foi anunciada

Em 17 de julho, a Northflank afirma sem rodeios que a licença não foi anunciada. Uma publicação da comunidade no Hugging Face igualmente a lista como indefinida até os pesos chegarem. A afirmação de que será "Modified MIT" é uma inferência de segunda mão a partir da geração K2 e não está resolvida.

3. Ele não é código aberto, para começar

O que foi prometido são os pesos treinados, não os dados nem o código de treinamento. O nome correto para esse arranjo é pesos abertos, que é coisa diferente de código aberto tal como a OSI o define.

Mesmo depois que sair, isso não é algo que uma pessoa física consiga rodar. Em 4 bits (MXFP4), só os pesos somam cerca de 1,4 TB e, com folga para o cache KV e as ativações, a Northflank estima que é preciso algo da ordem de oito nós com oito GPUs de 80 GB cada, enquanto a Moonshot recomenda um supernó de 64 aceleradores ou mais. Ele não cabe em uma única H100, H200 ou B200, um cluster distribuído é obrigatório e a implantação em produção é, na prática, só Linux com NVIDIA. Isso não tem nada a ver com as montagens pessoais tratadas em os requisitos de hardware para LLMs locais.

Dito isso, ainda assim importa muito. Quando pesos de nível de fronteira descem à terra, organizações que não podem deixar os dados saírem de suas paredes — setores regulados, órgãos públicos — passam a poder rodá-los internamente. A simples existência de um modelo público em pé de igualdade muda o poder de barganha das APIs fechadas. As premissas por trás de como escolher um modelo aberto precisam ser atualizadas por causa deste lançamento.

6. Quanto caíram as ações americanas — os números variam conforme o veículo

As ações de semicondutores dos EUA realmente foram vendidas em massa durante a semana do lançamento. Mas os percentuais de queda noticiados conflitam entre os veículos, então aqui eles aparecem como faixas, e não como fatos assentados.

O que se moveuMovimento noticiadoFonte e observações
Nasdaq-1,5% na sexta-feira (seu pior pregão da semana)Yahoo Finance
Mercado de TaiwanMais de -6%Idem
Mercado japonêsFechou a -4%Idem
ETF de semicondutores (SMH)Queda de mais de 20% em relação à máxima do fim de junhoIdem
Índice de Semicondutores da Filadélfia (SOX)-9% a -12,5% na semana⚠️ O número difere conforme o veículo ("12,5%, pior semana em 15 meses", "mais de 9%", "cerca de 10%, a mais acentuada desde abril de 2025")
Ações individuais (17 de julho)AMD -5%, Intel -4%, NVIDIA -3% (todas no intradiário, com recuperação depois)24/7 Wall St.
Empresas chinesas de IA listadas em Hong KongZhipu -28,4%, MiniMax -15,6% (17 de julho)Forbes. As chinesas apanharam mais

Para efeito de comparação, no choque DeepSeek de janeiro de 2025, ao qual todo mundo recorre, o Yahoo Finance noticiou que só a NVIDIA perdeu cerca de US$ 590 bilhões de valor de mercado em um único pregão. A queda da NVIDIA desta vez foi de 3% no intradiário — uma escala completamente diferente.

🟡 A queda já foi recuperada desde então

O Yahoo Finance noticiou depois que compradores de oportunidade entraram e as ações de chips reduziram as perdas, e o Bank of America adotou a visão serena de que aquilo foi apenas uma correção de verão. Os analistas também estão divididos. Robin Zhu, da Bernstein, enquadrou o K3 como confirmatório — mais um dado dentro da tendência já conhecida de os laboratórios chineses estarem encurtando a distância. Já Gary Yu, do Morgan Stanley, disse que o K3 teve recepção favorável no mundo todo e mostra que os LLMs chineses estão alcançando os líderes americanos em escala, desempenho e preço igualmente.

Circula também um número segundo o qual US$ 470 bilhões em valor ligado a IA evaporaram em três dias, mas ele remonta a uma nota rápida de um veículo de criptomoedas e não pôde ser corroborado na grande imprensa financeira, de modo que este artigo não o utiliza.

7. A acusação de destilação e a réplica

Entre 22 e 23 de julho, a história saiu da tecnologia e entrou na geopolítica. Michael Kratsios, diretor do Escritório de Política Científica e Tecnológica da Casa Branca (OSTP), fez duas afirmações sobre a Moonshot, conforme noticiado por CNBC, The Hill, Yahoo News e outros.

Afirmação 1: aquisição de chips embargados

Que a Moonshot obteve servidores equipados com NVIDIA GB300 e também teve acesso a GB300 na Tailândia, possivelmente usando-os para treinar os próprios modelos. A GB300 é uma peça da geração Blackwell e não pode ser vendida legalmente para a China.

Afirmação 2: destilação em escala industrial

Que a empresa realizou destilação encoberta em escala industrial contra o Fable, da Anthropic, e chegou a montar uma plataforma dedicada que alternava métodos de acesso para escapar da detecção. Jacob Helberg, que o acompanhava, chamou aquilo de roubo de valiosa propriedade intelectual americana.

Réplica: as datas não fecham

O funcionário da Moonshot Randy Xian respondeu com ironia no X que o Fable veio a público em 1º de julho e o K3 saiu em 15 de julho, então aparentemente treinamos um modelo de fronteira do zero em 15 dias — um feito para os livros. O pesquisador de IA Braden Hancock disse ao TechCrunch que o Fable só estava disponível desde 1º de julho e que destilar tantos dados, treinar com eles e lançar em duas semanas é impossível.

🔴 Nenhuma evidência foi tornada pública. Segundo o SCMP, vários especialistas em IA chamaram a acusação de política e imprudente, e observaram que as saídas de um modelo, para começo de conversa, não são protegidas por direitos autorais. A Reuters, citando telegramas diplomáticos, noticiou que o Departamento de Estado havia instruído embaixadas ainda em abril a informar os governos anfitriões sobre violação de propriedade intelectual por empresas chinesas de IA, com a Moonshot entre as citadas. Ou seja, essas acusações são anteriores ao lançamento do K3, e nenhuma evidência específica sobre o K3 foi apresentada.

Nem o lado americano está unido nisso. A NVIDIA criticou publicamente a Anthropic pelo nome, dizendo, a respeito das afirmações da Anthropic sobre brechas no controle de exportações, que as empresas americanas deveriam focar em inovação e encarar o desafio, em vez de contar histórias da carochinha.

8. Pontos fracos — velocidade, alucinação e a avaliação da própria Moonshot

Ficaram para trás das manchetes de desempenho três pontos fracos que mordem em produção.

🐢 Lento (embora as medições divirjam)

As medições ao vivo da Artificial Analysis mostram 33 tokens por segundo (145º entre 190 modelos) e 177 segundos até o primeiro token. Já a Northflank relata 62 tokens por segundo e 1,99 segundo. A maior parte dessa diferença é aperto de capacidade por causa da demanda avassaladora — o OpenRouter mantém um aviso no modelo de que a capacidade upstream está limitada e erros 429 podem ser frequentes.

🎭 A alucinação piorou

A Artificial Analysis relata que, embora a precisão tenha melhorado, a taxa de alucinação subiu de 39% para 51%. Uma pontuação de inteligência mais alta não é a mesma coisa que factualidade, e este não é um modelo que se possa usar sem verificação.

📝 A própria Moonshot admite a distância

A empresa diz que há uma diferença clara de experiência de uso entre o seu modelo e tanto o Claude Fable 5 quanto o GPT-5.6 Sol. A leitura dela mesma é que margens apertadas em benchmark e a sensação de usar um modelo no dia a dia são duas coisas distintas.

9. Como testar hoje

Antes de os pesos chegarem, há três formas de experimentá-lo.

CaminhoDetalhesPara quem serve
App / web oficial do KimiEm kimi.com. Há um plano gratuitoQuem só quer avaliar a qualidade
API da MoonshotUS$ 3 de entrada, US$ 15 de saída, US$ 0,30 em acertos de cache (por milhão de tokens)Times que vão embuti-lo no próprio produto
Via OpenRouterOpenRouter. O mesmo endpoint pelo qual você já chama outros modelosQuem está comparando vários modelos
Auto-hospedagemDepois da liberação dos pesos (marcada para 27 de julho). A recomendação é de 64 aceleradores ou mais, e você precisa de agendamento ciente de MoE em vLLM, TensorRT-LLM ou SGLangOrganizações cujos dados não podem sair de casa

Tenha em mente, porém, que, como observado acima, a capacidade está apertada e os 429 são comuns. Antes de mover uma carga de produção inteira para lá, a abordagem realista — o mesmo raciocínio de escolher entre nuvem e local — é direcionar uma fatia do tráfego para ele com um plano de contingência pronto.

10. Separando as afirmações por grau de certeza

✅ Confirmado em fontes primárias
  • API lançada em 16 de julho de 2026; 2,8 trilhões de parâmetros totais; 16 dos 896 especialistas ativos; 1 milhão de tokens
  • Preço de API de US$ 3 de entrada, US$ 15 de saída, US$ 0,30 em cache
  • 57 pontos no Artificial Analysis Intelligence Index
  • 1668 no GDPval-AA v2 (Fable 5 = 1760, Opus 4.8 = 1600)
  • Primeiro lugar com 1679 no Frontend Code Arena
  • Custo por tarefa de US$ 0,94, abaixo dos US$ 1,80 do Opus 4.8
  • Taxa de alucinação subindo de 39% para 51%
🟡 As fontes divergem ou o valor se move
  • Sua colocação no Intelligence Index (3º, 4º e 7º, todos em circulação)
  • A queda semanal do SOX (-9% a -12,5%)
  • A velocidade de saída (33 tok/s contra 62 tok/s)
  • Parâmetros ativos de "cerca de 50 bilhões" (uma estimativa, não um número oficial)
  • Uma licença "Modified MIT" (inferida do K2)
🔴 Em aberto, sem evidência
  • A acusação de destilação — sem evidência pública, e pesquisadores a rejeitam pela cronologia
  • Acesso a chips embargados — afirmação de um funcionário do governo dos EUA; nem a resposta formal da Moonshot nem qualquer evidência são públicas
  • Pesos e licença — não liberados até a redação deste texto (previstos para 27 de julho)
  • "US$ 470 bilhões em valor de IA perdidos em três dias" — não pôde ser corroborado na grande imprensa financeira

Em resumo, a história real do Kimi K3 é o fato de um modelo aberto chinês ter chegado ao alcance da fronteira. Ele chegou lá 40% a 50% abaixo do preço de fronteira ocidental, ainda que não com um desconto de uma ordem de grandeza; fica atrás do Fable 5 e do GPT-5.6 Sol no conjunto; é lento; e alucina mais. Mesmo assim, empurrou o GDPval-AA v2 em 478 pontos em uma única geração e se comprometeu a publicar seus pesos — e foi a isso que o mercado reagiu.

FAQ

Q1. O Kimi K3 é código aberto?

Não. O que está previsto é a liberação dos pesos treinados, ou seja, pesos abertos, e não a liberação dos dados nem do código de treinamento. Além disso, até a redação deste texto os próprios pesos ainda não saíram — a página moonshotai/Kimi-K3 no Hugging Face ainda exibe uma contagem regressiva e nenhuma licença foi anunciada. A liberação está marcada para 27 de julho de 2026.

Q2. Ele está mesmo em terceiro nos benchmarks?

A base são 57 pontos e o terceiro lugar no Intelligence Index da Artificial Analysis, atrás do Claude Fable 5 e do GPT-5.6 Sol, e, em 17 de julho de 2026, essa leitura está correta. Mas também existem contagens que colocam os mesmos 57 pontos em quarto e em sétimo, porque o resultado muda conforme se define o conjunto de comparação e quando a contagem foi feita. Leia "terceiro" como um retrato datado. No Frontend Code Arena, voltado a código, ele fica em primeiro, enquanto no FrontierSWE perde para o Fable 5.

Q3. Ele é mesmo barato?

A resposta se inverte conforme a comparação. A US$ 3 de entrada e US$ 15 de saída por milhão de tokens, ele é cerca de 40% mais barato na entrada e de 40% a 50% mais barato na saída que o Claude Opus 4.8 (US$ 5/US$ 25) ou o GPT-5.6 Sol (US$ 5/US$ 30), então, diante da fronteira ocidental, é claramente barato. O custo medido concorda: US$ 0,94 por tarefa contra US$ 1,80 do Opus 4.8 (Artificial Analysis). Diante dos rivais chineses, porém, ele é o mais caro do grupo — cerca de três vezes o GLM-5.2 e 23 vezes o DeepSeek V4 Pro. Simon Willison o chama de o modelo mais caro já lançado por um laboratório de IA chinês. Este não é o desconto de uma ordem de grandeza do choque DeepSeek.

Q4. Por que as ações americanas caíram?

Por causa do receio de que modelos chineses baratos reduzam a demanda por computação cara. Na semana do lançamento, o Nasdaq caiu 1,5% na sexta-feira, Taiwan mais de 6%, o Japão 4%, e o ETF de semicondutores (SMH) acumulava queda de mais de 20% em relação à máxima do fim de junho. Dito isso, as ações de chips reduziram as perdas em seguida, com a entrada de compradores de oportunidade, e o Bank of America classificou o episódio como apenas uma correção de verão. A escala é diferente da do choque DeepSeek, quando só a NVIDIA perdeu cerca de US$ 590 bilhões em um único dia, em janeiro de 2025.

Q5. É verdade que eles roubaram o modelo da Anthropic?

Nenhuma evidência foi tornada pública. Michael Kratsios, diretor do OSTP da Casa Branca, alegou destilação em escala industrial do Fable, da Anthropic, mas a Moonshot nega, apontando a janela de 15 dias entre a estreia pública do Fable em 1º de julho e o lançamento do K3 em 15 de julho. O pesquisador de IA Braden Hancock disse igualmente ao TechCrunch que destilar, treinar e lançar em duas semanas é impossível. Segundo o SCMP, vários especialistas criticaram a acusação como política. Não há material suficiente para chegar a um veredito neste momento.

Q6. Dá para rodá-lo no meu próprio PC?

Não. Mesmo com quantização de 4 bits (MXFP4), só os pesos ficam em torno de 1,4 TB, o que não cabe em uma única H100, H200 ou B200. A Northflank estima algo como oito nós com oito GPUs de 80 GB cada, e a Moonshot recomenda 64 aceleradores ou mais. macOS e Windows estão fora de escopo para uso em produção; a premissa é Linux com NVIDIA. Esta é uma escala completamente diferente de rodar um LLM local por conta própria.

Q7. Devo usá-lo em produção?

Migrar tudo de uma vez não é aconselhável, por três motivos: (1) a capacidade está apertada e os erros 429 podem ser frequentes (aviso do próprio OpenRouter); (2) a taxa de alucinação subiu de 39% para 51%; e (3) a própria Moonshot admite uma diferença clara de experiência de uso em relação ao Fable 5 e ao GPT-5.6 Sol. O caminho realista é manter um plano de contingência e direcionar parte do tráfego por ele numa área em que ele se destaca, como geração de código de front-end, e então comparar.

Q8. Quanto ele é melhor que o K2.6 anterior?

O tamanho do salto é a verdadeira história aqui. No GDPval-AA v2 da Artificial Analysis ele foi de 1190 para 1668, um ganho de 478 pontos, e no AA-Briefcase, a avaliação agêntica privada da empresa, ganhou 732 pontos. No Frontend Code Arena da Arena.ai ele subiu 17 posições, do 18º para o 1º. O que o mercado respondeu foi menos à colocação absoluta e mais a quanto terreno ele recuperou em uma geração.

Artigos relacionados