Le 16 juillet 2026, le chinois Moonshot AI a publié Kimi K3. Avec 2 800 milliards de paramètres au total, il est présenté comme le plus grand modèle ouvert jamais diffusé, et quelques jours à peine après son lancement, les valeurs américaines des semi-conducteurs étaient vendues et un responsable de la Maison-Blanche accusait publiquement l'entreprise d'avoir distillé les modèles d'Anthropic.

L'ennui, c'est que les chiffres, et jusqu'aux étiquettes elles-mêmes, ne concordent pas selon qui les rapporte. Cet article recoupe les éditeurs de benchmarks, la presse financière, les annonces de Moonshot et la page Hugging Face telle qu'elle est réellement, en précisant à chaque fois qui a produit le chiffre.

POINTS CLÉS
Performance
Troisième au général, premier en code

57 points, troisième place chez Artificial Analysis au lancement. Premier sur le Frontend Code Arena d'Arena.ai. Au général, en revanche, il n'atteint ni Fable 5 ni GPT-5.6 Sol.

Prix
Le verdict s'inverse selon la comparaison

À 3 $ en entrée et 15 $ en sortie, il est nettement moins cher qu'Opus 4.8 ou GPT-5.6 Sol. Pourtant, c'est le plus cher des modèles chinois — trois fois GLM-5.2.

Publication des poids
Poids ouverts, mais pas encore sortis

La publication est prévue pour le 27 juillet. À l'heure où ces lignes sont écrites, Hugging Face affiche encore un compte à rebours et la licence n'est pas annoncée.

1. Ce qu'est Kimi K3 — les specs essentielles et l'entreprise

Kimi K3 est le modèle phare de Moonshot AI, et l'API est en service depuis le 16 juillet 2026 (date cohérente chez ITmedia NEWS, OpenRouter et d'autres). L'entreprise a été fondée en 2023, elle est soutenue par Alibaba et Tencent, et selon Forbes, son dernier tour de table a porté sa valorisation au-delà de 20 milliards de dollars (après 4,3 puis 10 milliards), pour un ARR de 200 millions de dollars en avril 2026.

2,8 T
Paramètres au total. Au lancement, décrit comme le plus grand modèle jamais annoncé pour une diffusion publique
16 / 896
Experts MoE. Seuls 16 des 896 s'activent par token (moins de 2 % actifs)
1 M
Longueur de contexte (1 048 576 tokens, très exactement)
~1,4 To
Taille réelle des poids sur disque en 4 bits (MXFP4). Moonshot recommande 64 accélérateurs ou plus

Sources : l'annonce de Moonshot AI (telle que rapportée par ITmedia NEWS, citant l'analyse de npaka) et l'article de prise en main de Northflank. La longueur de contexte et la taille des poids sont les valeurs mesurées par Northflank.

Deux ajouts architecturaux portent un nom propre. Kimi Delta Attention (KDA) accélère le décodage sur des contextes d'un million de tokens ; AINews le donne jusqu'à 6,3 fois plus rapide. Et les Attention Residuals (AttnRes) vont chercher sélectivement, dans les couches antérieures, les représentations dont le modèle a besoin ; le même article chiffre le gain à environ 25 % d'efficacité d'entraînement en plus pour moins de 2 % de coût supplémentaire. Les poids sont en MXFP4 et les activations en MXFP8, et plutôt que d'ajouter la quantification après coup, l'entraînement a été mené avec la quantification intégrée dès l'étape SFT.

🟡 Il n'existe aucun chiffre officiel pour les paramètres actifs. La notation « 2.8T-A50B » (environ 50 milliards d'actifs) circule, mais il s'agit d'une estimation déduite du rapport 16/896, pas d'un nombre publié par Moonshot — Northflank note explicitement que Moonshot n'a jamais indiqué le nombre de paramètres actifs. Il faut aussi se rappeler que ni OpenAI ni Anthropic ne divulguent le nombre de paramètres de leurs propres modèles : « 2 800 milliards, le plus grand du monde » ne vaut donc que parmi les modèles dont la taille est publique.

2. Ce que « troisième place » veut dire au juste — quel classement, et à quelle date

Dire qu'il se classe « troisième, derrière les derniers modèles d'OpenAI et d'Anthropic » est globalement exact. Mais sans préciser la source, les chiffres cessent de tomber juste dès qu'on creuse.

La base, c'est l'Intelligence Index d'Artificial Analysis. Dans son analyse du 17 juillet 2026, le cabinet a noté Kimi K3 à 57 points, ce qui le place troisième derrière Claude Fable 5 et GPT-5.6 Sol, avec une intelligence jugée comparable à celle d'Opus 4.8 et de GPT-5.5. À titre de repère, le même index donne GLM-5.2 à 51 et DeepSeek v4 Pro à 44.

⚠️ Les mêmes 57 points sont rapportés comme 3e, 4e et 7e

L'annonce d'Artificial Analysis elle-même dit troisième, le décompte de Northflank dit quatrième sur 189 modèles, et la page en direct du cabinet affiche septième sur 190. Le score (57) n'a jamais bougé : l'écart vient donc de ce que l'on inclut dans la comparaison — les variantes à différents niveaux d'effort de raisonnement sont-elles comptées séparément ? — et de la date du relevé. Les classements bougent tous les jours, et « troisième » se lit avant tout comme un instantané daté du 17 juillet 2026.

Sur les métriques plus proches du travail réel, la hiérarchie est plus nette. Voici le GDPval-AA v2 d'Artificial Analysis, qui note des tâches pratiques sur une échelle Elo où la référence humaine est fixée à 1 000.

ModèleGDPval-AA v2 (Elo)Position
Claude Fable 517601er
Kimi K31668Derrière Fable 5 et Sol
Claude Opus 4.81600K3 le devance
GLM-5.21514Le meilleur de la génération chinoise précédente
GPT-5.51494
Kimi K2.6 (génération précédente)1190K3 fait 478 points de plus

Source : Artificial Analysis (article du cabinet publié le 17 juillet 2026). Sur AA-Briefcase, son évaluation agentique privée, K3 arrive aussi deuxième derrière Fable 5 avec un Elo de 1547, en hausse de 732 points par rapport à la K2.6 de la génération précédente. Sur AutomationBench-AA, il prend la première place avec 53 %.

Le chiffre qui compte vraiment n'est pas le « troisième », mais l'ampleur du bond par rapport à la génération précédente. De 1190 à 1668 sur GDPval-AA v2, et +732 points sur AA-Briefcase. Ce qui a fait bouger le marché, c'est qu'un modèle ouvert chinois soit venu se placer à portée de la frontière américaine en une seule génération.

3. Qui a mesuré les benchmarks — séparer les chiffres de l'éditeur de ceux des tiers

Un chiffre de benchmark n'a pas du tout le même poids selon que Moonshot l'a mesuré lui-même ou qu'un tiers s'en est chargé. ITmedia a rapporté les deux séparément, et cet article s'en tient à la même règle.

Mesuré par Moonshot (annoncé par l'éditeur)
  • Program Bench : K3 77,8 % (GPT-5.6 Sol 77,6 %, Fable 5 76,8 %)
  • SWE Marathon : K3 42,0 % (deuxième, Opus 4.8 à 40,0 %)
  • BrowseComp : K3 91,2 % (GPT-5.6 Sol 90,4 %)

Chaque victoire se joue à peu de chose, et toutes proviennent des tests de l'éditeur lui-même — à lire en gardant cela en tête.

Mesuré par des tiers
  • Frontend Code Arena (Arena.ai) : K3 premier avec 1679 (Fable 5 1631, GPT-5.6 Sol 1618). Il domine six des sept sous-domaines, soit 17 places gagnées depuis la 18e de K2.6
  • GDPval-AA v2 : K3 troisième avec 1668 (Artificial Analysis)
  • FrontierSWE : Fable 5 86,6 % > K3 81,2 %là, K3 perd
  • Vals Index : 74,70 % (deuxième sur 38 modèles, d'après le relevé de Northflank)

Le résultat à retenir, c'est qu'il concède 5,4 points à Fable 5 sur FrontierSWE. Les titres qui le disent en tête de certains benchmarks sont exacts, mais il ne gagne pas sur toute la ligne. Moonshot admet d'ailleurs rester en deçà de Fable 5 et de GPT-5.6 Sol au général (voir plus bas).

🟡 La méthode de notation a été contestée. L'auteur de Program Bench a fait remarquer que Moonshot avait retenu un taux d'implémentation moyen plutôt que le nombre de programmes menés à terme. L'entrepreneuse en IA Bindu Reddy plaide de son côté pour une vérification sur des évaluations privées non contaminées telles que LiveBench. Les victoires étroites annoncées par l'éditeur méritent donc d'être relativisées.

4. Les tarifs : le verdict s'inverse selon ce à quoi on le compare

Kimi K3 coûte 3,00 $ en entrée et 15,00 $ en sortie par million de tokens (0,30 $ pour l'entrée mise en cache). Comme le jugement s'inverse complètement selon la comparaison retenue, ne regarder qu'un seul côté conduit à la mauvaise conclusion.

Face aux modèles de frontière occidentaux → nettement moins cher
  • Kimi K3 : 3 $ / 15 $
  • Claude Opus 4.8 : 5 $ / 25 $
  • GPT-5.6 Sol : 5 $ / 30 $

Environ 40 % moins cher en entrée et 40 à 50 % moins cher en sortie. Des performances de niveau frontière sous les tarifs occidentaux : c'est l'argument constant de Kimi, et sur ce point il tient.

Face aux rivaux chinois → le plus cher du lot
  • Kimi K3 : 3 $ / 15 $
  • GLM-5.2 : environ un tiers du coût par tâche de K3
  • DeepSeek V4 Pro : environ un vingt-troisième du coût par tâche de K3

Simon Willison, qui y voit une hausse brutale par rapport aux modèles précédents de l'entreprise, le décrit comme le modèle le plus cher jamais publié par un laboratoire d'IA chinois.

Une chose doit être claire : ce n'est pas un nouveau choc DeepSeek. Ce qui avait tant secoué en janvier 2025, c'était un tarif inférieur d'un ordre de grandeur à celui de l'Occident. K3 est 40 à 50 % moins cher que les modèles occidentaux, mais dans le même ordre de grandeur. Ce n'est pas une rupture de prix, c'est un rattrapage de performance, assorti d'une remise modérée.

Et ce que l'on paie réellement ne se résume pas au tarif au token. Artificial Analysis a mesuré le coût réel d'une tâche menée à son terme pendant l'exécution de son Intelligence Index.

Coût par tâche mesuré par Artificial Analysis (pendant l'exécution de son Intelligence Index)

0,94 $
Kimi K3
1,04 $
GPT-5.6 Sol
1,80 $
Claude Opus 4.8
0,32 $
GLM-5.2
0,04 $
DeepSeek V4 Pro

Source : Artificial Analysis. Dans ses mesures, Kimi K3 a eu besoin d'environ 132 millions de tokens de sortie pour boucler l'Intelligence Index, soit moins que les quelque 166 millions consommés par la K2.6 de la génération précédente. Le tarif est plus élevé, mais un raisonnement moins bavard fait baisser le total.

Moins cher qu'Opus 4.8 au tarif affiché comme au coût mesuré, et le plus cher des modèles chinois : voilà le tableau complet côté prix. Le raccourci « chinois, donc bradé » ne s'applique pas, et le juger cher est tout aussi faux dès qu'on le compare à l'Occident.

5. Personne ne peut encore le télécharger — où en sont les poids ouverts

Les médias ne s'accordent même pas sur la façon de le nommer. VentureBeat titre sur le plus grand modèle open source jamais publié et SCMP sur le plus grand modèle d'IA open source au monde, tandis que Reuters écrit « open-weight ». C'est ce dernier terme qui est techniquement exact, et voici pourquoi.

1. Non publié à l'heure où nous écrivons

Le dépôt moonshotai/Kimi-K3 sur Hugging Face affiche toujours un compte à rebours, sans le moindre fichier safetensors listé. La fiche du modèle chez Artificial Analysis le marque également propriétaire. Vérifié le 27 juillet 2026 — c'est-à-dire le jour même prévu pour la publication : la situation a donc très probablement changé au moment où vous lisez ces lignes. Suivez le lien ci-dessus pour voir l'état actuel.

2. Aucune licence annoncée non plus

Au 17 juillet, Northflank indique sans détour que la licence n'est pas annoncée. Un message de la communauté Hugging Face la donne lui aussi comme à déterminer tant que les poids ne sont pas là. L'affirmation selon laquelle ce sera une licence « Modified MIT » relève d'une déduction de seconde main tirée de la génération K2 et n'est pas tranchée.

3. Ce n'est de toute façon pas de l'open source

Ce qui a été promis, ce sont les poids entraînés, pas les données ni le code d'entraînement. Le nom exact de cet arrangement est poids ouverts (open weights), ce qui n'est pas la même chose que l'open source au sens de l'OSI.

Même une fois publié, ce n'est pas quelque chose qu'un particulier pourra faire tourner. En 4 bits (MXFP4), les poids seuls représentent environ 1,4 To, et en gardant de la marge pour le cache KV et les activations, Northflank estime qu'il faut de l'ordre de huit nœuds de huit GPU de 80 Go, tandis que Moonshot recommande un supernœud de 64 accélérateurs ou plus. Cela ne tient ni sur un H100, ni sur un H200, ni sur un B200 : un cluster distribué est obligatoire, et le déploiement en production se limite en pratique à Linux et NVIDIA. On est très loin des configurations personnelles décrites dans la configuration requise pour un LLM local.

Cela dit, l'enjeu reste considérable. Dès lors que des poids de niveau frontière redescendent sur terre, les organisations qui ne peuvent pas laisser leurs données sortir de leurs murs — secteurs réglementés, administrations — peuvent les héberger en interne. La seule existence d'un modèle public au même niveau change le rapport de force des API fermées. Les hypothèses qui sous-tendent le choix d'un modèle ouvert sont à réviser à cause de cette sortie.

6. De combien la Bourse américaine a-t-elle reculé — les chiffres varient selon les médias

Les valeurs américaines des semi-conducteurs ont bel et bien été vendues pendant la semaine du lancement. Mais les pourcentages de baisse rapportés se contredisent d'un média à l'autre : ils sont donc donnés ici sous forme de fourchettes plutôt que de faits établis.

Ce qui a bougéVariation rapportéeSource et remarques
Nasdaq-1,5 % vendredi (sa pire séance de la semaine)Yahoo Finance
Marché taïwanaisPlus de -6 %Idem
Marché japonaisClôture à -4 %Idem
ETF semi-conducteurs (SMH)En baisse de plus de 20 % par rapport à son sommet de fin juinIdem
Philadelphia Semiconductor Index (SOX)-9 % à -12,5 % sur la semaine⚠️ Le chiffre diffère selon les médias (« 12,5 %, pire semaine en 15 mois », « plus de 9 % », « environ 10 %, la plus forte baisse depuis avril 2025 »)
Valeurs individuelles (17 juillet)AMD -5 %, Intel -4 %, NVIDIA -3 % (en séance, avec rebond ensuite)24/7 Wall St.
Valeurs chinoises de l'IA cotées à Hong KongZhipu -28,4 %, MiniMax -15,6 % (17 juillet)Forbes. Les valeurs chinoises ont été davantage sanctionnées

À titre de comparaison, lors du choc DeepSeek de janvier 2025 auquel tout le monde se réfère, Yahoo Finance rapportait que NVIDIA à elle seule avait perdu environ 590 milliards de dollars de capitalisation en une seule séance. Cette fois, la baisse de NVIDIA a été de 3 % en séance — une tout autre échelle.

🟡 La baisse a depuis été effacée

Yahoo Finance a rapporté par la suite que des acheteurs sont revenus sur les creux et que les valeurs des puces ont réduit leurs pertes, et Bank of America a retenu la lecture apaisée d'une simple correction estivale. Les analystes sont divisés, eux aussi. Robin Zhu, de Bernstein, présente K3 comme une confirmation — un point de données de plus dans une tendance déjà connue, celle des laboratoires chinois qui comblent l'écart. Gary Yu, de Morgan Stanley, estime au contraire que K3 a été très bien reçu dans le monde entier et montre que les LLM chinois rattrapent les leaders américains sur l'échelle des modèles, la performance et le prix à la fois.

Un chiffre affirmant que 470 milliards de dollars de valeur liée à l'IA se sont évaporés en trois jours circule également, mais il remonte à une brève publiée par un média spécialisé dans les cryptomonnaies et n'a pas pu être corroboré par la grande presse financière : cet article ne l'utilise donc pas.

7. L'accusation de distillation, et la réfutation

Les 22 et 23 juillet, l'affaire est passée de la technologie à la géopolitique. Michael Kratsios, directeur du Bureau de la politique scientifique et technologique de la Maison-Blanche (OSTP), a formulé deux accusations contre Moonshot, rapportées notamment par CNBC, The Hill et Yahoo News.

Accusation 1 : obtention de puces sous embargo

Moonshot se serait procuré des serveurs équipés de NVIDIA GB300 et aurait également eu accès à des GB300 en Thaïlande, peut-être pour entraîner ses propres modèles. Le GB300 appartient à la génération Blackwell et ne peut légalement être vendu en Chine.

Accusation 2 : distillation à grande échelle

L'entreprise aurait mené une distillation clandestine à l'échelle industrielle contre Fable, le modèle d'Anthropic, et aurait même bâti une plateforme dédiée qui faisait tourner les méthodes d'accès pour échapper à la détection. Jacob Helberg, présent à ses côtés, a parlé du vol d'une propriété intellectuelle américaine de grande valeur.

Réfutation : le calendrier ne tient pas

Randy Xian, salarié de Moonshot, a répondu avec ironie sur X que Fable est sorti le 1er juillet et K3 le 15 juillet : nous aurions donc entraîné un modèle de frontière depuis zéro en 15 jours, un record à inscrire dans les annales. Le chercheur en IA Braden Hancock a déclaré à TechCrunch que Fable n'était disponible que depuis le 1er juillet et que distiller autant de données, s'entraîner dessus et livrer en deux semaines est impossible.

🔴 Aucune preuve n'a été rendue publique. Selon SCMP, plusieurs spécialistes de l'IA ont qualifié l'accusation de politique et d'imprudente, en rappelant que les sorties d'un modèle ne sont de toute façon pas protégeables par le droit d'auteur. Reuters, citant des télégrammes diplomatiques, a rapporté que le Département d'État avait demandé dès avril à ses ambassades d'alerter les gouvernements hôtes sur les atteintes à la propriété intellectuelle commises par des entreprises d'IA chinoises, Moonshot figurant parmi les noms cités. Autrement dit, ces accusations sont antérieures à la sortie de K3, et aucune preuve propre à K3 n'a été produite.

Le camp américain n'est pas non plus uni sur ce point. NVIDIA a critiqué publiquement Anthropic, nommément, en déclarant à propos des affirmations d'Anthropic sur les failles du contrôle des exportations que les entreprises américaines devraient se concentrer sur l'innovation et relever le défi plutôt que de raconter des histoires.

8. Faiblesses — vitesse, hallucinations et l'aveu de Moonshot

Derrière les titres sur les performances, trois faiblesses se font oublier alors qu'elles mordent en production.

🐢 Lent (même si les mesures divergent)

Les mesures en direct d'Artificial Analysis donnent 33 tokens par seconde (145e sur 190 modèles) et 177 secondes jusqu'au premier token. Northflank, de son côté, rapporte 62 tokens par seconde et 1,99 seconde. L'essentiel de cet écart tient à une saturation de capacité face à une demande écrasante — OpenRouter affiche sur le modèle un avertissement indiquant que la capacité en amont est limitée et que les erreurs 429 peuvent être fréquentes.

🎭 Les hallucinations ont empiré

Artificial Analysis rapporte que si l'exactitude a progressé, le taux d'hallucination est passé de 39 % à 51 %. Un meilleur score d'intelligence n'équivaut pas à de la factualité, et ce n'est pas un modèle utilisable sans vérification.

📝 Moonshot reconnaît lui-même l'écart

L'entreprise déclare qu'il existe une différence nette d'expérience utilisateur entre son modèle et Claude Fable 5 comme GPT-5.6 Sol. Sa propre lecture est que des marges étroites sur les benchmarks et le ressenti d'un modèle à l'usage quotidien sont deux choses différentes.

9. Comment l'essayer dès aujourd'hui

Avant l'arrivée des poids, il existe trois façons de l'essayer.

VoieDétailsÀ qui cela convient
Application / site officiels KimiVia kimi.com. Une offre gratuite est disponibleQuiconque veut simplement juger de la qualité
API Moonshot3 $ en entrée, 15 $ en sortie, 0,30 $ en cas de succès du cache (par million de tokens)Les équipes qui l'intègrent à leur propre produit
Via OpenRouterOpenRouter. Le même point d'accès que celui par lequel vous appelez déjà d'autres modèlesQuiconque compare plusieurs modèles
Auto-hébergementAprès la publication des poids (prévue le 27 juillet). 64 accélérateurs ou plus sont recommandés, et il faut un ordonnancement compatible MoE dans vLLM, TensorRT-LLM ou SGLangLes organisations dont les données ne peuvent pas quitter les locaux

Gardez toutefois à l'esprit que, comme indiqué plus haut, la capacité est sous tension et les 429 sont fréquentes. Avant de basculer une charge de production en bloc, l'approche réaliste — le même raisonnement que dans le choix entre cloud et local — consiste à lui router une fraction du trafic en gardant un repli en place.

10. Trier les affirmations par degré de certitude

✅ Confirmé par les sources primaires
  • API publiée le 16 juillet 2026 ; 2 800 milliards de paramètres au total ; 16 experts actifs sur 896 ; 1 million de tokens
  • Tarif API de 3 $ en entrée, 15 $ en sortie, 0,30 $ en cache
  • 57 points sur l'Artificial Analysis Intelligence Index
  • 1668 sur GDPval-AA v2 (Fable 5 = 1760, Opus 4.8 = 1600)
  • Première place avec 1679 sur Frontend Code Arena
  • Coût par tâche de 0,94 $, sous les 1,80 $ d'Opus 4.8
  • Taux d'hallucination passé de 39 % à 51 %
🟡 Les sources divergent ou la valeur bouge
  • Son rang sur l'Intelligence Index (3e, 4e et 7e circulent tous les trois)
  • La baisse hebdomadaire du SOX (-9 % à -12,5 %)
  • La vitesse de sortie (33 tok/s contre 62 tok/s)
  • Les paramètres actifs « d'environ 50 milliards » (une estimation, pas un chiffre officiel)
  • Une licence « Modified MIT » (déduite de K2)
🔴 Non tranché, sans preuve
  • L'accusation de distillation — aucune preuve publique, et les chercheurs la rejettent sur la base du calendrier
  • L'accès à des puces sous embargo — l'affirmation d'un responsable américain ; ni la réponse formelle de Moonshot ni la moindre preuve ne sont publiques
  • Les poids et la licence — non publiés à l'heure où nous écrivons (prévus le 27 juillet)
  • « 470 milliards de dollars de valeur IA perdus en trois jours » — n'a pas pu être corroboré par la grande presse financière

En résumé, la véritable histoire de Kimi K3, c'est qu'un modèle ouvert chinois est venu se placer à portée de la frontière. Il y est parvenu à 40-50 % sous les tarifs de frontière occidentaux, sans pour autant offrir une remise d'un ordre de grandeur ; il reste derrière Fable 5 et GPT-5.6 Sol au général ; il est lent ; et il hallucine davantage. Malgré cela, il a fait progresser GDPval-AA v2 de 478 points en une seule génération et s'est engagé à publier ses poids — et c'est à cela que le marché a réagi.

FAQ

Q1. Kimi K3 est-il open source ?

Non. Ce qui est prévu, c'est la publication des poids entraînés, autrement dit des poids ouverts, et non la publication des données ni du code d'entraînement. De plus, à l'heure où nous écrivons, les poids eux-mêmes ne sont toujours pas sortis : la page moonshotai/Kimi-K3 sur Hugging Face affiche encore un compte à rebours et aucune licence n'a été annoncée. La publication est prévue pour le 27 juillet 2026.

Q2. Est-il vraiment troisième aux benchmarks ?

La base, ce sont 57 points et une troisième place sur l'Intelligence Index d'Artificial Analysis, derrière Claude Fable 5 et GPT-5.6 Sol, et au 17 juillet 2026 cette lecture est exacte. Mais il existe aussi des relevés qui placent ces mêmes 57 points au quatrième et au septième rang, parce que le résultat change selon la façon de délimiter l'ensemble comparé et la date du décompte. Il faut lire « troisième » comme un instantané. Sur le Frontend Code Arena, orienté code, il prend la première place, alors que sur FrontierSWE il perd face à Fable 5.

Q3. Est-il vraiment bon marché ?

Cela s'inverse selon la comparaison. À 3 $ en entrée et 15 $ en sortie par million de tokens, il est environ 40 % moins cher en entrée et 40 à 50 % moins cher en sortie que Claude Opus 4.8 (5 $/25 $) ou GPT-5.6 Sol (5 $/30 $) : face à la frontière occidentale, il est donc clairement peu coûteux. Le coût mesuré va dans le même sens : 0,94 $ par tâche contre 1,80 $ pour Opus 4.8 (Artificial Analysis). Face aux rivaux chinois, en revanche, c'est le plus cher du groupe — environ trois fois GLM-5.2 et 23 fois DeepSeek V4 Pro. Simon Willison le qualifie de modèle le plus cher jamais publié par un laboratoire d'IA chinois. Ce n'est pas la remise d'un ordre de grandeur du choc DeepSeek.

Q4. Pourquoi la Bourse américaine a-t-elle chuté ?

À cause de la crainte que des modèles chinois bon marché réduisent la demande de calcul coûteux. Pendant la semaine du lancement, le Nasdaq a perdu 1,5 % vendredi, Taïwan plus de 6 %, le Japon 4 %, et l'ETF semi-conducteurs (SMH) était en baisse de plus de 20 % par rapport à son sommet de fin juin. Cela dit, les valeurs des puces ont ensuite réduit leurs pertes, des acheteurs étant revenus sur les creux, et Bank of America y a vu une simple correction estivale. L'échelle n'a rien à voir avec le choc DeepSeek, lorsque NVIDIA à elle seule avait perdu environ 590 milliards de dollars en une journée, en janvier 2025.

Q5. Est-il vrai qu'ils ont volé le modèle d'Anthropic ?

Aucune preuve n'a été rendue publique. Michael Kratsios, directeur de l'OSTP à la Maison-Blanche, a allégué une distillation à l'échelle industrielle de Fable, le modèle d'Anthropic, mais Moonshot le nie en pointant la fenêtre de 15 jours entre la sortie publique de Fable le 1er juillet et le lancement de K3 le 15 juillet. Le chercheur en IA Braden Hancock a de même déclaré à TechCrunch que distiller, entraîner et publier en deux semaines est impossible. Selon SCMP, plusieurs spécialistes ont critiqué le caractère politique de l'accusation. Il n'y a pas assez d'éléments pour trancher à ce stade.

Q6. Puis-je le faire tourner sur mon propre PC ?

Non. Même en quantification 4 bits (MXFP4), les poids seuls pèsent environ 1,4 To, ce qui ne tient pas sur un seul H100, H200 ou B200. Northflank estime qu'il faut quelque chose comme huit nœuds de huit GPU de 80 Go, et Moonshot recommande 64 accélérateurs ou plus. macOS et Windows sortent du cadre d'un usage en production : c'est Linux plus NVIDIA qui est présupposé. On change complètement d'échelle par rapport au fait de faire tourner soi-même un LLM local.

Q7. Faut-il l'utiliser en production ?

Basculer entièrement, tout de suite, n'est pas conseillé, pour trois raisons : (1) la capacité est sous tension et les erreurs 429 peuvent être fréquentes (avertissement d'OpenRouter lui-même) ; (2) le taux d'hallucination est passé de 39 % à 51 % ; et (3) Moonshot admet lui-même un écart net d'expérience utilisateur face à Fable 5 et GPT-5.6 Sol. La voie réaliste consiste à garder un repli en place et à faire passer une partie du trafic par lui sur un terrain où il excelle, comme la génération de code front-end, puis à comparer.

Q8. Quel progrès par rapport à la K2.6 précédente ?

C'est l'ampleur du bond qui constitue ici la vraie information. Sur le GDPval-AA v2 d'Artificial Analysis, il est passé de 1190 à 1668, soit un gain de 478 points, et sur AA-Briefcase, l'évaluation agentique privée du cabinet, il a gagné 732 points. Sur le Frontend Code Arena d'Arena.ai, il a grimpé de 17 places, de la 18e à la 1re. Ce à quoi le marché a réagi, c'est moins le classement absolu que le terrain regagné en une seule génération.

Articles liés