2026 年 7 月 16 日,中国的 Moonshot AI 发布了 Kimi K3。总参数量 2.8 万亿,被称为史上最大的开放模型;发布后没过几天,美国半导体股票遭到抛售,一位白宫官员更是公开指控该公司蒸馏了 Anthropic 的模型。

麻烦的是,这件事的数字、甚至连叫法,都会因为报道者不同而互相打架。本文把基准发布方、财经媒体、Moonshot 自己的公告,以及 Hugging Face 上的实际页面逐一对照,并在行文中随时说明每个数字出自谁之手

要点
性能
综合第三,编程第一

发布时在 Artificial Analysis 上得 57 分、排名第三。在 Arena.ai 的 Frontend Code Arena 上排名第一。但综合来看,它仍未追上 Fable 5 和 GPT-5.6 Sol。

价格
换个比较对象,结论就反过来

输入 $3、输出 $15,明显比 Opus 4.8 或 GPT-5.6 Sol 便宜。但它又是中国模型里最贵的一个——是 GLM-5.2 的三倍。

权重公开
开放权重,但尚未放出

公开时间定在7 月 27 日。截至撰稿时,Hugging Face 上仍是倒计时页面,许可证也尚未公布

1. Kimi K3 是什么——核心规格与公司背景

Kimi K3 是 Moonshot AI 的旗舰模型,API 于 2026 年 7 月 16 日上线ITmedia NEWSOpenRouter 等来源一致)。该公司成立于 2023 年,由阿里巴巴和腾讯投资;据 Forbes 报道,最近一轮融资使其估值超过 200 亿美元(此前依次为 43 亿美元和 100 亿美元),截至 2026 年 4 月年化收入(ARR)为 2 亿美元

2.8 万亿
总参数量。发布时被称为迄今宣布将公开的最大模型
16 / 896
MoE 专家数。896 个中每个 token 只激活 16 个(激活率不到 2%)
100 万
上下文长度(准确地说是 1,048,576 个 token)
约 1.4TB
4 比特(MXFP4)下权重的实际磁盘占用。Moonshot 建议 64 张以上加速卡

来源:Moonshot AI 的发布公告(据 ITmedia NEWS 报道,其中引用了 npaka 的解读文章)与 Northflank 的实测文章。上下文长度和权重体积为 Northflank 的实测数值。

架构上有两处新增设计各自拥有名字。Kimi Delta Attention(KDA)用于在百万 token 级上下文下加速解码,AINews 称其最高快 6.3 倍。而 Attention Residuals(AttnRes)会有选择地从更早的层中取出所需的表示,同一篇文章给出的收益是额外成本不到 2%,训练效率提升约 25%。权重采用 MXFP4、激活值采用 MXFP8;而且不是事后再加上量化,而是从 SFT 阶段起就以量化为前提进行训练。

🟡 激活参数量没有官方数字。流传的“2.8T-A50B”(激活约 500 亿)这一写法,其实是由 16/896 这个比例推算出来的估计值,并非 Moonshot 公布的数字——Northflank 明确指出,Moonshot 从未说明过激活参数量。另外也值得记住:OpenAI 和 Anthropic 都不公开自家模型的参数量,所以“2.8 万亿、全球最大”这个说法,只在那些公开了规模的模型之间才成立。

2. “第三名”到底指什么——是哪个榜单,又是什么时候的事

说它“仅次于 OpenAI 和 Anthropic 的最新模型,位居第三”,大体上没错。但如果不把出处钉死,后面的数字就会对不上。

依据是 Artificial AnalysisIntelligence Index。该机构在 2026 年 7 月 17 日的文章中给 Kimi K3 打了 57 分,排在 Claude Fable 5 和 GPT-5.6 Sol 之后位居第三,并评价其智能水平与 Opus 4.8、GPT-5.5 相当。作为参照,同一榜单上 GLM-5.2 为 51 分,DeepSeek v4 Pro 为 44 分。

⚠️ 同样是 57 分,却被报成第 3、第 4 和第 7

Artificial Analysis 自己的公告写的是第三,Northflank 的统计是189 个模型中第四,而该机构的实时页面显示190 个模型中第七。分数(57)从未变过,因此差异来自比较范围里放了什么——推理强度不同的变体是否单独计入——以及统计是在哪个时点做的。榜单每天都在变,“第三”最好当作 2026 年 7 月 17 日的一张快照来读

换成更贴近实际工作的指标,排序就清晰得多。下面是 Artificial Analysis 的 GDPval-AA v2,它用 Elo 分制衡量实务任务,人类基准线设为 1,000。

模型GDPval-AA v2(Elo)所处位置
Claude Fable 51760第 1
Kimi K31668仅次于 Fable 5 与 Sol
Claude Opus 4.81600K3 超过了它
GLM-5.21514中国上一代模型中的最好成绩
GPT-5.51494
Kimi K2.6(上一代)1190K3 高出 478 分

来源:Artificial Analysis(该机构 2026 年 7 月 17 日发布的文章)。在其非公开的智能体评测 AA-Briefcase 上,K3 同样以 Elo 1547 排在 Fable 5 之后位居第二,较上一代 K2.6 提升 732 分。在 AutomationBench-AA 上则以 53% 拿下第一

真正重要的数字不是“第三”,而是相对上一代跃升的幅度。GDPval-AA v2 从 1190 涨到 1668,AA-Briefcase 上 +732 分。真正撬动市场的,是一款中国开放模型在一代之内就逼近了美国前沿这一事实。

3. 基准是谁跑的——把厂商自测和第三方测评分开看

基准数字的分量,取决于它是Moonshot 自己测的还是外部机构测的,二者完全不同。ITmedia 把这两类分开报道,本文也沿用同样的做法。

Moonshot 自测(=厂商发布)
  • Program Bench:K3 77.8%(GPT-5.6 Sol 77.6%、Fable 5 76.8%)
  • SWE Marathon:K3 42.0%(第二名 Opus 4.8 为 40.0%)
  • BrowseComp:K3 91.2%(GPT-5.6 Sol 90.4%)

每一项都赢得很微弱,而且全部出自厂商自己的测试——阅读时需把这一点考虑进去。

第三方测评
  • Frontend Code Arena(Arena.ai):K3 以 1679 分排第一(Fable 5 1631、GPT-5.6 Sol 1618)。在 7 个子领域中的 6 个居首,较 K2.6 的第 18 名上升 17 位
  • GDPval-AA v2:K3 以 1668 分排第三(Artificial Analysis)
  • FrontierSWE:Fable 5 86.6% > K3 81.2%这一项 K3 输了
  • Vals Index:74.70%(38 个模型中第二,据 Northflank 统计)

值得注意的结果是,它在 FrontierSWE 上以 5.4 分之差落后于 Fable 5。说它在某些基准上登顶,这是准确的,但它并没有全面获胜。Moonshot 自己也承认综合水平不及 Fable 5 和 GPT-5.6 Sol(详见后文)。

🟡 计分方法遭到了质疑。Program Bench 的作者指出,Moonshot 用的是平均实现率,而不是完整跑通的程序数量。AI 创业者 Bindu Reddy 则另外主张,需要在 LiveBench 这类未被污染的非公开评测上做验证。厂商自测中那些微弱的胜出,应当据此打个折扣来看。

4. 价格:结论会随比较对象而反转

Kimi K3 每百万 token 输入 $3.00、输出 $15.00(缓存命中的输入为 $0.30)。由于换个比较对象,评价就会完全反过来,只看其中一侧就会得出错误结论。

对比西方前沿模型 → 明显更便宜
  • Kimi K3:$3 / $15
  • Claude Opus 4.8:$5 / $25
  • GPT-5.6 Sol:$5 / $30

输入便宜约四成,输出便宜四到五成。以低于西方的价格提供前沿级性能,一直是 Kimi 的统一说法,而在这一点上它确实站得住脚

对比中国同行 → 是其中最贵的
  • Kimi K3:$3 / $15
  • GLM-5.2:单任务成本约为 K3 的三分之一
  • DeepSeek V4 Pro:单任务成本约为 K3 的二十三分之一

Simon Willison 认为这是相对该公司此前模型的大幅涨价,并称它是中国 AI 实验室发布过的最贵的模型

有一点必须说清楚:这不是又一次 DeepSeek 冲击。2025 年 1 月的 DeepSeek 之所以令人震动,是因为定价比西方低了一个数量级。K3 则是比西方模型便宜四到五成,但仍在同一个数量级。这不是价格颠覆,而是性能追上来之后,顺带给了一点折扣

而且,实际付出的金额并不只由单价决定。Artificial Analysis 在运行其 Intelligence Index 的过程中测量了完成一个任务的真实成本

Artificial Analysis 实测的单任务成本(在其 Intelligence Index 运行期间)

$0.94
Kimi K3
$1.04
GPT-5.6 Sol
$1.80
Claude Opus 4.8
$0.32
GLM-5.2
$0.04
DeepSeek V4 Pro

来源:Artificial Analysis。在其测量中,Kimi K3 完成 Intelligence Index 需要约 1.32 亿个输出 token,少于上一代 K2.6 所消耗的约 1.66 亿。单价虽高,但推理不那么啰嗦,总额反而被拉低了。

无论按标价还是按实测成本都比 Opus 4.8 便宜,同时又是中国模型里最贵的——这才是价格的完整图景。“中国出品所以极其便宜”这套框架并不适用;而一旦拿它和西方比较,把它一句“太贵”打发掉同样是错的。

5. 现在还没人能下载——开放权重的真实进度

各家媒体连该怎么称呼它都没谈拢。VentureBeat 的标题写的是“史上最大的开源模型”,SCMP 写的是“全球最大的开源 AI 模型”,而路透社用的是“开放权重(open-weight)”。技术上准确的是后者,原因如下。

1. 截至撰稿时尚未放出

Hugging Face 上的 moonshotai/Kimi-K3 仓库仍然显示倒计时,一个 safetensors 文件都没有列出。Artificial Analysis 的模型页面也把它标为专有(proprietary)核对时间为 2026 年 7 月 27 日——这一天正是预定的公开日,因此等你读到本文时,情况很可能已经变了。请点击上面的链接查看当前状态。

2. 许可证同样未公布

截至 7 月 17 日,Northflank 明确写道许可证尚未公布。Hugging Face 的一篇社区文章同样把它列为“待定”,直到权重放出为止。所谓会采用“Modified MIT”的说法,是从 K2 一代推断出来的二手信息,并未确定。

3. 它本来就不是开源

被承诺公开的是训练好的权重,而不是训练数据或训练代码。这种形态准确的叫法是开放权重,与 OSI 所定义的开源是两回事。

即便真的放出,这也不是个人能跑得动的东西。在 4 比特(MXFP4)下仅权重就约有 1.4TB,再算上 KV 缓存和激活值所需的余量,Northflank 估计你需要八台各配八张 80GB GPU 的节点,而 Moonshot 建议使用64 张以上加速卡的超级节点。它装不进单张 H100、H200 或 B200,分布式集群是必需的,生产环境部署实际上只能是 Linux 加 NVIDIA。这和本地 LLM 的硬件要求里讨论的个人配置完全不是一回事。

话虽如此,它的意义依然很大。一旦前沿级权重落到地面上,那些不能让数据离开自己围墙的组织——受监管行业、政府机构——就能在内部运行它们。仅仅是存在一个站在同一水平线上的公开模型,就足以改变闭源 API 的议价能力。如何挑选开放模型背后的那些前提,也因为这次发布而需要更新。

6. 美股到底跌了多少——数字因媒体而异

发布当周,美国半导体股票确实遭到了抛售。但各家媒体报出的跌幅互相冲突,因此这里以区间而非定论的形式列出。

波动对象报道中的变动来源与备注
纳斯达克周五-1.5%(当周最差的一个交易日)Yahoo Finance
台湾市场跌超 6%同上
日本市场收盘-4%同上
半导体 ETF(SMH)较 6 月底高点下跌超过 20%同上
费城半导体指数(SOX)当周-9% 至 -12.5%⚠️ 数字因媒体而异(“12.5%,15 个月来最差一周”“超过 9%”“约 10%,为 2025 年 4 月以来最大跌幅”)
个股(7 月 17 日)AMD -5%、Intel -4%、NVIDIA -3%(均为盘中,随后收复)24/7 Wall St.
港股上市的中国 AI 公司智谱-28.4%、MiniMax -15.6%(7 月 17 日)Forbes。中国公司被抛售得更狠

作为对照,在人人都会拿来类比的 2025 年 1 月DeepSeek 冲击中,Yahoo Finance 报道称仅 NVIDIA 一家就在一个交易日内蒸发了约 5,900 亿美元市值。这次 NVIDIA 的跌幅是盘中 3%——完全不是一个量级。

🟡 此后跌幅已被收复

Yahoo Finance 随后报道称抄底资金入场,芯片股收窄了跌幅,美国银行则持冷静看法,认为这不过是一次夏季回调。分析师的意见也不统一。Bernstein 的 Robin Zhu 把 K3 定位为确认性(confirmatory)的事件——只是给中国实验室正在缩小差距这条已知趋势又添了一个数据点。相反,摩根士丹利的 Gary Yu 表示,K3 在全球获得了正面反响,显示出中国的 LLM 正在模型规模、性能和价格三方面同时追赶美国领先者

另外还流传着一个说法,称AI 相关市值在三天内蒸发了 4,700 亿美元,但它的源头是一家加密货币媒体的快讯,在主流财经媒体上无法得到佐证,因此本文不采用。

7. 蒸馏指控,以及针对它的反驳

7 月 22 日至 23 日,话题从技术转向了地缘政治。据 CNBC、The Hill、Yahoo News 等媒体报道,白宫科技政策办公室(OSTP)主任 Michael Kratsios 就 Moonshot 提出了两项指控。

指控一:获取被禁运的芯片

称 Moonshot 取得了搭载 NVIDIA GB300 的服务器,并且在泰国也能使用 GB300,有可能用它们训练了自家模型。GB300 属于 Blackwell 世代,依法不得销往中国。

指控二:工业规模的蒸馏

称该公司针对 Anthropic 的 Fable 实施了工业规模的隐蔽蒸馏,甚至搭建了一个专门轮换访问方式以逃避检测的平台。同场出席的 Jacob Helberg 把它称作对美国宝贵知识产权的窃取。

反驳:时间对不上

Moonshot 员工 Randy Xian 在 X 上带着讽刺回应称,Fable 于 7 月 1 日公开,K3 于 7 月 15 日发布,照这么说我们是在 15 天里从零训练出了一个前沿模型——够破纪录了。AI 研究者 Braden Hancock 对 TechCrunch 表示,Fable 从 7 月 1 日才开始可用,要在两周内蒸馏出那么多数据、完成训练并发布,是不可能的

🔴 没有任何证据被公开。据 SCMP 报道,多位 AI 专家称这一指控是政治性的、不负责任的,并指出模型输出本来就不受版权保护。路透社援引外交电文报道称,美国国务院早在 4 月就已指示各使馆向驻在国政府通报中国 AI 企业的知识产权侵权问题,Moonshot 也在被点名之列。换句话说,这些指控早于 K3 的发布,而针对 K3 本身的证据一份也没有拿出来。

美国一方对此也并非铁板一块。NVIDIA 公开点名批评了 Anthropic,就 Anthropic 关于出口管制漏洞的说法表示,美国企业应当专注于创新、迎接挑战,而不是编造离奇的故事

8. 短板——速度、幻觉,以及 Moonshot 自己的判断

被性能话题盖过去的,是三个在生产环境中会真正咬人的短板。

🐢 慢(不过测量结果互相矛盾)

Artificial Analysis 的实时测量显示为每秒 33 个 token(190 个模型中第 145 位),首个 token 需要177 秒。而 Northflank 报告的是每秒 62 个 token、1.99 秒。这个差距大多来自需求过旺造成的容量紧张——OpenRouter 在该模型上挂出了警告,称上游容量受限,429 错误可能频繁出现

🎭 幻觉反而变严重了

Artificial Analysis 报告称,虽然准确率有所提升,但幻觉率从 39% 升到了 51%。智能分数更高不等于更符合事实,这不是一个可以不做核验就直接用的模型

📝 Moonshot 自己也承认存在差距

该公司表示,自家模型与 Claude Fable 5 及 GPT-5.6 Sol 之间在用户体验上存在明显差异。它自己的判断是:基准上的微弱差距,和一个模型在日常使用中的手感,是两码事。

9. 现在就能上手的方式

在权重放出之前,有三种方式可以试用它。

途径详情适合谁
Kimi 官方应用/网页版通过 kimi.com 使用。提供免费额度只想先判断质量的人
Moonshot API输入 $3、输出 $15、缓存命中 $0.30(每百万 token)要把它嵌入自家产品的团队
通过 OpenRouterOpenRouter。用你已经在调用其他模型的同一个接口想同时比较多个模型的人
自建部署需等权重公开(预定 7 月 27 日)之后。建议64 张以上加速卡,并且在 vLLM、TensorRT-LLM 或 SGLang 中需要支持 MoE 的调度数据不能离开自己场所的组织

不过要记住,如前所述,容量紧张、429 错误很常见。在把生产工作负载整体切过去之前,现实的做法——和在云端与本地之间做选择是同一个思路——是先准备好回退方案,再把一部分流量导到它上面

10. 按确信度给各项说法分级

✅ 已在一手来源中确认
  • API 于 2026 年 7 月 16 日发布;总参数量 2.8 万亿;896 个专家中激活 16 个;100 万 token
  • API 定价为输入 $3、输出 $15、缓存 $0.30
  • Artificial Analysis Intelligence Index 得 57 分
  • GDPval-AA v2 得 1668(Fable 5 = 1760、Opus 4.8 = 1600)
  • Frontend Code Arena 以 1679 分位列第一
  • 单任务成本 $0.94,低于 Opus 4.8 的 $1.80
  • 幻觉率从 39% 升至 51%
🟡 来源不一致或数值会变动
  • 它在 Intelligence Index 上的名次(第 3、第 4、第 7 三种说法并存)
  • SOX 的周跌幅(-9% 至 -12.5%)
  • 输出速度(33 tok/s 与 62 tok/s)
  • 激活参数量“约 500 亿”(是估算值,不是官方数字)
  • “Modified MIT”许可证(由 K2 推断而来)
🔴 尚未定论、没有证据
  • 蒸馏指控——没有公开证据,研究者基于时间线予以否定
  • 获取禁运芯片——一位美国官员的说法;Moonshot 的正式回应与相关证据均未公开
  • 权重与许可证——截至撰稿时尚未放出(预定 7 月 27 日)
  • “AI 相关市值三天蒸发 4,700 亿美元”——在主流财经媒体上无法得到佐证

简而言之,Kimi K3 真正的故事,是一款中国开放模型已经进入了前沿的射程之内。它以比西方前沿低四到五成的价格走到了这一步,但并非低一个数量级;它综合上仍落后于 Fable 5 和 GPT-5.6 Sol;它慢;而且幻觉更多。即便如此,它在一代之内把 GDPval-AA v2 推高了 478 分,并承诺公开权重——市场反应的正是这一点。

FAQ

Q1. Kimi K3 是开源的吗?

不是。计划中的是公开训练好的权重,也就是开放权重,而不是公开训练数据或训练代码。除此之外,截至撰稿时权重本身也还没有放出——Hugging Face 上的 moonshotai/Kimi-K3 页面仍显示倒计时,许可证也尚未公布。公开时间预定为 2026 年 7 月 27 日。

Q2. 它在基准上真的是第三吗?

依据是 Artificial Analysis 的 Intelligence Index 上的57 分、第三名,排在 Claude Fable 5 和 GPT-5.6 Sol 之后;截至 2026 年 7 月 17 日,这个说法是正确的。但同样是 57 分,也存在把它排在第四和第七的统计,因为结果会随比较范围如何划定以及统计时点而变化。请把“第三”当作一张快照来读。在偏编程的 Frontend Code Arena 上它排第一,而在 FrontierSWE 上它输给了 Fable 5

Q3. 它真的便宜吗?

这要看和谁比,结论会反转。每百万 token 输入 $3、输出 $15,比 Claude Opus 4.8($5/$25)或 GPT-5.6 Sol($5/$30)输入便宜约四成、输出便宜四到五成,所以相对西方前沿它明显便宜。实测成本也印证了这一点:单任务 $0.94,而 Opus 4.8 是 $1.80(Artificial Analysis)。但和中国同行相比,它是其中最贵的——约为 GLM-5.2 的三倍、DeepSeek V4 Pro 的 23 倍。Simon Willison 称它是中国 AI 实验室发布过的最贵的模型。这不是 DeepSeek 冲击那种低一个数量级的折扣。

Q4. 美股为什么会下跌?

因为担心廉价的中国模型会削弱对昂贵算力的需求。发布当周,纳斯达克周五下跌 1.5%,台湾跌超 6%,日本跌 4%,半导体 ETF(SMH)较 6 月底高点下跌超过 20%。不过随后抄底资金入场,芯片股收窄了跌幅,美国银行称这不过是一次夏季回调。这与 DeepSeek 冲击的规模不同——2025 年 1 月,仅 NVIDIA 一家就在一天内蒸发了约 5,900 亿美元。

Q5. 说他们偷了 Anthropic 的模型,是真的吗?

没有任何证据被公开。白宫 OSTP 主任 Michael Kratsios 指控其对 Anthropic 的 Fable 进行了工业规模的蒸馏,但 Moonshot 予以否认,理由是Fable 于 7 月 1 日公开发布,K3 于 7 月 15 日上线,中间只有 15 天。AI 研究者 Braden Hancock 同样对 TechCrunch 表示,在两周内完成蒸馏、训练和发布是不可能的。据 SCMP 报道,多位专家批评这一指控是政治性的。就目前而言,还没有足够的材料下定论。

Q6. 我能在自己的电脑上运行它吗?

不能。即便是 4 比特量化(MXFP4),仅权重就约有 1.4TB,单张 H100、H200 或 B200 都装不下。Northflank 估计需要八台各配八张 80GB GPU 的节点,而 Moonshot 建议64 张以上加速卡。macOS 和 Windows 不在生产使用的考虑范围内,前提是 Linux 加 NVIDIA。这与自己运行本地 LLM完全不是一个量级。

Q7. 我应该在生产环境中使用它吗?

不建议马上全面切换,理由有三:(1)容量紧张,429 错误可能频繁出现(这是 OpenRouter 自己的警告);(2)幻觉率从 39% 升到了 51%;(3)Moonshot 自己也承认相对 Fable 5 和 GPT-5.6 Sol 存在明显的用户体验差距。现实的路径是保留回退方案,先在它擅长的领域把一部分流量导过去,比如前端代码生成,然后再做对比。

Q8. 它比上一代 K2.6 好多少?

跃升的幅度才是这里真正的看点。在 Artificial Analysis 的 GDPval-AA v2 上,它从 1190 提升到 1668,涨了 478 分;在该机构非公开的智能体评测 AA-Briefcase 上则涨了732 分。在 Arena.ai 的 Frontend Code Arena 上,它从第 18 名爬到第 1 名,上升了 17 位。市场所回应的,与其说是绝对名次,不如说是它在一代之内追平了多少差距

相关文章