2026 年 9 月 29 日补充: 本文介绍的是 2026 年 7 月全面开放的 GPT-5.6(Luna / Terra / Sol)。此后,OpenAI 于 9 月 3 日发布了 GPT-6 Astra,又于 9 月 22 日(美国时间)发布了把 Sol、Luna 之名延续到下一代的 GPT-6 Sol 和 GPT-6 Luna。截至 2026 年 9 月 30 日,其 API 模型列表建议:不确定从哪里开始时用 Astra,兼顾智能与成本用 9 月 29 日发布的 GPT-6.1 Sol(在 ChatGPT 中可在 Work 和 Codex 使用,聊天中没有;每百万 token 输入 $2、输出 $10),注重成本的大批量任务用 GPT-6 Luna(同 $0.10、$0.50);GPT-5.6 的三款模型已不在推荐之列(据 ChatGPT 帮助页面,GPT-5.6 Sol、Terra、Luna 在过渡期内仍可使用)。Anthropic 也于 7 月 24 日发布了 Claude Opus 5、9 月 1 日发布了 Claude Fable 5.1、9 月 22 日发布了 Claude Opus 5.5。费用方面请参阅实测比较 Astra(low)与 GPT-5.6 Sol(high)的文章。正文中的“旗舰”“首位”等说法和基准数值均为撰写时的情况。9 月 22 日我们还注明:Luna 在 DeepSWE 上的性价比(每美元约 24 分)是第三方依据 OpenAI 数据做的推算,并标出了出处。

2026年7月9日,OpenAI 正式向公众开放了全新模型家族 “GPT-5.6”(OpenAI 官方公告,在6月26日的限量预览之后正式上线)。最大的特点是,放弃了以往“基础版+Pro”的两档结构,改为 Luna(高速、低成本)/ Terra(均衡)/ Sol(旗舰) 的 三模型体系。

旗舰款 Sol 在衡量编程智能体性能的指标 Artificial Analysis Coding Agent Index 上取得 80 分 位居榜首,在衡量长时实务工作流的 Agents' Last Exam 上也拿下 53.6,把 Claude Fable 5(40.5)拉开了 13.1 分(OpenAI 公布的数值,由 Vellum 整理)。另一方面,在生产级实战编程的 SWE-Bench Pro 上,Claude Fable 5 为 80.0%,Sol 为 64.6%,仍存在明显输给 Claude 的领域(两者均为 OpenAI 评估表中的数值;Anthropic 的系统卡中 Fable 5 也为 80.0%;Anthropic 发布表格中的 80.3% 是与 Mythos 5 共用一栏时较高的数值,即 Mythos 5 的成绩)。

本文基于 OpenAI 官方公告及多份独立基准测试报告,围绕 GPT-5.6 的 三款模型的区别、价格、基准测试、新功能、ChatGPT 各套餐提供情况、与 Claude 的对比、按用途的选择,用确定信息进行解读。

GPT

GPT-5.6 发布

2026年7月9日 正式公开发布 / 三模型体系

Luna
高速、低成本
$0.20 / $1.20 per 1M tokens
Terra
均衡(实务主力)
$2 / $12 per 1M tokens
Sol
旗舰(最高性能)
$5 / $30 per 1M tokens

1. 发布概览——日期、提供范围、规格一览

项目内容
家族名称GPT-5.6
正式公开发布2026年7月9日(限量预览为6月26日)
开发方OpenAI
上一代GPT-5.5
模型构成Luna(高速、低成本)/ Terra(均衡)/ Sol(旗舰)三款模型
上下文窗口约 100 万 tokens(1,050,000)* 三款模型共通
最大输出128,000 tokens
知识截止2026年2月16日
API 价格(Sol)$5(输入)/ $30(输出)per 1M tokens
API 价格(Terra)$2(输入)/ $12(输出)per 1M tokens
API 价格(Luna)$0.20(输入)/ $1.20(输出)per 1M tokens
推理 effortnone / low / medium / high / xhigh / max 六个档位
提供渠道ChatGPT / ChatGPT Work / Codex / OpenAI API
同期发布ChatGPT Work(业务智能体)、内置 Codex 的全新桌面应用、语音模型 GPT-Live

要点在于,三款模型都共享相同的约 100 万 tokens 上下文与 128K 的最大输出。区别在于“聪明程度”“速度”“价格”,可处理的文档量并无不同。这一设计让你可以按用途和成本进行纵向的分档选择。

2. Luna / Terra / Sol——三款模型的区别与选择

GPT-5.6 最大的变化是从“两档(基础版/Pro)”重组为“三档”。下面梳理各自的定位。

Luna
高速、低成本

最便宜、最快的模型。最适合简单的分类、摘要、聊天、大批量处理。Trilogy AI Center of Excellence(2026 年 7 月 10 日)根据 OpenAI 发布图表中的 DeepSWE v1.1 得分与估算 API 成本推算:Luna 在最高得分时每 1 美元估算 API 成本约得 24 分,远超 Claude Fable 5 的 3.2(成本为 OpenAI 模拟得出的估算值)。

适合用途:高频次、低单价任务、企业内部工具

Terra
均衡(实务主力)

以远低于上一代的价格提供与 GPT-5.5 相当性能的“日常使用首选”。在 TerminalBench 2.1 上以 87.4% 逼近 Sol,单价却只有 Sol 的四成(2026年7月30日降价后)。被定位为“多数实务工作负载用 Terra 就够了”。

适合用途:日常编程、写作、智能体

Sol
旗舰(最高性能)

GPT-5.6 家族中最聪明的模型。在智能体综合实力、长时任务、安全性上均为最高水准。据 OpenAI 称,编程的 token 效率提升了 54%,实现“用更少的 token 达到前沿性能”。

适合用途:复杂智能体、长时自主任务

选择原则很简单。先把 Terra 设为默认,精度不够就升到 Sol,若最看重单价和速度就降到 Luna——这种“以 Terra 为起点”的思路,能更容易地在成本与质量之间取得平衡。

3. 价格体系——低一档的 Terra 值得关注

模型输入 / 1M tokens输出 / 1M tokens定位
GPT-5.6 Sol$5.00$30.00最高性能
GPT-5.6 Terra$2.00$12.00以 Sol 四成的单价达到 GPT-5.5 水准
GPT-5.6 Luna$0.20$1.20最便宜、最快

值得注意的是 Terra 的性价比。OpenAI 解释称“Terra 以约半价提供与上一代 GPT-5.5 相当的性能”。也就是说,此前需要 Sol(相当于旧基础版)才能完成的许多任务,如今有可能以一半的成本运转。

另一方面,Sol 的 $5/$30 与 Claude Opus 4.8($5/$25)在输入上同价,输出则略高。各家旗舰的单价正逐渐趋于持平,差距已进入靠“性能”和“token 效率”来体现的时代。

4. 基准测试——与 Claude 的直接对比

GPT-5.6 基准测试(主要 4 项)

Sol / Terra / Luna vs Claude Fable 5

Sol Terra Luna Claude Fable 5
TerminalBench 2.1(终端操作)
88.8% ← 领先
87.4%
84.7%
83.1%
SWE-Bench Pro(生产级实战编程)
80.0% ← 领先
64.6%
63.4%
62.7%
Claude Fable 5 明显占优(OpenAI 评估表的数值;Anthropic 系统卡中也为 80.0%)
Agents' Last Exam(55 个领域的长时实务)
53.6 ← 领先
50.4
50.3
40.5
Artificial Analysis Coding Agent Index
80 ← 领先
77.4
77.2
74.6

来源:OpenAI 的 GPT-5.6 发布中的评估表(Coding Agent Index 来自 Artificial Analysis;Sol 的 Agents' Last Exam 来自发布正文)。Claude Fable 5 的数值同样来自 OpenAI 的表;Anthropic 自己的发布给出的是 SWE-Bench Pro 80.3%、TerminalBench 2.1 88.0%(均为与 Mythos 5 共用一栏时两者中较高的数值;系统卡中 Fable 5 单独为 80.0% 和 84.3%)

基准测试SolTerraLunaClaude Fable 5
TerminalBench 2.188.8%87.4%84.7%83.1%
SWE-Bench Pro64.6%63.4%62.7%80.0%
Agents' Last Exam53.650.450.340.5
Coding Agent Index8077.474.677.2
MRCR 长文本召回91.5%89.6%41.3%—

结论:智能体强,生产级实战编程 Claude 更胜一筹

GPT-5.6 Sol 在 智能体综合实力(Agents' Last Exam)和编程智能体指标上位居首位。按 OpenAI 的表,在 TerminalBench 上也超过 Claude Fable 5(83.1%)。然而在 SWE-Bench Pro(在真实代码仓库中修复生产级 Bug)上,Sol 为 64.6%,对阵 Claude Fable 5 的 80.0%(Terra 为 63.4%,Luna 为 62.7%),以超过 15 分的差距落败。“作为智能体自主运转的能力”与“精准修改真实代码库的能力”是两回事——这是坦率的解读。

此外,Luna 的长文本召回(MRCR)为 41.3%,大幅低于 Sol/Terra。即便拥有 100 万 tokens 的窗口,用 Luna 精细处理超长文本也并不合适。长文本请选择 Terra 及以上。

5. 有哪些新变化——五大要点

① 从两档结构转向三模型体系

最大的变化。从以往的“基础版+昂贵的 Pro”,重组为 Luna / Terra / Sol 三档。尤其 Terra 以“用 Sol 四成的单价达到 GPT-5.5 水准”的性价比,成为成本设计的主角。

② token 效率的改进(编程提升 54%)

OpenAI 的萨姆·奥尔特曼 CEO 表示,Sol 在智能体编程任务上的 token 效率高出 54%(接受 CNBC 采访时所说,未说明比较基准)。即便是相同的工作,只要消耗的 token 减少,单价不变总成本也会下降。这正是应当不只看单价表、更要按“每个任务的实际成本”来比较的原因。

③ Programmatic Tool Calling(Responses API)

作为面向开发者的新功能,让模型生成并执行 JavaScript 来编排工具调用的“Programmatic Tool Calling”被加入到了 Responses API 中(Simon Willison 的解读)。可以用更少的往返执行跨多个工具的复杂智能体。推理 effort 分为 none / low / medium / high / xhigh / max 六个档位。

④ ChatGPT Work、全新桌面应用

在 GPT-5.6 发布的同时,还发布了面向业务的智能体 “ChatGPT Work”、内置 Codex 的全新桌面应用,以及面向客户的托管服务。这是把 ChatGPT 从“单纯的聊天”拓展为“执行业务的平台”的举措。

⑤ 语音模型 GPT-Live(全双工对话)

在语音方面推出了新系列 GPT-Live。它不再采用以往的轮次制(说完后才回应),而是实现 全双工(full-duplex)、像人一样可以插话、附和的对话。付费用户可用 GPT-Live-1,免费用户提供 GPT-Live-1 mini。

6. ChatGPT 各套餐的提供情况

套餐月费参考GPT-5.6 的使用模型选择
Free$0△ 仅在 ChatGPT Work / Codex 内使用 Terra不可(固定 Terra)
Go$8/月△ 仅在 ChatGPT Work / Codex 内使用 Terra不可(固定 Terra)
Plus$20/月✅ Sol / Terra / Luna可(可设置 effort)
Pro$100〜$200/月✅ Sol / Terra / Luna可(可设置 effort)
Business$25/席起✅ Sol / Terra / Luna可(可设置 effort)
Enterprise面议✅ Sol / Terra / Luna可(可设置 effort)

Free / Go 用户的一个特点是,在 ChatGPT Work 或 Codex 中也可以使用 Terra。不过,能够自由地分档选择模型、甚至调整推理 effort 的,是 Plus 及以上。语音的 GPT-Live 即使免费也能使用 mini 版。(套餐构成、价格基于发布时的各类报道。最新信息请查看 ChatGPT 官方价格页)

7. 与 Claude(Fable 5 / Opus 4.8)的对比

GPT-5.6 Sol vs Claude Fable 5 vs Claude Opus 4.8

旗舰级的分工使用

GPT-5.6 Sol

2026年7月9日

价格(输入/输出)
$5 / $30 per MTok
上下文
1,050,000 tokens
优势
◎ 智能体综合实力(首位)
◎ token 效率、安全性
◎ 三款模型可纵向选择
短板
△ SWE-Bench Pro 大幅落败
Claude Fable 5

Anthropic 顶级款

价格(输入/输出)
$10 / $50 per MTok
上下文
1,000,000 tokens
优势
◎ SWE-Bench Pro 80.0%(首位)
◎ 精准修改真实代码库
◎ 长时自主编程
短板
△ 单价偏高
Claude Opus 4.8

重视性价比的实务向

价格(输入/输出)
$5 / $25 per MTok
上下文
1,000,000 tokens
优势
◎ 输出单价比 Sol 便宜
◎ 安全性、准确性
◎ 编程的稳定感
短板
△ 最新智能体综合实力 Sol 占优

归纳来看——“作为智能体广泛地自主运转”选 GPT-5.6 Sol,“精准修改真实代码库、进行长时编程”选 Claude,这就是两者的分工。价格方面,Claude Opus 4.8($5/$25)的输出单价比 Sol($5/$30)便宜,且编程质量高,因此在编程用途上 Claude 阵营的性价比更为突出。

8. 注意事项——未公开的基准与编程短板

① 存在 OpenAI 未公开的基准测试

独立分析(Vellum)在发布后不久指出,OpenAI 未公布 SWE-bench Verified、GPQA Diamond、AIME、MMLU、ARC-AGI-2、FrontierMath。不过,2026 年 9 月 22 日查看的 OpenAI 发布页评估表中列有 GPQA Diamond(Sol 94.6%)和 FrontierMath(第 1 至 3 级 89%,第 4 级 83%)。表中没有的是 SWE-bench Verified、AIME、MMLU;Sol 的 ARC-AGI-2 数值(92.5%)则是在 9 月 3 日 GPT-6 Astra 发布的对比表中才首次出现。以智能体类指标为中心、通用推理与数学的对比值偏少这一点,在评估时应予留意。需要打个折扣来看待——因为有可能只罗列了好看的数字。

② 生产级实战编程即便是 Sol 也偏弱

如前所述,在 SWE-Bench Pro 上 Sol 为 64.6%,而 Claude Fable 5 为 80.0%(均为 OpenAI 评估表中的数值)。若主要目的是生产仓库的 Bug 修复或创建 PR,比起 GPT-5.6,值得考虑 Claude。另外,OpenAI 虽然把这一数值列入评估表,却另外发布了一份分析,认为 SWE-Bench Pro 中约 30% 的任务存在缺陷(Vellum 指出)。

③ Luna 不擅长长文本处理

Luna 便宜又快,但长文本召回(MRCR)仅为 41.3%,大幅偏低。请避免把冗长的规格文档、日志、代码库整份交给 Luna,长文本请交给 Terra 及以上。

④ 知识截止为 2026年2月16日

此后发生的事件未被学习。需要最新信息的任务,以配合使用 Web 搜索工具为前提。

9. 按用途推荐——该选哪款模型

✅ 选择 GPT-5.6 Terra
  • 日常编程、写作、摘要
  • 看重成本与质量的平衡
  • “先作为默认使用”的一台
✅ 选择 GPT-5.6 Sol
  • 复杂的自主智能体运营
  • 长时任务、安全业务
  • 精度比成本更重要的场景
✅ 选择 GPT-5.6 Luna
  • 高频次、低单价的大批量处理
  • 分类、抽取、简短聊天
  • 以短文本为主(避免长文本)
✅ 选择 Claude
  • 生产仓库的 Bug 修复、PR
  • 长时的自主编程
  • 准确性、安全性最优先

FAQ

Q1. GPT-5.6 从什么时候开始可以使用?

2026年7月9日开始正式向公众提供(限量预览为6月26日)。可在 ChatGPT、ChatGPT Work、Codex、OpenAI API 中使用。

Q2. Luna / Terra / Sol 有什么区别?

它们是在聪明程度、速度、价格三条轴上纵向排列的模型。Luna=最便宜、最快,Terra=均衡(以 Sol 四成的单价达到 GPT-5.5 水准),Sol=最高性能。上下文(约 100 万 tokens)和最大输出(128K)三款模型共通。建议先把 Terra 设为默认,再按需切换到 Sol/Luna。

Q3. 免费套餐也能使用 GPT-5.6 吗?

在普通聊天中不能使用,但 在 ChatGPT Work 或 Codex 中,Free / Go 也能使用 Terra。若要自由地分档选择模型或调整推理 effort,则需要 Plus($20/月)及以上。语音的 GPT-Live 即使免费也能使用 mini 版。

Q4. GPT-5.6 和 Claude,编程谁更强?

取决于指标。在终端操作(TerminalBench 2.1)上,Sol 88.8% 超过 Claude Fable 5 的 83.1%,但在生产级实战的 SWE-Bench Pro 上,Claude Fable 5 为 80.0%,Sol 64.6%,Claude 大幅占优(均为 OpenAI 评估表中的数值;Anthropic 的系统卡中 Fable 5 的 SWE-Bench Pro 也为 80.0%)。若主要目的是生产仓库的 Bug 修复就选 Claude,若要广泛的自主智能体就选 Sol,这样分工使用更为现实。

Q5. 价格是怎样的?

每 1M tokens,Sol $5/$30,Terra $2/$12,Luna $0.20/$1.20(输入/输出)(截至 2026年8月)。2026年7月30日 Luna 降价 80%、Terra 降价 20%,Sol 保持不变。Terra 被定位为以 Sol 约四成的单价提供相当于上一代 GPT-5.5 的性能,是成本设计的主角。另外,Sol 自2026年8月21日起转为促销价(输入 $4 / 输出 $20,公告称为期3个月)。它和 GPT-6 Astra 哪个更省钱,在GPT-6 Astra 的 low 真的更便宜吗里根据实测值做了比较。

Q6. 上下文窗口和知识截止是?

三款模型都拥有约 100 万 tokens(1,050,000)的上下文和 128K 的最大输出。知识截止为 2026年2月16日。

Q7. 有面向开发者的新功能吗?

Responses API 中新增了 Programmatic Tool Calling(让模型生成 JavaScript 来组装工具调用的功能)。推理 effort 可以用 none / low / medium / high / xhigh / max 六个档位来控制。

Q8. GPT-Live 是什么?

是与 GPT-5.6 同时发布的全新语音模型系列。它不是轮次制,而是 全双工(full-duplex),能进行包含插话和附和的自然对话。付费提供 GPT-Live-1,免费提供 GPT-Live-1 mini。

Q9. 有 OpenAI 未公开的基准测试吗?

是的。发布页的评估表中没有 SWE-bench Verified、AIME、MMLU。独立分析(Vellum)在发布后不久指出 GPQA Diamond 和 FrontierMath 也未公布,但 2026 年 9 月 22 日查看的评估表中已列有 GPQA Diamond(Sol 94.6%)和 FrontierMath。由于以智能体类指标为中心,通用推理、数学的实力需要另行评估。

Q10. 现有的 GPT 应用还能照常运行吗?

API 大体兼容,切换模型 ID 即可迁移。不过由于变成了三模型体系,重新设计把哪类任务分配给 Luna/Terra/Sol,能够优化成本与质量。多数情况下以 Terra 为起点是有效的。

总结:进入以三模型体系“纵向选择”的时代

GPT-5.6 不是单一的招牌模型,而是以 Luna / Terra / Sol 三档结构登场。Sol 在智能体综合实力和编程智能体指标上位居首位,Terra 以“用 Sol 四成的单价达到 GPT-5.5 水准”的性价比成为实务主力,Luna 则担当大批量处理的性价比角色——分工明确。

另一方面,在生产级实战编程(SWE-Bench Pro)上大幅输给 Claude,以及 OpenAI 评估表中通用推理、数学的对比值偏少、Luna 的长文本处理偏弱等,也存在无法无条件称之为最佳的因素。

2026 年聪明的用法,仍然是 “根据任务在 GPT-5.6 的三款模型与 Claude 之间分工使用”。日常用 Terra,复杂智能体用 Sol,大批量处理用 Luna,生产编程用 Claude——以多模型为前提,持续优化成本与质量。

相关文章