2026 年 9 月 29 日补充: OpenAI 已于 2026 年 9 月 3 日发布后继模型 GPT-6 Astra,又于 9 月 22 日(美国时间)发布了 GPT-6 Sol 和 GPT-6 Luna。本文比较的是它们之前一代的 GPT-5.6 与 GPT-5.5。文中称 Sol 为“旗舰”“最高端”,指的是在 GPT-5.6 世代之内的定位。如果现在要为 GPT-5.5 选择迁移目标,请先考虑 GPT-6 世代的 Astra、Sol、Luna:截至 2026 年 9 月 30 日,API 模型列表建议,不确定从哪里开始时用 Astra,兼顾智能与成本用 9 月 29 日发布的 GPT-6.1 Sol(在 ChatGPT 中可在 Work 和 Codex 使用,聊天中没有),注重成本的大批量任务用 GPT-6 Luna。GPT-5.5 将于 2026 年 10 月 14 日从 ChatGPT、ChatGPT Work 和 Codex 退役(OpenAI API 不受影响),OpenAI 给出的替代是:付费方案用 GPT-6 Sol,Free 和 Go 用桌面应用中的 GPT-6 Luna(GPT-5.6 Sol、Terra、Luna 在过渡期内仍可使用)。费用方面请参阅实测比较 Astra(low)与 GPT-5.6 Sol(high)的文章。

在 2026年4月23日发布的 GPT-5.5 之后仅两个半月,OpenAI 便于 7 月 9 日正式向公众开放了 GPT-5.6。但这次更新并非“单纯的性能提升”。最大的变化是从“单一旗舰模型”重组为“Luna / Terra / Sol 三款模型体系”。

而对大多数 GPT-5.5 用户而言最有冲击力的一点是,中位模型 Terra 以远低于 GPT-5.5 的价格提供“GPT-5.5 级的质量”。发布时为半价,2026年7月30日的降价后更降至 GPT-5.5 的四成单价。想提升性能的人有最高端的 Sol(与 GPT-5.5 同价却更强),想降低成本的人有 Terra——由此产生了新的选择。本文将基于官方发布和独立分析,梳理从 GPT-5.5 到 5.6 发生了哪些变化、以及该换到哪款模型。

GENERATION UPGRADE · 2026

从单一旗舰,走向三款模型体系

— 让你可以在“提升性能”和“降低账单”之间做选择

2026年4月
GPT-5.5
单一旗舰(+高价的 Pro)
SWE-Bench Pro: 58.6%
价格: $5 / $30 per MTok
知识截止: 2025年12月
→
2026年7月
GPT-5.6
Luna / Terra / Sol 三款模型
Sol SWE-Bench Pro: 64.6%
价格: Sol $5/$30、Terra $2/$12、Luna $0.20/$1.20(Sol 自2026年8月21日起为期3个月的促销价为 $4/$20)
知识截止: 2026年2月

Terra 以“四成单价提供 5.5 级质量” / Sol 以“同价提升性能”

1. 有何变化——从单一旗舰到三款模型

GPT-5.5 采用的是“标准版($5/$30)+高价的 GPT-5.5 Pro($30/$180)”两级结构。GPT-5.6 将其重构为可按用途与成本选择的三款模型。

Luna
高速、低成本($0.20/$1.20)

适合大批量处理、分类、轻量对话。是比 GPT-5.5 更低一档的全新定位。

Terra
均衡($2/$12)

以四成的单价提供 GPT-5.5 级的质量。是“用 5.5 就足够的人”的实质后继。

Sol
最高端($5/$30)

在与 GPT-5.5 同价的前提下夯实了性能的 GPT-5.6 世代旗舰。是纯粹意义上的性能后继。

换言之,GPT-5.5 用户的迁移去向会按用途分化。“想以同等质量降低成本”就选 Terra,“想以同等价格提升性能”就选 Sol,“想更便宜地处理大量任务”就选 Luna。相比曾是单一模型的 5.5,选择的自由度大幅增加了。

2. 规格速览表

项目GPT-5.5GPT-5.6 SolGPT-5.6 Terra
发布2026年4月23日2026年7月9日
定位单一旗舰(+Pro)最高端均衡(以四成单价提供 5.5 级质量)
API 价格$5 / $30$5 / $30$2 / $12
上下文1,050,0001,050,0001,050,000
最大输出128,000128,000128,000
知识截止2025年12月1日2026年2月16日(更新)
SWE-Bench Pro58.6%64.6%63.4%
推理效率基准OpenAI 称能以更少的 token 取得相同或更好的结果(未公布相对 GPT-5.5 的削减比例)
推理控制effort(none〜xhigh)effort(none〜max,新增 max)

* 价格与规格基于 OpenAI 的模型页面(GPT-5.5、GPT-5.6 Sol、GPT-5.6 Terra)。Sol 自 2026 年 8 月 21 日起 3 个月为促销价 $4/$20。SWE-Bench Pro 方面,GPT-5.5 的 58.6% 是 GPT-5.5 发布时(2026 年 4 月)OpenAI 公布的数值,Sol 的 64.6% 来自 OpenAI 随 GPT-5.6 公布的评测表(同一张表中 GPT-5.5 为 59.4%)。TerminalBench 方面,GPT-5.5 发布时的 82.7% 是 2.0 的数值;GPT-5.6 的评测表也在 2.1 上测了 GPT-5.5,为 85.6%,Sol 为 88.8%(参见第 4 章)。

3. Terra 的冲击——“5.5 级质量,四成单价”

本次更新中冲击最大的,与其说是最高端 Sol 的性能提升,不如说是中位 Terra 的性价比。OpenAI 将 Terra 定位为“以大约半价提供 GPT-5.5 级的质量”(OpenAI)。

THE TERRA EFFECT

同样的质量,账单降六成

输入单价
GPT-5.5: $5.00
Terra: $2.00
→ 降六成
输出单价
GPT-5.5: $30.00
Terra: $12.00
→ 降六成
再加上 token 效率
OpenAI 称用更少的 token 完成同样的工作
→ 未公布削减比例;若成立,实际成本再降一档

* OpenAI 称训练 GPT-5.6 是为了“让每个 token 产出更多有用的工作”,但没有公布相对 GPT-5.5 的削减比例。单价在发布时为半价,经 2026年7月30日的降价已降至 GPT-5.5 的四成。

Terra 可以说是为“用 GPT-5.5 已经足够,只想降低账单”的用户准备的模型。如果能在不降低质量的前提下把成本降低六成,那么它将成为许多现有工作负载的首选迁移目标。大多数不追求极致性能的实务,用 Terra 而非 Sol 就够了。

4. 基准测试——跨代提升了多少

观察跨代提升时需要注意的一点是,基准测试版本发生变化的项目无法简单比较。这里将“可在同一版本下比较的”和“无法比较的”分开呈现。

SWE-BENCH PRO(同一指标可比)

实际编码跨代 +6pt

GPT-5.6 Sol64.6%
GPT-5.558.6%

修复真实 GitHub 问题的能力。跨代提升约 6 个百分点(出处:OpenAI)

在同一指标 SWE-Bench Pro 上,从 GPT-5.5 的 58.6% 提升到 Sol(64.6%),约提高 6 个百分点。生产级实际编码的修复能力稳步增强。不过需注意,这两个数值出自 OpenAI 的不同发布:在随 GPT-5.6 公布的评测表中,GPT-5.5 为 59.4%(差距约 5 个百分点)。

⚠️ 比较时的注意事项

  • TerminalBench:GPT-5.5 发布时的 82.7% 是 2.0 的数值,GPT-5.6 Sol 的 88.8% 是 2.1 的数值,不能直接相减。在同样以 2.1 测量的 GPT-5.6 评测表中,GPT-5.5 为 85.6%(差距约 3 个百分点)。
  • GPQA、FrontierMath:列在 GPT-5.6 的评测表中。GPQA Diamond 上 GPT-5.5 为 93.6%,Sol 为 94.6%;FrontierMath Tier 1–3 为 85.3% 对 89%。已接近上限,提升幅度小。AIME、MMLU 未列出。

OpenAI 这次把代理类的新指标(Agents' Last Exam 53.6、Coding Agent Index 80 等)放在了前面。通用推理的 GPQA Diamond 仅差 1 个百分点、已接近上限,用旧有基准衡量“跨代变聪明了多少”很困难,这就是现实。

5. 5.6 新增的功能

  • 三款模型体系(Luna/Terra/Sol)——可按用途与成本选择。最大的变更点。
  • Programmatic Tool Calling——由模型生成 JavaScript 来编排工具调用的新功能(Responses API)。以更少的往返执行复杂代理。
  • 推理 effort 新增“max”——在 none/low/medium/high/xhigh 之上增加 max,共 6 档。
  • ChatGPT Work——面向业务的代理。Codex 应用已并入全新的 ChatGPT 桌面应用。
  • GPT-Live(全双工语音)——非回合制、可打断的自然语音对话。
  • 支持 GitHub Copilot——Sol/Terra/Luna 可在 Copilot 中选择。
  • 知识截止更新——2025年12月 → 2026年2月16日。

6. 实际成本——升级后账单如何变化

迁移到 Terra 对成本的影响很大。假设以每月输入 100M token、输出 20M token的工作负载来比较:

继续用 GPT-5.5
≈ $1,100 / 月

输入 100M×$5 + 输出 20M×$30

迁移到 GPT-5.6 Terra
≈ $440 / 月

输入 100M×$2 + 输出 20M×$12。若 token 效率提升,实际还可能更低

仅凭单价账单就约降六成。此外 OpenAI 称 GPT-5.6 能用更少的 token 完成工作,若如此,实际的削减幅度可能超过单价差(未公布削减比例)。对于质量用 GPT-5.5 级就够的工作负载,迁移到 Terra 几乎是纯粹的成本削减。

* 以上为基于单价的粗略估算。实际账单会随提示长度、缓存利用、输出量而变化。建议用自己有代表性的请求实测。

7. 是否该迁移——该换到哪款模型

你现在用 GPT-5.5 的方式推荐的迁移去向理由
质量已足够,想降低成本Terra以四成的单价提供 5.5 级质量。纯粹的成本削减
想以相同预算提升性能Sol同价 $5/$30,SWE-Bench Pro 等有所提升
大量处理、轻量任务,只求便宜Luna$0.20/$1.20 的新设最低价档位
此前使用 GPT-5.5 Pro($30/$180)Sol比 Pro 便宜得多,日常高强度推理往往已足够
代码修复质量最优先Sol+外部对比实际编码上,Claude 阵营也是候选

迁移本身只需切换模型 ID,API 大体兼容。对多数用户而言,最优解是“先降到 Terra 把账单降六成,只把需要性能的处理升到 Sol”的两段式做法。相比单一模型的 5.5 时代,成本与质量的调优变得更容易了。

总结

  • 最大的变化是三模型化:从 GPT-5.5 的单一旗舰,走向 Luna/Terra/Sol 的用途分工三款模型。
  • Terra 是主角:以四成的单价($2/$12)提供 GPT-5.5 级质量。是现有工作负载的实质后继。
  • Sol 同价提升性能:$5/$30 不变,SWE-Bench Pro 58.6→64.6%(OpenAI 公布值,+6pt)。
  • 效率也有改善:OpenAI 称能以更少的 token 取得相同或更好的结果(未公布相对 GPT-5.5 的削减比例)。
  • 注意点:TerminalBench 在不同发布中版本不同(同为 2.1 时 GPT-5.5 为 85.6%,Sol 为 88.8%)。GPQA 等通用推理的提升很小。
  • 迁移的最优解:先用 Terra 把账单降六成,只把需要性能的处理升到 Sol。

FAQ

Q1. 从 GPT-5.5 迁移的话,该选哪款模型?

取决于用途。想保持质量并降低成本就选 Terra(以四成单价提供 5.5 级质量),想以同价提升性能就选 Sol,想以大量处理换取极致便宜就选 Luna。大多数实务用 Terra 就足够,只把需要性能的处理升到 Sol 的两段式做法最优。

Q2. Terra 真的和 GPT-5.5 质量相当吗?

OpenAI 将其定位为“以约半价提供 GPT-5.5 级的质量”。在随 GPT-5.6 公布的评测表中,Terra 在 SWE-Bench Pro 上为 63.4%(GPT-5.5 为 59.4%)有所超出,但在 GPQA Diamond 等部分项目上为 92.9%(同 93.6%)略低。从定位上看,它是“用 5.5 已足够的用途的后继”。如有担忧,稳妥的做法是先用自己有代表性的任务实测比较 Terra 与 5.5 的输出,再决定迁移。

Q3. 跨代变聪明了多少?

在同一指标 SWE-Bench Pro 上从 58.6% 提升到 64.6%(Sol,均为 OpenAI 公布值),约提高 6 个百分点。TerminalBench 在不同发布中从 2.0 变为 2.1,但在同以 2.1 测量的表中,GPT-5.5 为 85.6%,Sol 为 88.8%。GPQA Diamond 从 93.6% 到 94.6%,已接近上限,提升较小。“明确提升的是实际编码和代理类工作,通用推理接近持平”,这就是现实。

Q4. 实际成本能降多少?

迁移到 Terra 后单价约为 GPT-5.5 的四成。若每月输入 100M、输出 20M,粗略估算为 $1,100→$440(2026年7月30日降价后)。OpenAI 还称 GPT-5.6 能用更少的 token 完成工作,若如此,实际削减幅度可能超过单价差(未公布削减比例)。

Q5. 我之前用的是 GPT-5.5 Pro,后继是哪款?

多数用途用 Sol($5/$30,自2026年8月21日起为期3个月的促销价为 $4/$20)就足够。GPT-5.5 Pro 为 $30/$180 的高价,而 Sol 便宜得多,也能胜任高强度推理。是否只在超高难度推理时才需要 Pro 级,建议用实际任务来判断。

Q6. 现有的 GPT-5.5 应用能直接运行吗?

API 大体兼容,切换模型 ID 即可迁移。不过既然变成了三款模型,重新设计把哪些处理分配给 Luna/Terra/Sol能优化成本与质量。多数情况下以 Terra 为起点很有效。

Q7. GPT-5.6 与其他厂商模型(Claude)有何不同?

在实际编码(SWE-Bench Pro)上,Claude 阵营往往更强(在 OpenAI 的评测表中,Claude Fable 5 为 80%,Sol 为 64.6%)。详情请参见GPT-5.6 Sol vs Claude Opus 4.8或vs Claude Fable 5的比较。

相关文章