2026年9月25日补充:本文比较的是截至2026年7月的 Claude Fable 5 与 GPT-5.6 Sol。此后,Anthropic 于7月24日发布了 Claude Opus 5、9月1日发布了 Fable 5 的后继 Claude Fable 5.1,OpenAI 于9月3日发布了 GPT-6 Astra。费用方面请参阅实测比较 Astra(low)与 Sol(high)的文章。随后在9月22日,Anthropic 发布了 Claude Opus 5.5,OpenAI(美国时间)发布了作为 GPT-5.6 Sol 下一代的 GPT-6 Sol 和 GPT-6 Luna。Anthropic 目前建议:不确定选哪个模型时,大多数用途先从 Opus 5.5 开始。Fable 5 仍作为旧版(Legacy)模型在 API 中继续提供,GPT-5.6 Sol 在过渡期内也仍可使用。正文中的“最高端”“旗舰”“居首”等说法和基准数值均为撰写时的情况。9月22日我们还依据一手资料更正了基准数值。Fable 5 的 TerminalBench 2.1“86.0%”在两家公司的表中都不存在,因此改为同时列出两款模型的 OpenAI 表中的数值(83.1%);与 Sol 对比 SWE-Bench Pro 的地方,也改用同一张表中的80.0%。此外,“最长12小时的连续自主”并非 Anthropic 的说法,而是一位用户的报告,因此改为 Anthropic 本身的表述。
目录
OpenAI 当时的最高端 GPT-5.6“Sol”(2026年7月9日正式发布)与 Anthropic 发布时定位为“面向公众发布的史上最强”的 Claude Fable 5(6月9日发布)。与与 Opus 4.8 的对比那种“同价位段的正面对决”不同,这一次的主题是“半价全能型 Sol”对“贵一倍但为顶级的 Fable 5”,即成本与实力之间的权衡。
先说结论——在生产级实战编码与长时间自主上,Fable 5 明显更胜一筹;在价格与智能体综合实力的广度上,Sol 更强。SWE-bench Pro 的差距比对阵 Opus 4.8 时拉得更开。本文将基于两家的官方发布与独立基准测试,梳理如何区分使用这两个非对称的强者。
半价全能 vs 顶级工匠
— 价格相差两倍,但 SWE-bench Pro 的差距更大
Fable 5: 在实战代码修复·长时间自主上最强的“跑完全程的能力”
Sol: 终端操作·广度·半价的“性价比与综合实力”
1. 两款模型的定位——“半价全能” vs “顶级工匠”
Claude Fable 5——全力押注“长跑的完赛能力”
Fable 5 是 Anthropic 将其内部最强级的 frontier 模型“Mythos”级能力,以普通用户和开发者可用的形式开放出来的模型(内核与 Mythos 5 相同,仅安全机制不同)。它的宣传语是“为长时间、复杂的工作而打造”。在衡量真实 GitHub 仓库修复的 SWE-Bench Pro 上取得 80.0%,大幅甩开 Opus 4.8(69.2%)和上一代 GPT-5.5(58.6%)(据 Anthropic 的系统卡;发布表格中的 80.3% 位于与 Mythos 5 共用的一栏,是较高的 Mythos 5 的分数)。它能在数百万 token 中保持专注,自主工作的时间比以往任何 Claude 都长,还有 Stripe 在一天内完成5000万行 Ruby 代码迁移的实例(来源:Anthropic 官方发布)。
GPT-5.6 Sol——“半价的全能型”
Sol 是 GPT-5.6(Luna/Terra/Sol)中的最高端。在自主操作终端的 TerminalBench 2.1 上取得 88.8%,在长时间实战的 Agents' Last Exam 上取得 53.6,在智能体综合实力上位居首位,并且编码时的token 效率提升了54%。而最重要的是,Sol 约为 Fable 5 的一半价格($5/$30 对 $10/$50),这是它最大的武器。它处于“并非最强,但以性价比取胜”的定位(来源:OpenAI 官方发布·Vellum·Artificial Analysis)。
2. 规格速览表
| 项目 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|
| 提供方 | Anthropic(发布时的最高端·面向公众发布的模型) | OpenAI(GPT-5.6 的最高端) |
| 发布日期 | 2026年6月9日 | 2026年7月9日(正式发布) |
| 模型 ID | claude-fable-5 | gpt-5.6-sol |
| 上下文长度 | 1,000,000 tokens | 1,050,000 tokens |
| 最大输出 token | 128,000 tokens | 128,000 tokens |
| 知识截止 | 2026年上半年(分阶段公布) | 2026年2月16日 |
| API 价格 | $10 / $50 per MTok | $5 / $30 per MTok(约为 Fable 的一半。自2026年8月21日起为期3个月的促销价为 $4 / $20) |
| 推理 | 常时开启(自适应思考,不返回原始思考过程) | reasoning effort(none〜max 共6档) |
| 强项核心 | SWE-Bench Pro 80.0%(Anthropic 公布值)、历代 Claude 中最长的自主、长跑的完赛能力 | 终端操作·智能体综合实力·token 效率·半价 |
| 安全设计 | 三分类器,仅在检测到风险时回退至 Opus 4.8(触发率不足会话的5%) | 标榜“最强安全模型”·强化 safety 栈 |
| 提供渠道 | Claude.ai、API、GitHub Copilot 等 | ChatGPT、ChatGPT Work、Codex、OpenAI API |
* 价格·规格基于各家官方发布(Fable 5=2026年6月9日,GPT-5.6=2026年7月9日)。基准测试在两家的测量条件、时间、harness 各不相同,并非同一标准下的严格对比。两款模型并列比较的数值(SWE-Bench Pro 80.0% 对 64.6%、TerminalBench 2.1 83.1% 对 88.8%、Agents' Last Exam 40.5 对 53.6、Coding Agent Index 77.2 对 80)出自同时列出两者的 OpenAI GPT-5.6 发布中的评测表(Sol 的 Agents' Last Exam 53.6 为发布正文中的数值,同一页面的表中为52.7%;Coding Agent Index 为 Artificial Analysis 的指标)。在 Anthropic 自己发布的表中,Fable 5 的 SWE-Bench Pro 为80.3%、TerminalBench 2.1 为88.0%,但两者都位于与 Mythos 5 共用的一栏,是两者中较高的分数(系统卡中 Fable 5 单独为80.0%和84.3%);TerminalBench 2.1 还附有 Anthropic 的注释:由于安全机制会把请求转给其他模型,Fable 5 的成绩更接近 Opus 4.8(同一张表中为82.7%)。86.0% 这个数值在两张表中都不存在。
3. 基准测试详细对比
既不是“Fable 5 全胜”,也不是“Sol 全胜”。而是按编码的类型清晰地分出胜负。
实战代码修复看 Fable,终端·广度看 Sol
出处:OpenAI GPT-5.6 发布中的评测表(Sol 的 Agents' Last Exam 取自发布正文,Coding Agent Index 为 Artificial Analysis)
关键在于 “基准测试所衡量的东西” 的差异。SWE-bench Pro 衡量的是真实 GitHub issue 的补丁生成=对既有代码库的修复能力,在这里 Fable 5 以80.0%把 Sol 的64.6%甩开15个百分点以上。另一方面,TerminalBench 2.1 考察的是命令行的自主操作,Sol 以88.8%超过 Fable 5 的83.1%。此外在智能体综合的 Agents' Last Exam 与 Coding Agent Index 上 Sol 占优。呈现出“把实战代码彻底修好的深度=Fable,终端操作与智能体的广度=Sol”这种清晰的分工。
4. “未公开基准问题”——被隐去的指标与受质疑的 SWE-bench Pro
在这次对比中同样需要注意的是,OpenAI 的评测表里缺少部分指标。发布后不久,独立分析(Vellum)指出 OpenAI 没有公布 SWE-bench Verified、GPQA Diamond、AIME、MMLU、ARC-AGI-2、FrontierMath。不过,2026年9月22日查阅的 OpenAI 发布页面评测表中列有 GPQA Diamond(Sol 94.6%、Fable 5 92.6%)和 FrontierMath(Tier 1–3:Sol 89%、Fable 5 87%;Tier 4:Sol 83%、Fable 5 87.8%)。表中没有的是 SWE-bench Verified、AIME、MMLU,而 Sol 的 ARC-AGI-2 数值(92.5%)直到9月3日 GPT-6 Astra 发布的表中才首次出现。本文的 SWE-bench Pro“64.6%”同样来自 OpenAI 随 GPT-5.6 公布的评测表。不过 OpenAI 同时发布了一份分析,认为 SWE-bench Pro 约30%的任务存在缺陷(Simon Willison 指出了这一点)。
OpenAI 对最贴近实战的编码指标提出质疑
* 若重视生产级实战编码,在两家的表中 SWE-bench Pro 都在80%左右的 Fable 5 是有力之选。不要仅凭华丽的智能体数字来判断。
5. 长时间自主——Fable 5 的看家本领
Fable 5 的真正价值与其说在基准分数,不如说在“长跑的完赛能力”。Anthropic 解释称,它能在数百万 token 中保持专注,自主工作的时间比以往任何 Claude 都长(并未给出以小时计的上限)。它举出的实例是 Stripe 在一天内完成了5000万行 Ruby 代码迁移(若靠人工相当于两个多月的工作量)。发布后不久,还有用户在 Ten Past Tomorrow 博客中报告,模型仅凭一条指令就独自运行了12小时以上。在长时间分析基准 Hex 上,还报告了史上首次突破90%的成绩。
在数百万 token 中保持专注,自主完成长时间的编码与调查(Anthropic 的说法)。
把人工需两个多月的 Ruby 迁移在一天内完成的实例。
在 OpenAI 的表中大幅甩开 Opus 4.8(69.2%)和 Sol(64.6%)(Anthropic 的系统卡中也为80.0%)。
Sol 在长时间实战的 Agents' Last Exam 上也位居首位(53.6),但这是衡量“广泛业务工作流”的基准。在把单一巨型代码库从头到尾彻底修好的“深度完赛能力”上,Fable 5 更占优势——这就是两者在质上的差异。大规模迁移、长时间调查、自主编码智能体的主力,Fable 5 更为合适。
6. 实际成本——如何看待两倍的单价
单价为 Fable 5 是 $10/$50,Sol 是 $5/$30。输入贵一倍,输出贵1.67倍,Fable 5 大约是 Sol 的两倍贵(Sol 自2026年8月21日起为期3个月的促销价 $4/$20 期间约为2.5倍)。这正是选择的分水岭。
- Sol 的成本优势:单价仅为一半,加之编码时token 效率提升54%。同样的作业消耗的 token 也更少,因此在“跑量”的用途上,总成本大幅低于 Fable 5。
- Fable 5 的价值:单价虽高,但一次就能正确彻底修好的成功率(SWE-bench Pro 在两家的表中都约为80%)更高。若把返工、审查、人工回退的成本都算进去,在难任务上有时会是“贵但结果反而便宜”。若能一天迁移5000万行,换算成人力成本可谓极其划算。
也就是说,应该以“每完成一项任务的成本”而非“token 单价”来看待。日常的量产任务·终端操作用 Sol(若更看重成本还有 GPT-5.6 Terra 或 Luna),失败代价高昂的大规模·长时间任务用 Fable 5——这样的分工,从成本最优的角度看也合情合理。
* 由于两家均未公布同一条件下的输出 token 对比,因此无法断定具体的“实际成本倍率”。建议用自己有代表性的任务实测成功率与输出 token,并把返工成本一并纳入比较。
7. 强项·弱项地图
顶级的完赛能力 vs 半价的综合实力
- ·SWE-Bench Pro 约80%(两张表),实战编码最强级
- ·历代 Claude 中最长的自主·完赛能力
- ·大规模迁移的实绩(Stripe 5000万行/1天)
- ·即便在 OpenAI 的表中,FrontierMath Tier 4 也高于 Sol(87.8% 对 83%)
- ·三分类器的新安全设计(仅抑制危险领域)
- ·单价高($10/$50=约为 Sol 的两倍;Sol 促销期内约为2.5倍)
- ·终端操作·智能体综合的广度不及 Sol
- ·对轻量量产任务而言规格过剩
- ·不返回原始思考过程
- ·TerminalBench 88.8%·终端操作居首位
- ·Agents' Last Exam·Coding Agent Index 居首位
- ·单价半价+token 效率+54%,性价比最强
- ·Luna/Terra/Sol 三款模型按用途优化
- ·ChatGPT Work / Codex / GPT-Live 联动
- ·SWE-bench Pro 大差落后15pt以上
- ·AIME、MMLU 等不在评测表中
- ·单一巨型代码的“深度完赛能力”不及 Fable
- ·长时间自主的实绩展示 Fable 更胜一筹
8. 按使用场景的选择方法
| 使用场景 | 推荐模型 | 理由 |
|---|---|---|
| 大规模代码迁移·遗留系统翻新 | Fable 5 | 长时间自主+Stripe 5000万行/1天的完赛能力 |
| 真实仓库的难 bug 修复·大型 PR | Fable 5 | SWE-Bench Pro 约80%(两张表),成功率高 |
| 长时间的自主调查·分析智能体 | Fable 5 | 专注数百万 token·针对完赛能力优化 |
| 失败返工代价高昂的重要任务 | Fable 5 | 一次就正确彻底修好的把握高 |
| 自主操作 CLI·终端的智能体 | Sol | TerminalBench 2.1 88.8% 居首位 |
| 广泛的业务工作流自动化 | Sol | Agents' Last Exam 53.6 居首位 |
| 注重成本的量产任务 | Sol | 半价+token 效率+54%。轻量作业也可用 Terra/Luna |
| 含 ChatGPT/Codex/语音的一体化运营 | Sol | 与 ChatGPT Work·GPT-Live·Codex 融为一体 |
总结
- Claude Fable 5: 在实战代码修复(SWE-Bench Pro 约80%)与长时间自主上属最强级。大规模迁移·难任务的“完赛能力”是其看家本领。不过单价约为 Sol 的两倍。
- GPT-5.6 Sol: 在终端操作(TerminalBench 88.8%)·智能体综合实力上居首位,凭半价+token 效率+54%性价比最强。三款模型便于按用途优化。
- SWE-bench Pro 的差距比对阵 Opus 4.8 时更大(OpenAI 的表中 80.0 vs 64.6·超15pt)。但需注意,OpenAI 也发布了分析,认为 SWE-bench Pro 约30%的任务存在缺陷。
- 成本应以“每完成一项任务”而非“token 单价”来看。量产·终端用 Sol,失败代价高昂的大规模·长时间任务用 Fable 5。
- 现实的解法是双模型并用。日常用 Sol(或 Terra),关键时刻的大任务用 Fable 5,如此区分使用最为理想。
FAQ
Q1. GPT-5.6 Sol 与 Claude Fable 5,编码哪个更强?
取决于指标。衡量真实仓库 bug 修复的 SWE-Bench Pro 上 Fable 5 以80.0%超过 Sol 的64.6%15pt以上。另一方面,终端自主操作的 TerminalBench 2.1 上 Sol 以88.8%超过 Fable 5 的83.1%(均为 OpenAI 评测表中的数值;Anthropic 的系统卡中 Fable 5 的 SWE-Bench Pro 也为80.0%)。“要把实战代码彻底修好选 Fable,要终端操作·智能体的广度选 Sol”是实用的分工。
Q2. 值得为两倍的价差付费吗?
视任务而定。日常的量产·终端操作用半价的 Sol(更轻量的作业还有 Terra/Luna)就足够。但在大规模迁移或难 bug 修复等“失败返工代价高昂的任务”上,成功率高的 Fable 5 结果反而更便宜的情况是存在的。请以“每完成一项任务的成本”而非 token 单价来判断。
Q3. Sol 的 SWE-bench Pro“64.6%”是官方数值吗?
是的,这是 OpenAI 随 GPT-5.6 公布的评测表中的数值。不过 OpenAI 同时发布了一份分析,认为 SWE-bench Pro 约30%的任务存在缺陷,对该指标本身提出了质疑。发布后不久被 Vellum 指为未公布的 GPQA Diamond 与 FrontierMath,在2026年9月22日查阅的评测表中其实都有列出(GPQA:Sol 94.6%、Fable 5 92.6%)。表中没有的是 SWE-bench Verified、AIME、MMLU。
Q4. 长时间的自主任务哪个更合适?
Fable 5。它能在数百万 token 中保持专注,按 Anthropic 的说法,自主工作的时间比以往任何 Claude 都长,并有 Stripe 在一天内完成5000万行 Ruby 迁移的实绩。把单一巨型代码库从头到尾彻底修好的“完赛能力”是 Fable 5 的看家本领。
Q5. Fable 5 与 Mythos 5 有什么区别?
内核(能力)相同,仅安全机制不同。面向公众发布的是 Fable 5,Fable 5 具备仅在检测到风险时才回退至 Opus 4.8 的三分类器安全设计(触发率不足会话的5%,超过95%为自主运行)。
Q6. GPT-5.6 的“Terra”与这次对比有何关联?
GPT-5.6 有 Luna/Terra/Sol 三款模型。本文作为撰写时的旗舰对旗舰而选取了 Sol,但若注重成本,Terra($2/$12)以 Sol 四成的单价提供相当于 GPT-5.5 的能力(2026年7月30日降价后)。“用 Fable 5 做难任务、用 Terra 跑量”的组合在实战中也颇具优势。详情请参见GPT-5.6 发布完全解读。
Q7. Opus 4.8 与 Fable 5、Sol 相比该选哪个?
按用途和预算来选。Opus 4.8($5/$25)与 Sol 同价位段,SWE-bench Pro 69.2%,是性价比不错的编码模型。Fable 5($10/$50)为当时的最高端,80.0% 的完赛能力属另一个级别但价格昂贵。日常用 Opus 4.8/Sol,关键时刻用 Fable 5,这种三段式活用较为现实。也请参见Sol vs Opus 4.8 的对比。
相关文章
- GPT-5.6 Sol vs Claude Opus 4.8 深度对比 — 同价位段的正面对决
- Claude Fable 5 发布深度解读 — 发布时最高端模型的详情
- GPT-5.6 发布完全解读 — Luna/Terra/Sol 三款模型
- Claude Opus 4.8 发布完全解读 — 性价比段的实战模型
- AI 能削减多少开发工时?智能体时代的真实数据 — 智能体时代关于 AI 削减开发工时的真实数据