2026 年 7 月 24 日,Anthropic 发布了 Claude Opus 5。距离 Opus 4.8 只隔了大约两个月,版本号却从 4.8 直接跨了一整代到 5。Anthropic 自家文档的措辞是:相对 Opus 4.8,这是一次台阶式的跃升,而不是渐进式的小改

先说结论。价格没有变动(每百万 token 输入 $5 / 输出 $25),但在智能体类基准上,它追平甚至超过了旗舰 Claude Fable 5——后者的价格是 $10 / $50,也就是说 Opus 5 用一半的钱干了同样的活。另一方面,API 带来了两处破坏性变更,原封不动搬过去的代码可能撞上 400 报错或输出被截断。本文交叉核对了官方公告、官方文档与多家媒体报道,从实战角度梳理性能、价格与迁移中的坑

CLAUDE OPUS 5 — 2026.07.24

价格不变,实力明显上台阶

—— Anthropic 自己的说法:用 Fable 5 一半的价格,交付前沿级性能

MODEL ID
claude-opus-5
没有日期后缀
价格(每百万 token)
$5 / $25
与 Opus 4.8 相同,是 Fable 5 的一半
上下文 / 输出
1M / 128K
1M 既是默认值也是上限
注意事项
2 处破坏性变更
思考默认开启,关闭思考受限制
来源:Anthropic 官方公告与 Claude Platform 文档(2026 年 7 月 24 日)

1. 三句话看懂 Opus 5

1. 性能

在智能体编码、计算机操作和长时间任务上大幅提升。在智能体终端基准 Frontier-Bench v0.1 上,Anthropic 称其得分超过 Opus 4.8 的两倍,而单任务成本更低。

2. 价格

没有涨价。每百万 token 输入 $5 / 输出 $25,与 Opus 4.8 完全一致——也正好是旗舰 Fable 5($10 / $50)的一半

3. 迁移风险

思考现在默认开启,而且只有在 effort 为 high 及以下时才能关闭。凡是把 max_tokens 卡得很紧的调用,都可能在答到一半时被截断。

一句话概括:Opus 5 用 Opus 4.8 的价格,干了接近 Fable 5 的活。反过来说也成立——当你需要压榨最强能力时,Fable 5 和 Mythos 5 依然有它们的位置(见下文的短板部分)。

2. 核心规格与可用渠道

先看数字。以下是 Anthropic 官方模型列表给出的主要规格。

项目 Claude Opus 5 Claude Opus 4.8(上一代) Claude Fable 5(旗舰)
API 模型 ID claude-opus-5 claude-opus-4-8 claude-fable-5
价格(输入 / 输出) $5 / $25 $5 / $25 $10 / $50
上下文窗口 100 万 token(默认值即上限) 100 万 token 100 万 token
最大输出 128K token 128K token 128K token
可靠知识截止 2026 年 5 月 2026 年 1 月 2026 年 1 月
思考(thinking) 默认开启 默认关闭(需显式启用) 始终开启(无法关闭)
effort 档位 low / medium / high / xhigh / max low / medium / high / xhigh / max low / medium / high / xhigh / max

来源:Anthropic《Models overview》《What's new in Claude Opus 5》(2026 年 7 月时点)

这张表里最容易被一扫而过、但日常使用中感受最明显的,是知识截止时间往前推了。Opus 4.8 与 Fable 5 停在 2026 年 1 月,Opus 5 则到了 2026 年 5 月。这意味着多出好几个月的库版本与近期规格变更,它可以直接凭知识回答。即便如此,它依然不知道「今天」发生了什么——涉及时事或最新价格变动时,务必让它先联网检索,不要放任它断言。

可以在哪里用

API 与云平台

Claude API(claude-opus-5)、Amazon Bedrock(anthropic.claude-opus-5)、Google Cloud、Microsoft Foundry。Opus 4.8 继续保留可用。

应用与开发工具

claude.ai、Claude Code 与 Claude Cowork。它是 Max 套餐的默认模型,也是 Pro 套餐可选的最高级模型

高速模式的限制

高速版本目前是研究预览,仅限 Claude API。Bedrock、Google Cloud、Microsoft Foundry 上暂不提供。

3. 价格:不涨价,只有 Fable 5 的一半

这次发布最实用的一条事实,就是能力上去了,价格纹丝不动。Anthropic 的文档写得很直白:每百万输入 token $5、每百万输出 token $25,与 Claude Opus 4.8 保持不变。

每百万 token 价格(Claude API)

Claude Opus 5
$5 输入 / $25 输出
缓存写入 $6.25(5 分钟)/ $10(1 小时),缓存读取 $0.50
Claude Fable 5
$10 输入 / $50 输出
旗舰型号,正好是 Opus 5 的两倍
Opus 5 高速模式
$10 输入 / $50 输出
约 2.5 倍速度,2 倍价格。仅限 API

来源:Anthropic《What's new in Claude Opus 5》与《Pricing》(2026 年 7 月)。缓存费率按官方倍率换算(写入 1.25 倍与 2 倍,读取 0.1 倍)

真正需要记进脑子里的一点是:单价与单任务成本是两码事。在 Opus 5 的宣传材料里,Anthropic 首先摆出的是单任务成本的图表,而不是单价。比如在计算机操作基准 OSWorld 2.0 上,官方公告称它以约三分之一的成本超过了 Fable 5 的最佳成绩。单价砍半,再加上少走冤枉路,两者叠加后现实中的差距会拉得更开。

唯一的注意点:由于思考现在默认开启,同一个提示词可能产生更多输出 token、花更多钱。如果你原本在 Opus 4.8 上关着思考、跑得很便宜,只是把模型 ID 一换,账单是会涨的。迁移之后请实测 usage

4. 基准测试详解

Anthropic 的公告是以图表为主、而非数字表格组织的,页面正文里明说的多为相对表述:「超过两倍」「差距在 0.5% 以内」。因此本文把Anthropic 在正文中明确写出的比较多家媒体口径一致的数值分开呈现。

4-1. Anthropic 明确写出的比较

Frontier-Bench v0.1

考察智能体的终端操作与编码。它胜过所有参测模型,成绩超过 Opus 4.8 的两倍,且单任务成本更低。

CursorBench 3.2

在 max effort 下,与 Fable 5 的最佳成绩相差 0.5% 以内,而成本约为其一半。

ARC-AGI 3

衡量真正陌生问题的求解能力,它的得分是第二名的三倍

OSWorld 2.0

计算机操作。在各个价位段都领先竞品,并以约三分之一的成本超过 Fable 5 的最佳成绩

Zapier AutomationBench

在同等成本下,通过率约为第二名的 1.5 倍。Anthropic 称即便是它最低的 effort 档,也高于竞品模型的最好成绩。

生命科学

在 Anthropic 跟踪的所有评测上都优于 Opus 4.8,其中有机化学提升超过 10 分(例如从波谱数据推断分子结构)。

4-2. 媒体报道中的数值

下面的数字来自 the decoder(2026 年 7 月 24 日)与 tech-ish(同日),两家都是从 Anthropic 的图表上读取的。此处只列出两家口径一致的条目。请注意,这些数字并未以数值形式写在官方页面的正文里(标黄点者表示「媒体来源」)。

基准测试 Opus 5 Fable 5 GPT-5.6 Sol Opus 4.8
Frontier-Bench v0.1
智能体终端作业
43.3% 33.7% 34.4% 约 21%🟡
ARC-AGI-3
陌生问题求解
30.2% 7.8% 1.5%
GDPval-AA v2(Elo)
真实知识型工作
1,861 1,747 1,736 1,593
OSWorld 2.0
计算机操作智能体
70.6% 66.1%
DeepSWE v1.1
智能体编码
68.8% 69.7% 72.7%

规律相当清楚:模型需要独自工作的时间越长,差距就越大——终端作业、计算机操作、业务自动化、陌生问题都是如此。反过来,在单次补丁式的编码(DeepSWE)上,它输给了 GPT-5.6 Sol。我们在 GPT-5.6 Sol 对比文章里勾勒过的格局,在更高一档上又重演了一遍。

5. 它仍然会输的地方

发布类文章往往只罗列优点,这里我们刻意反过来写。以下是 Anthropic 自己在公告中承认的短板,加上媒体点出的数字。

攻击性网络安全

发现漏洞方面已经缩小了与 Mythos 5 的差距,但 Anthropic 明确写道,它在编写利用代码方面仍远远落后。专门的防御向模型依然是 Mythos 系列

长周期自主生物学研究

生命科学整体都有提升,但文档指出,它在长时间自主运行的生物学研究任务上仍不及 Mythos 5

一次成型的编码🟡

在 DeepSWE v1.1 上它得 68.8%,落后于 GPT-5.6 Sol 的 72.7%。Humanity's Last Exam 也基本打平,56.3% 对 Fable 5 的 56.5%(媒体来源)。

max effort 未必最好🟡

the decoder 指出,在 Frontier-Bench 与 Coding Agent Index 上,max effort 的得分低于更低的档位。多花钱不等于多收获。

落到实处的含义:无脑把 effort 拉到 max,可能账单变高、分数反而变低。文档本身也建议从 highxhigh 起步,在自己的评测集上一路往下试到 medium。请把 effort 当成需要调优的旋钮,而不是设一次就不管的常量。

6. 两处破坏性变更(思考默认开启、effort 限制)

如果你直接调用 API,这一节是唯一不能跳过的。Anthropic 列为「行为变更」的两项,会让原封不动搬过去的代码出问题。

变更 1:思考默认开启

在 Opus 4.8 上,不写 thinking 就意味着不带思考运行。而在 Opus 5 上,不写它就等于开启思考——效果与写 thinking: {"type": "adaptive"} 完全相同。

# 在 Opus 4.8 上不带思考运行的同一段代码……
client.messages.create(
    model="claude-opus-5",
    max_tokens=1024,          # 现在这个上限同时约束思考和回答
    messages=[...],
)
# 在 Opus 5 上它会先思考,于是回答可能被截断

max_tokens 限制的是思考 token 与回答正文的总和。凡是照着预期回答长度把 max_tokens 卡得很紧的调用,预算都会被思考吃掉,进而被截断。迁移时你必须二选一:要么显式关闭思考,要么给 max_tokens 留出余量。

变更 2:只有 effort 在 high 及以下时才能关闭思考

而且「关掉它」这个选项现在也带了限制。把 thinking: {"type": "disabled"} 与 effort xhighmax 组合使用会返回 400 错误。由于校验是按请求进行的,那些运行中途才提高 effort 的代码会以最糟糕的方式失败:一开始好好的,突然就开始报错。

✅ 允许

关闭思考 + effort low/medium/high

❌ 400 错误

关闭思考 + effort xhigh/max

🔧 推荐做法

保持思考开启,靠调低 effort 来控制成本

Anthropic 还进一步记录了真的关闭思考运行时会出什么问题。在思考被禁用的情况下,Opus 5 有时会把工具调用当成正文写出来——也就是工具根本没执行,但这一轮看起来却是成功的——还可能把内部 XML 标签泄漏到输出里。如果你在构建智能体,保持思考开启、把 effort 调低才是更稳妥的路线

7. 五档 effort 该怎么选

Opus 5 支持全部五档 low / medium / high / xhigh / max,而且 API 与 Claude Code 的默认值都是 high。关于 Claude Code 一侧的设置,可参考我们的effort 设置指南

effort 适合的场景 备注
low / medium 常规处理、分类、执行型子智能体、对延迟敏感的链路 Anthropic 强调「Opus 5 即便在 low effort 下也依然强劲」正是指这一档。值得先试试
high(默认) 需要真正智力的一般性工作 拿不准时的安全选择,是质量与成本的平衡点
xhigh 编码与智能体类负载的推荐起点 max_tokens 留足空间(从 64K token 左右起步)
max 正确性比账单更重要的高难度问题 推理最深,但结果未必最好(见第 5 节)

8. 其他新功能

对话中途变更工具(beta)

过去在对话中途改动工具列表,会让整个提示词缓存失效。Opus 5 允许在保留缓存的前提下增删工具(beta 请求头 mid-conversation-tool-changes-2026-07-01)。这对长时间运行的智能体的成本影响很大。

可缓存提示词的最小长度减半

可缓存提示词的最小长度从 1,024 token 降到 512 token。在 Opus 4.8 上因为太短而无法缓存的提示词,不改一行代码就变得可缓存。

「default」回退模式

当请求被安全过滤拦下时,你不必再自己列出备选模型,而可以直接套用 Anthropic 推荐的自动路由(beta 请求头 server-side-fallback-2026-07-01)。

高速模式

研究预览版,以 2 倍价格换取约 2.5 倍的输出速度。仅限 Claude API——Bedrock、Google Cloud、Microsoft Foundry 上不提供。

9. 性格变了,提示词要跟着改

这一点你多半会比任何基准分数更早察觉。文档列出了四项一行代码都不用改就能感受到的行为变化。

变化 应对方式
回复和产出物变长
面向用户的回答、它写出的 Markdown 文件
明确要求简洁。调低 effort 并不会让文字变短,只能靠提示词
它更爱汇报自己在干什么 删掉「每 N 步汇报一次进度」这类旧脚手架。如果还是啰嗦,就告诉它工具调用之间默认保持安静
它会主动把任务分给子智能体
Opus 4.8 曾经很不情愿
移除你为 4.8 写的「多分派一些」类提示。明确设定并发上限,免得成本失控
它会不用催就自我检查 「最后加一步验证」「让子智能体来验证」现在会导致过度验证——请删掉(Anthropic 明确这样写)

迁移是做减法,不是做加法。你当初为了弥补旧模型短板而加进提示词的内容——催它验证、催它分派、强制汇报进度——到了 Opus 5 上统统变成副作用。先把这些删干净,观察原生行为,再把真正缺的那部分补回去。

10. 谁应该立刻迁移

立刻迁移
  • 你在跑长时间运行的编码智能体
  • 你在做计算机操作或业务自动化类智能体
  • 你在用 Fable 5 但成本吃不消(性能接近,价格减半)
  • 你还停在 Opus 4.8(同价位下明显更强)
先测试再迁移
  • 关着思考、max_tokens 又设得很低的低成本常规任务
  • 依赖输出长度或风格的下游环节
  • 塞满了验证与分派指令的提示词
不必着急
  • 以单次补丁生成为主(收益有限,有时反而更差)
  • 你依赖 Bedrock 等平台上的高速模式
  • 攻击性安全测试或长周期生物学研究(Mythos 领先)

迁移步骤(面向 API 用户)

  1. 把模型 ID 从 claude-opus-4-8 改成 claude-opus-5
  2. 找出所有关闭思考的地方(thinking: disabled);在 effort 为 xhigh 或 max 时这已经是 400 错误,所以要么调低 effort,要么把思考重新打开
  3. 凡是没有显式设置 thinking 的地方,都重新审视 max_tokens(为思考 token 留出余量)
  4. 从提示词里删掉催验证、催分派、强制汇报进度这三类内容
  5. 加上要求简洁的指令,然后实测 usage,重新建立成本基线
  6. medium / high / xhigh 之间扫一遍 effort,在自己的评测集上找到最佳点

总结

Claude Opus 5 属于用户可以纯粹高兴一场的那类发布:价格不变,实力明显上台阶。差距拉得最开的是长时间自主工作的智能体场景,而 Anthropic 也正是用单任务成本来讲这个故事——用 Fable 5 一半的价格交付前沿级性能。

与此同时,API 有两处不能忽视的变更(思考默认开启;只有 effort 在 high 及以下时才能关闭思考)。而迁移做得好不好,关键在于你是在删提示词,而不是在加提示词。当年为了给旧模型打补丁而写下的指令,恰恰是让 Opus 5 变啰嗦、变过度谨慎的元凶。

最后请记住,基准分数永远只是在那一项任务上测出来的数值。Opus 5 在 DeepSWE 上输给 GPT-5.6 Sol,也存在 max effort 并非最佳设置的领域。请在你自己的业务负载上再测一遍——归根结底,只有那个数字才能给出答案。

常见问题

Q. Opus 5 比 Opus 4.8 更贵吗?

A. token 单价完全相同(每百万 token 输入 $5 / 输出 $25)。但由于思考默认开启,输出 token 可能增加,所以实际账单有可能上涨。迁移后请实测 usage

Q. 该用 Fable 5 还是 Opus 5?

A. 论性价比选 Opus 5——单价减半,而且在多项智能体基准上领先。论最高难度的推理与长周期研究,Fable 5 仍然更强。我们在 Fable 5 与 Opus 的选型指南里给出的框架可以直接套用。

Q. 免费套餐能用吗?

A. Opus 5 是 Max 套餐的默认模型,也是 Pro 套餐可选的最高级模型。套餐结构会调整,最新的可用范围请查阅 Anthropic 的价格页面

Q. 迁移之后开始报 400 错误。

A. 先检查你是不是把 thinking: {"type": "disabled"} 和 effort xhighmax 一起发出去了。Opus 5 会拒绝这个组合。把 effort 降到 high 及以下,或者干脆删掉 thinking 参数(回到默认的开启状态)。

Q. 回答太长,调低 effort 能变短吗?

A. 不能。effort 主要控制思考的深度,并不能稳定地压缩面向用户的输出。正确的做法是在提示词里明确要求简洁

附注:本文中的数字出自 Anthropic 公告《Introducing Claude Opus 5》、官方文档《What's new in Claude Opus 5》《Models overview》,以及 the decodertech-ish 的报道(均为 2026 年 7 月 24 日)。标有 🟡 的数值并未以数字形式写在官方正文中,而是记者从图表上读取的,确定性相对较低。规格与价格可能变动,作出关键决策前请以官方文档为准。