2026 年 9 月 26 日更新:标题和开头图表中的“压缩到未优化成本的 20-30%”“缓存可省 60 至 90%”“每月 $30K 降至 $6-9K”“十项任务里有八项用更便宜的模型也够”等数字,因为无法给出出处,已全部删除。取而代之的是可以用 Anthropic 与 OpenAI 官方价格页面上的单价和倍率算出来的示例,并附上算式。同时更正了缓存的回本点(5 分钟缓存读 1 次、1 小时缓存读 2 次即回本)和输出单价(输入的 5 倍),并新增了批处理一章。具体改动汇总在文末。

从 ChatGPT Plus(每月 $20)这样的固定套餐,换到按 token 计费——用 API 密钥跑 Claude Code,或者自己开发的 AI 应用——账单可能随用法差出一个量级。按用量计费没有上限。

好消息是,最见效的手段可以归结为三个:提示缓存、模型选择、输出预算。每一项的效果都由官方价目表上公布的倍率决定,所以你可以套用到自己的用量上自行计算。本文依据 Anthropic 与 OpenAI 的官方资料,整理这些倍率以及计算方法。

三大杠杆

效果可以用官方单价算出来

— 依据 2026 年 9 月 26 日 Anthropic 与 OpenAI 的官方价目表

杠杆 1 缓存
0.1 倍
从缓存读取的输入按基础单价的 0.1 倍计费(Claude Opus 5.5 为 0.05 倍)。写入时 5 分钟缓存为 1.25 倍,1 小时缓存为 2 倍(Anthropic 官方)。
杠杆 2 模型选择
四分之一
从 Opus 5.5 换到 Haiku 4.5,输入由 $4 降到 $1,输出由 $20 降到 $5(每百万 token,Anthropic 官方)。换成 Sonnet 5 则是一半。
杠杆 3 输出预算
5 倍
输出单价是输入的 5 倍(现行 Claude 各模型与 GPT-6 三款模型均如此)。少输出 1 个 token,相当于省下 5 个输入 token。

算例:把同一段 10 万 token 的前缀以不到 5 分钟的间隔发给 Opus 5.5 共 10 次,输入费用从不用缓存的 $4.00 降到 5 分钟缓存的 $0.68(写入 1 次 $0.50,加读取 9 次 $0.18)。
不着急的处理交给批处理 API,输入输出都半价,而且还能叠加缓存倍率。
来源:Claude Platform Docs《Pricing》、OpenAI API Pricing(2026 年 9 月 26 日确认;计算由本文完成)

1. 为什么 AI 账单会悄悄膨胀

AI 工具有两类计费方式:个人套餐(固定费率)与 API 计费(按用量)。账单爆炸的主要是后者。

  • 个人套餐:ChatGPT Plus 每月 $20,Claude Pro 每月 $20(按年付为每月 $17),Max 每月 $100 起。固定成本,因此即便重度使用也有上限(伴随使用量限制)。
  • API 计费:按 token、按用量计费。用 API 密钥运行的 Claude Code 和自研 AI 应用都属于此类。月度金额会随用法大幅波动。

按用量计费之所以会膨胀,是因为(1) 输出 token 的单价是输入的 5 倍、(2) 上下文越长,每次请求整段重发的量越大、(3) 后台会反复调用子智能体、(4) 一旦陷入循环就停不下来——这些会叠加放大。理解机制后,每一项都可修复。

2. 成本拆解——输入、输出、缓存、批处理

以 Claude Opus(截至 2026 年 9 月为 Opus 5.5;位于最高档 Fable 之下,是 Anthropic 推荐作为起点的一档)的 API 价格为例,看看钱花在了哪里。

项目单价(每百万 token)说明
输入 token$4你发送的内容:提示词 + 对话历史 + 文件等。
输出 token$20AI 返回的内容。是输入的 5 倍。
缓存写入(5 分钟)$5(输入的 1.25 倍)把前缀存进缓存。5 分钟内每被读取一次,就免费续期一次。
缓存写入(1 小时)$8(输入的 2 倍)间隔超过 5 分钟也不会失效,代价是写入更贵。
缓存读取$0.20(输入的 0.05 倍)多数模型为 0.1 倍,Opus 5.5 为 0.05 倍。是节费的明星。
批处理输入 $2、输出 $10(半价)把不着急的请求集中起来异步处理。可与缓存倍率叠加。
工具调用计入输入工具定义属于上下文的一部分。只要传入工具,还会额外加上一段工具专用的系统提示(Opus 5.5 为 286 token)。

简而言之,放在缓存里的前缀,只要输入价的十分之一甚至更低就能读出来。写入倍率(5 分钟 1.25 倍、1 小时 2 倍)和“输出是输入的 5 倍”这一关系,在现行所有 Claude 模型上都相同,只有读取倍率因模型而异(Fable 5.1 为 0.025 倍)。另外,Claude Opus 4.7 及之后的模型使用新的分词器,官方称同样的文本会产生约多 30% 的 token——跨代比较价格时也要考虑这一点。来源:Claude Platform Docs《Pricing》(2026 年 9 月 26 日确认)。

3. 套餐选择及其节省效果

一旦能预测自己的使用方式,就先切到合适的套餐。

使用情况推荐套餐月度目标注意事项
兴趣、学习、每周几次Claude Free / ChatGPT Free$0有使用量限制;不可用于工作数据。
个人,每日数小时Claude Pro / ChatGPT Plus$20个人套餐;不可用于工作数据。
个人重度使用Claude Max$100 起使用量为 Pro 的 5 倍或 20 倍;适合长时间使用 Claude Code 的人。
团队工作Claude Team / ChatGPT BusinessClaude Team 标准席位每用户 $20(按年付)至 $25可用于工作数据;数据不会用于训练。
大型组织Enterprise销售报价SSO、审计日志、SLA。
嵌入式 AI 开发直接调用 API(Anthropic / OpenAI)按用量用好缓存与批处理。

来源:Claude 价格页面、OpenAI 帮助中心“What is ChatGPT Plus?”(2026 年 9 月 26 日确认)。

如果你每天长时间使用 Claude Code、经常撞上 Pro 的上限,可以考虑 Max 套餐。它是固定费用,账单不会像用 API 密钥那样失控。Cursor 的个人 Pro 套餐每月 $20 起,往上还有 Pro+ 和 Ultra。

4. 提示缓存——最见效的杠杆

如果你直接调用 API,并且反复发送同一段前缀,那几乎没有理由不用提示缓存。从缓存读取的部分,只按基础输入单价的一小部分计费。

工作机制

当你在多次请求中复用相同的 system prompt 或同一份文档时,首次调用会把它们写入缓存(5 分钟缓存为输入的 1.25 倍)。之后的每次调用都按输入的 0.1 倍从缓存读取(Opus 5.5 为 0.05 倍,Fable 5.1 为 0.025 倍)。不过前缀太短是不会被缓存的:最小长度为 Opus 5.5 的 512 token、Sonnet 5 的 1,024 token、Haiku 4.5 的 4,096 token(Claude Platform Docs“Prompt caching”)。

回本点——5 分钟缓存读 1 次,1 小时缓存读 2 次

把输入单价记为 1,比较发送同一段前缀的费用(按 Anthropic 官方倍率计算):

  • 5 分钟缓存:写入 1.25 + 读取 1 次 0.1 = 1.35。不用缓存发 2 次是 2,所以读 1 次就回本
  • 1 小时缓存:写入 2 + 读取 2 次 0.2 = 2.2。不用缓存发 3 次是 3,所以读 2 次就回本(只读 1 次是 2.1,略高于不用缓存的 2)

Anthropic 的价格页面也写明:5 分钟缓存读 1 次、1 小时缓存读 2 次即可回本。Opus 5.5 的读取倍率是 0.05 倍,同样的读取次数下差距更大。

算例——10 万 token 的前缀发送 10 次

模型不用缓存5 分钟缓存差额
Claude Opus 5.5(输入 $4、写入 $5、读取 $0.20)0.1 × $4 × 10 次 = $4.000.1 × $5 + 0.1 × $0.20 × 9 次 = $0.68约减少 83%
Claude Sonnet 5(输入 $2、写入 $2.50、读取 $0.20)0.1 × $2 × 10 次 = $2.000.1 × $2.50 + 0.1 × $0.20 × 9 次 = $0.43约减少 79%

只计算前缀(system prompt、参考资料等)的输入部分,10 万 token = 0.1(以百万 token 为单位)。假设 10 次请求的间隔都不到 5 分钟,第 1 次写入缓存,其余 9 次从缓存读取。单价来自 Claude Platform Docs《Pricing》(2026 年 9 月 26 日确认)。不含输出及每次都会变化的部分。

OpenAI 的 GPT-6 系列机制也很接近。缓存输入为 0.1 倍,写入为 1.25 倍,官方指南给出的也是同样的算法:写入 1 次再完整复用 1 次是 1.35 倍,而不用缓存处理 2 次是 2 倍。缓存在最后一次使用后保留 30 分钟,受支持的模型默认开启(OpenAI“Prompt caching”)。

默认有效期是 5 分钟

在 Anthropic 的 API 中,提示缓存的有效期(TTL)默认是 5 分钟。每次读取都会免费续期,但间隔超过 5 分钟就会失效,下一次请求要重新写入(输入价的 1.25 倍)。也可以选 1 小时的有效期,但写入要输入价的 2 倍(来源:Claude Platform Docs“Prompt caching”)。

Claude Code 也跑在同一机制上。在 Claude 订阅所含用量之内,主对话使用 1 小时的有效期;但用 API 密钥时,或超出套餐上限转用使用额度(usage credits)时,会降为 5 分钟。v2.1.242 起可以通过 promptCacheTtl 设置自行选择 5m 或 1h(来源:Claude Code Docs“Prompt caching”,2026 年 9 月 26 日确认)。如果你习惯中途休息,适用哪一种会直接影响缓存被重写的次数。

5 分钟与 1 小时怎么选

官方文档给出的参考:

  • 使用间隔短于 5 分钟的前缀:用 5 分钟缓存即可。每次读取都会免费续期,不必付更贵的 1 小时写入费
  • 使用间隔在 5 分钟到 1 小时之间的前缀(等待用户回复、在超过 5 分钟的任务之后才发起的调用等):适合 1 小时缓存
  • 两者混用时:把 1 小时缓存放在 5 分钟缓存之前——与把不变的 system prompt 和工具定义放在最前面是同一个顺序

缓存是否生效,可以看响应 usage 中的 cache_read_input_tokens(读取)和 cache_creation_input_tokens(写入)。如果读取一直是 0,说明前缀每次都在某处变化,或者没有达到最小 token 数。

5. 上下文管理——/compact 与拆分

用 Claude Code 或 Cursor 一段时间后,长对话进行到一半时你会发现每一轮都在重发大量的过往对话。膨胀的不是输出,而是输入(= 过往对话)。

战术 1:积极使用 /compact

Claude Code 提供 /compact 命令。它会把到目前为止的对话总结,腾出上下文空间(Claude Code Docs“Commands”),还可以附上指示,告诉它总结里要保留什么。在工作告一段落时使用最合适。

战术 2:按任务拆分会话

不要在同一段长对话里同时做“实现功能 A”、“修复 Bug B”、“生成文档 C”——开新会话。每项任务结束就关掉会话。如需长期记忆,写到记忆文件里。

战术 3:用 Hooks 削减噪声

Claude Agent SDK / Claude Code 提供 Hooks,可以在工具输出送达 AI 之前进行加工。例如:通过 Hook 把冗长的 npm install 日志压缩成“成功/失败”。日志越长,每一轮的输入就越轻。

6. 模型选择——按任务路由

“始终用 Opus”是百万富翁的玩法。分类、抽取这类例行工作,用 Sonnet 或 Haiku 往往就够了。价格由模型档位(高、中、轻量)决定,截至 2026 年 9 月 26 日的官方价格(每百万 token)如下。版本更替之间,“档位越高越贵、轻量档只要高档的几分之一”这一关系没有变过。

模型输入输出擅长场景
Claude Opus 5.5(高档)$4$20复杂设计、推理、长时自主任务
Claude Sonnet 5(中档)$2$10日常编码、分析、摘要
Claude Haiku 4.5(轻量)$1$5分类、抽取、短文本转换、实时响应
GPT-6 Sol(OpenAI 的均衡型)$2$10复杂编码与智能体类工作
GPT-6 Luna(OpenAI 的低成本型)$0.10$0.50目标明确的大量轻量工作

来源:Claude Platform Docs《Pricing》、OpenAI API Pricing(2026 年 9 月 26 日确认;OpenAI 为短上下文价格)。更上一档还有 Anthropic 的 Fable 5.1($10 / $50)和 OpenAI 的旗舰 GPT-6 Astra($10 / $50)。各公司的当前模型可在当前模型与知识截止日期一览中查看。

从高档的 Opus 换到轻量的 Haiku,单价降到四分之一(截至 2026 年 9 月)。以每天输入 200 万、输出 20 万 token 的分类工作为例,按官方单价可以这样算:

  • Opus 5.5:2 × $4 + 0.2 × $20 = $12
  • Sonnet 5:2 × $2 + 0.2 × $10 = $6
  • Haiku 4.5:2 × $1 + 0.2 × $5 = $3
  • Haiku 4.5 走批处理:$3 × 0.5 = $1.50(第 8 章)

质量够不够取决于具体工作,所以换成便宜模型之前,先用相同的输入比较结果(FAQ 的 Q4)。判断参考:

  • 用 Opus 的场景:复杂重构、跨多文件设计、深度推理、探索陌生领域
  • 用 Sonnet 的场景:日常编码、分析、摘要、代码评审、补测试
  • 用 Haiku 的场景:分类、抽取、格式转换、实时建议、生成提交信息

7. 管理输出预算

输出 token 的单价是输入的 5 倍(现行 Claude 模型与 GPT-6 的 Astra、Sol、Luna 都一样)。例如 Opus 5.5 上输入 2,000、输出 1,000 token 的一次应答,费用是输入 $0.008 + 输出 $0.020 = $0.028。把输出压到 500 token,就是 $0.018,约减少 36%(按官方单价计算)。

三种做法

  • 按用途收紧 max_tokens:在 Anthropic 的 Messages API 中,max_tokens 是必填参数,填入的数字就是输出的上限(API 参考“Messages”)。不要一直留着很大的值,改成与用途相称的值,例如 max_tokens: 1000。
  • 在提示中加入“简短回答”或“五条要点”:AI 是会听的。压制冗余的前言、总结与寒暄。
  • 结构化输出(JSON 模式):JSON 比散文更短。如果你的应用要消费结果,这是正解。

对于不需要“长篇优美回答”的场景(分类、抽取、决策),狠狠压短反而更具成本效益。

8. 批处理——不着急的工作半价

不需要马上拿到答案的工作(夜间批量分类、大量摘要、评测跑批等),交给批处理 API,输入和输出都半价。Anthropic 的 Message Batches API 每批最多接受 10 万个请求,多数在 1 小时内完成,但最长可能需要 24 小时(Claude Platform Docs“Batch processing”)。OpenAI 的 Batch API 同样打五折,完成时限为 24 小时(OpenAI“Batch API”)。

根据 Anthropic 的价格页面,缓存倍率可以与批处理折扣叠加。例如在批处理中对 Haiku 4.5 做缓存读取,费用是 $1 × 0.1 × 0.5 = 每百万 token $0.05。

9. 多智能体陷阱——15 倍 token

2026 年的潮流——多智能体架构(编排器 + 并行子智能体)虽然强大,但 Anthropic 公开了自家 Research 功能的数据:智能体的 token 用量约为普通聊天的 4 倍,多智能体系统约为聊天的 15 倍(Anthropic“How we built our multi-agent research system”,2025 年 6 月)。15 倍的比较对象是聊天,而不是单智能体。

节省视角下的判断标准

  • 清晰、按序执行的任务(单文件编辑、摘要、代码评审)→单智能体已足够
  • 能显著缩短墙钟时间的并行场景→多智能体值得
  • “默认就用多智能体”在经济上是错的。从单智能体起步,只把真正能看见的瓶颈拆出去。

详情参见什么是多智能体?

10. 监控与账单告警

要避免按用量计费的账单吓你一跳,例行监控 + 告警必不可少。

API 用户

  • 在 Claude Console / OpenAI Dashboard 检查每日 token 消耗
  • 设置使用上限:例如超过每月 $200 就停止。无上限 = 危险。
  • 账单告警:$50 发邮件、$100 发 Slack——分级阈值。

Claude Code 用户

  • 用 /usage 查看当前会话的花费与套餐用量(/cost 现在是 /usage 的别名)
  • 把每天结束时检查 /usage 养成习惯

组织管理员

  • 按用户的使用报告(Anthropic Team / Enterprise 管理控制台)
  • 异常检测(标记用量远高于平时的人)
  • 每季度全公司分享一次“浪费模式”

11. 七种常见浪费模式

模式问题所在修复方法
每轮重新附上所有文件缓存不生效;输入暴涨把不变的文档放进前缀并缓存
同一个问题既问 ChatGPT 又问 Claude同一份输入在两个套餐里付两次钱选一个
不用 /compact 持续长对话每轮都重发完整历史工作告一段落时用 /compact
用 Opus 做简单分类或抽取同样结果付 Haiku 4 倍的钱模型与任务匹配
反复说“再润色一些”/“再长一点”输出 token 不断累积开头就说清想要的长度
定义大量用不上的工具工具定义会带进上下文只定义会用到的
动不动就上多智能体约为聊天的 15 倍 token(单个智能体约 4 倍)有明确需要时再用

总结

  • AI 成本优化的三大杠杆:提示缓存、模型选择、输出预算。每一项的效果都由官方倍率决定,而且倍率可以相乘
  • 缓存读取 = 输入的 0.1 倍(Opus 5.5 为 0.05 倍)。5 分钟缓存读 1 次、1 小时缓存读 2 次即可回本。10 万 token 的前缀向 Opus 5.5 发送 10 次,费用从 $4.00 降到 $0.68
  • 模型选择:从 Opus 5.5 换到 Haiku 4.5,单价降到四分之一;换到 Sonnet 5 则是一半(截至 2026 年 9 月)
  • 输出预算:输出单价是输入的 5 倍。显式设 max_tokens 并要求“简短”
  • 批处理:不着急的工作输入输出都半价,还能与缓存折扣叠加
  • 上下文管理:工作告一段落时用 /compact,按任务拆分,用 Hooks 压缩输出
  • 多智能体陷阱:约为聊天的 15 倍 token。仅在有明确需要时使用
  • 监控:使用上限、账单告警、查看 /usage 都要养成习惯

FAQ

Q1. 我每天用 Claude Code,是 Pro($20)划算还是 Max 划算?

如果经常撞上 Pro 的上限,就考虑 Max。Anthropic 的帮助中心建议:经常撞上限、需要更多容量处理大型仓库的 Pro 用户,可以考虑升级到 Max 5x(Claude Help Center“Using Claude Code with your Pro or Max plan”)。如果碰不到上限,继续用 Pro 即可。

Q2. 使用提示缓存需要特殊配置吗?

在 Anthropic 的 API 上需要指定 cache_control——可以在请求最上层放一个(自动缓存),也可以放在具体的块上(显式断点)。OpenAI 在受支持的模型上默认开启。Claude Code 会自动使用缓存。详见 Anthropic 官方文档。

Q3. ChatGPT 与 Claude,哪个更具成本效益?

视用例而定。只看单价,中档的 Claude Sonnet 5 与 GPT-6 Sol 都是输入 $2、输出 $10,不分高下。对于短问答和大量的例行处理,OpenAI 的低成本型(截至 2026 年 9 月为 GPT-6 Luna,输入 $0.10)只有 Haiku 4.5(输入 $1)的十分之一。对于反复发送同一前缀的长任务,缓存读取的作用很大,Opus 5.5(0.05 倍)也值得考虑。“两个都订,按场景挑”也很务实。

Q4. 怎么判断“Haiku 已经够了”?

做三步实验。(1) 先在 Opus 上跑通。(2) 同一个提示发给 Sonnet 比对质量。(3) 如果 Sonnet 看上去差不多,再试 Haiku。越是例行的任务,差距往往越小。把 Opus 留给真正需要深度判断或推理的场景。

Q5. 个人用户应该直接调 API 吗?

看情况。如果以交互式编码为主,账单固定的 Max 套餐更省心。如果要把 AI 嵌入自家应用、做批处理或自动化,就需要直接调 API。两者并用的人也不少。

Q6. 账单告警阈值该设多少?

没有标准答案,不过一种分级方式是:第一档告警设为常规月支出的 1.5 倍,3 倍时停止。例:通常每月花 $30,则告警 $50、停止 $100。初期可以按天设小额告警,摸清自己的用量后再放宽。

Q7. 公司被告知“AI 预算太大了”,先做什么?

按顺序做三件事。(1) 看按用户的用量,找出消耗集中在哪里。(2) 与用量最多的人聊聊他们的工作流程,识别浪费模式。(3) 在公司内部分发一份“缓存、模型选择、输出预算”指南,每月汇报进展。

对旧版的更正

2026 年 9 月 26 日,我们更正了以下内容。

旧版的说法现在
三大杠杆可压到未优化成本的 20-30%(标题、开头、配图)无法给出出处,已删除。改为用官方单价与倍率计算的示例
缓存 -60 至 90%、模型选择 -50 至 80%、输出预算 -30 至 60%、每月 $30K 降至 $6-9K同上。改为“10 万 token 的前缀发送 10 次:$4.00 → $0.68”等算例
十项任务里有八项用更便宜的模型也够没有出处,已删除
5 分钟缓存读 2 次回本读 1 次即回本(写入 1.25 + 读取 0.1 = 1.35 < 2)
1 小时缓存读 5 次回本读 2 次即回本(2 + 0.2 = 2.2 < 3)
输出 token 比输入贵 5-6 倍5 倍(现行 Claude 各模型与 GPT-6 三款模型)
缓存命中率低于 60% 就有优化空间,生产环境应瞄准 80% 以上没有出处,已删除。改为查看 usage 中读取与写入的 token 数
/compact 可把 20 万 token 压到 5,000没有出处,已删除数字