新模型更聪明但也更贵——一般都会这么想。可是放到 GPT-6 AstraGPT-5.6 Sol 身上,只比单价是得不出答案的。因为 Astra 用更少的token就能把同样的活干完

先说结论。第三方机构 Artificial Analysis 的实测显示,把 Astra 开到最弱的 low,每个任务的费用和把 Sol 开到 high 时几乎相同($0.82 对 $0.81),分数还更高(46 对 42)。用掉的输出token只有三分之一,回复开始之前的等待时间只有四分之一。

不过,这个“几乎相同”是建立在有期限的前提之上的。Sol 现在是促销价,按公告的说法会在2026年11月下旬结束,价格有可能回升。本文以2026年9月18日时点 Artificial Analysis 的实测值和 OpenAI 的官方信息为依据,整理按推理强度划分的费用、token和速度,前提改变之后的试算,以及在编程上的差别。

用同一把尺子量 Astra(low)和 Sol(high)

Artificial Analysis Intelligence Index,按每个任务计(截至2026年9月18日)

费用

$0.82 对 $0.81

几乎打平。单价是2.5倍,总额却并驾齐驱

输出token

4,000 对 13,000

Astra 用大约三分之一就抵达了答案

回复开始之前

2.7秒 对 11.9秒

深思的时间短。体感差距就出在这里

智能指数

46 对 42

弱设定的 Astra 反超了强设定的 Sol

参考来源: Artificial Analysis“GPT-6 Astra (low) vs GPT-5.6 Sol (high)”。费用是按 Sol 的促销价($4/$20)计算的

1. 论点:单价是2.5倍,token只有三分之一

如果比较只停在单价上,Astra 显然是贵的那一个。

模型输入(每100万token)缓存读取输出(每100万token)
GPT-6 Astra$10.00$1.00$50.00
GPT-5.6 Sol(促销价,自2026年8月21日起3个月)$4.00$0.40$20.00
GPT-5.6 Sol(促销之前的价格)$5.00$0.50$30.00

参考来源: OpenAI 开发者文档“GPT-6 Astra”OpenAI 开发者社区的降价公告(2026年8月21日)

按促销价来比,Astra 的单价在输入上是2.5倍,在输出上也是2.5倍。只看这一处,结论就是“贵得没法用”。

可是,账单是由“单价 × 实际用掉的token数”决定的。推理模型在给出答案之前会先思考,而那些思考也按输出token计费,所以用更少的思考就抵达正确答案的模型,即使单价更高,总额也可能更便宜——这就是本文要回答的论点。

2.“low就够用”是谁说的

起因是这样一句话:“Astra 的 low 比 Sol 的 high 更好”。我们来确认它的出处。

出处是 OpenAI 的员工(Tibo)在2026年9月6日发到 X(原 Twitter)上的一条帖子。在 OpenAI 开发者社区里,OpenAI 一方的发帖者也重述了这个说法,写道 OpenAI 的建议是把推理强度设为 lowGPT-6-Astra 当作高强度 GPT-5.6-Sol 的替代。

🟡 不过,这是帖子里给出的指引,并不是作为规格得到保证的内容。OpenAI 的开发者文档里既没有强度之间的比较,也没有关于token效率的任何说法(笔者已确认)。文档里写着的只有推理强度分5档(low / medium / high / xhigh / max),以及价格和限制。请把它当作大致的参考,再拿自己的工作去验证。

也就是说,要给“low就够用”找到支撑,就需要独立的实测

3. 按推理强度看实测值

Artificial Analysis 会按每一档推理强度跑一遍汇总了多项基准测试的 Intelligence Index,并且连每个任务的费用和输出token数一起公布。下面是截至2026年9月18日的数字。

模型和强度智能指数每个任务的费用输出token到首个token的时间生成速度
Astra low46$0.824,0002.74秒49 tok/秒
Astra medium50$1.5410,0004.46秒46 tok/秒
Astra high51$1.7212,00047.76秒46 tok/秒
Astra xhigh53$2.3117,000154.86秒49 tok/秒
Astra max53$3.2627,000300.45秒52.6 tok/秒
Sol medium39$0.508,0004.74秒60 tok/秒
Sol high42$0.8113,00011.91秒60 tok/秒
Sol xhigh44$1.1820,00040.15秒66 tok/秒
Sol max47$1.99129.63秒61.7 tok/秒

参考来源: Artificial Analysis 的模型比较页面(low 对 highmedium 对 highhigh 对 highxhigh 对 xhighlow 对 medium)以及 Sol 的模型页面。费用是按 Sol 的促销价计算的。输出token是按千位取整之后的显示值,包含回答部分和推理部分的合计。Sol max 的输出token无法在图上确定数值,因此省略

从中可以读出三件事。

  • Astra 的 low 对上 Sol 的 high 和 xhigh 都能胜出。它和 Sol high(42分、$0.81)几乎同价却高出4分,比 Sol xhigh(44分、$1.18)高2分却便宜三成。不过它并不比 Sol medium(39分、$0.50)便宜——那就变成了“为7分之差付 $0.32 值不值”的比较
  • Astra 一旦调高强度,费用就涨得很陡。medium 是 $1.54(约为 Sol high 的1.9倍),max 是 $3.26(约4倍)。分数的涨幅却只有 46→53 的7分
  • Sol 在分数上能超过 Astra low 的只有 max。为那47分要花 $1.99,是2.4倍的费用

4. 为什么总额会打平

单价是2.5倍而总额却持平,原因在于用掉的token只有三分之一。用最简单的乘法就能验证。

明细Astra lowSol high
输出token(每个任务)4,00013,000
输出的单价(每100万token)$50.00$20.00
输出部分的费用(据显示值计算)约 $0.20约 $0.26
每个任务的总额(含输入和缓存)$0.82$0.81

参考来源: 输出部分的费用是笔者根据上表的token数和官方单价计算得出的(4,000 × $50 ÷ 100万 = $0.20)。token数是按千位取整的,所以这个计算也只是概数。Artificial Analysis 也提供把费用按回答、推理、缓存、输入分类的图表,但能读出的数值有出入,因此这里用总额和显示值来比较。总额采用 Artificial Analysis 的公布值

只看输出的话,会出现这样的反转:即使单价是2.5倍,付的钱反而是 Astra 更少($0.20 对 $0.26)。总额之所以几乎持平,是因为剩下的输入和缓存部分把 Astra 的高单价体现了出来。

由此可以得出一条实务上的经验:输入越短、越是以思考量为主的工作,Astra 的 low 越占优;越是每次都要读大量上下文的工作,就越吃亏。关于上下文的处理,我们在什么是 AI 上下文?——1M 令牌时代“读了但没读完”的现实里谈过。

5. 速度:等待时间只有四分之一

费用既然打平,接下来就看快慢。按单个token算的生成速度是 Sol 更快(60 对 49 tok/秒),可是实际把答案全部返回完所需的时间,反而是 Astra low 更短。原因在于思考的时间(到首个token为止的等待)和吐出的token数之差。

模型和强度到首个token的时间生成所需的时间(实测)合计
Astra low2.74秒91.69秒约94秒
Astra medium4.46秒209.95秒约214秒
Sol high11.91秒219.90秒约232秒
Sol xhigh40.15秒296.86秒约337秒
Astra max300.45秒522.00秒约822秒

参考来源: Artificial Analysis 的实测值(到首个token为止的时间,以及每个任务的生成时间)。合计是笔者相加得到的。生成时间这个指标在定义上不包含“到首个token为止的等待”,所以可以直接相加。但要注意,等待时间和速度来自另一项让模型输出500个token的测量,而生成时间是指数的任务平均值,两者的测量出处并不相同

Astra low 用大约 Sol high 的1/2.5 的时间就跑完了。反过来,一旦调到 max,光是等第一个字出来就要等5分钟(300.45秒)。如果用在对话上,这段等待时间的差距比费用更能被直接感受到。

6. 前提改变的那一天——Sol 的促销价

到这里为止的“几乎同价”,是靠 Sol 的促销价才成立的。OpenAI 在2026年8月21日公告称,“在接下来的3个月里,把 GPT-5.6 Sol 的 API 和额度价格下调20%以上”(输入 $5→$4,缓存 $0.50→$0.40,输出 $30→$20。ChatGPT Work 和 Codex 的额度同样适用)。如果按公告执行,这就是到2026年11月下旬为止的限时价格。

🟡 无论是点名结束日期的说法,还是结束之后的价格,OpenAI 都没有给出。在同一个帖子里,有用户写道“至少到2026年11月21日”,并说 Terra 和 Luna 的降价(Terra $2.50→$2.00 / $15→$12,Luna $1.00→$0.20 / $6.00→$1.20,2026年7月30日实施)是永久的,但这是用户的发帖,不是 OpenAI 的公告

假设价格回到原来的 $5/$30,那么输入和缓存变成1.25倍,输出变成1.5倍。Sol high 的一个任务($0.81)里输出部分约为 $0.26,因此其余部分按1.25倍、输出按1.5倍算下来约为 $1.08。取全部偏向输入和全部偏向输出这两个极端,也落在 $1.01~$1.22 的区间里。无论哪种情况,Astra low($0.82)都要便宜两三成。

现在(促销进行中)

费用打平

Astra low $0.82 / Sol high $0.81。凭分数和速度,Astra low 更占优。

促销结束之后(如果回到原价)

Astra low 便宜两三成

Sol high 会涨到约 $1.08(取极端则是 $1.01~$1.22)。Astra low 仍是 $0.82。

判断

现在换过去也不容易吃亏

价格变动的方向对 Astra 有利。不过还是请先拿自己的工作测一遍再决定。

7. 在编程上差距会缩小

到这里为止讲的都是智能指数(综合)。在衡量编程智能体作业的指数上,价格的差距会缩小。

在综合指数上,两边都开到最高强度时,Astra($3.26)比 Sol($1.99)贵约六成;而在编程智能体指数上,Astra 每个任务是 $7.09,只比 Sol 贵约15%。分数是 62 对 55,Astra 高出7分,token是三分之一可以说,编程是对 Astra 相对有利的场子。

不过🟡 编程指数并没有公布低强度下的费用。本文的主题“low够不够用”,在编程上是没有得到验证的。请以综合指数能支撑的那条经验“弱强度够用就划算,一路开到最高就偏贵”为参考,拿自己的智能体去测。

参考来源: Artificial Analysis“Benchmarking GPT-6 Astra”(Coding Agent Index,在 max 强度下的比较。2026年9月9日公布)

另外,Astra 还有两个会让账单跳涨的条件。输入超过272,000个token时,输入和缓存翻倍,输出变成1.5倍。反过来,Batch 和 Flex 是半价,Fast 是2倍。如果你的用法是每次都把长文档整份递过去,这笔加价就会压上来。

8. 拿自己的工作去测

上面这些数字,都是用一整套基准测试的组合测出来的,和你的工作内容并不一样。请先用能代表自己实际工作的任务测过,再下判断。步骤有三步。

  1. 把同一个请求用两种设定各跑一遍:把 Astra 设为 low、Sol 设为 high,用同样的输入各投5~10次。只跑1次的话,结果会被某次碰巧想得特别久的调用带偏
  2. 看响应里的数字,而不是账单:把响应里带的token数(输入、输出、推理)记录下来,乘上单价就得到每次调用的费用。API 计费的基础,我们整理在什么是 AI API?—— 新手指南:价格、Token、模型选择与网页对话的区别
  3. 把重试的次数也数进去:如果便宜的模型一次做不完、要重投两次,实际费用就是两倍。费用要按“把活干完为止的总额”来比,而不是“一次调用的价格”

FAQ

Q1. Astra 的 low 和 Sol 的 low 是同样的强度吗?
不是。强度的名称是各个模型自己的设定值,并不是共通的尺度。实测中,Astra low(46分)也超过了 Sol 从高往下数第二档的 xhigh(44分)。请按分数和费用来比,而不是按名字。

Q2. 该从哪一档强度开始试?
low 往上加比较稳妥。Astra 一旦调高强度,费用涨得很陡,medium 约为 Sol high 的1.9倍,max 约为4倍。分数的涨幅只有 46→53 的7分,所以越往上调越不划算

Q3. 促销价结束之后应该换过去吗?
价格变动的方向对 Astra 有利。如果回到原来的 $5/$30,Sol high 会变成 $1.01~$1.22,Astra low($0.82)要便宜两三成。不过🟡 结束之后的价格并没有公布

Q4. 既然token只有三分之一,那在有上限的套餐上也占优吗?
在 API 的按量计费上确实如此,但并没有任何公布说订阅套餐的用量上限会按token数成比例扣减。套餐那边怎么算,请和计费的问题分开确认。

Q5. 这些数字是什么时候的?
正文里的实测值是截至2026年9月18日 Artificial Analysis 所公布的内容。价格和各强度的成绩都会更新,所以在做判断之前,请到来源页面确认最新的数值。

参考来源