2026年9月3日,OpenAI 公开了新旗舰 “GPT-6 Astra”OpenAI API文档)。API 无门槛正式开放,模型ID 是 gpt-6-astra,上下文为 1,050,000 token

不过“已经发布”和“你的套餐能用”是两回事。OpenAI 自己公告说“从有限的组织开始逐步开放”,在 ChatGPT Plus 的常规聊天界面里它不会出现。本文第2章单独成节,就是写给只想知道这一点的人。

还有一点,本文和其他解读文章不一样。没有刊登基准测试的分数表。OpenAI 提到的指标名会列出来,但数值只收录能追溯到发布方页面的那些。理由写在第4章——先说结论,现在流传的“GPT-6 Astra 74.1% 对 Claude Opus 5 96%”这一类比较,本来就是把用不同尺子量出来的数值摆在了一起

G6

GPT-6 Astra

2026年9月3日发布 / API 正式开放

上下文
1,050,000
输入上限 922,000 / 输出 128,000
API价格(每100万token)
$10 / $50
缓存输入 $1 / 缓存写入 $12.50
知识截止
2026年4月30日
Opus 5 为2026年5月
网络安全能力
Critical
首个达到该等级的模型

参考来源: OpenAI

1. 发布概况——日期、规格、开放范围

OpenAI 把 GPT-6 Astra 定位为“目前最聪明的模型”,并说明它在计算机操作、浏览、软件工程、科学和专业工作上具备最先进的性能。官方的说法是“擅长执行跨越代码、浏览器和业务软件的多步骤工作流”,重心放在“长时间运行的工作”而不是一问一答OpenAI 模型指南)。

项目GPT-6 Astra备注
发布日期2026年9月3日从有限的组织开始逐步扩大
模型IDgpt-6-astraAPI 无门槛
上下文1,050,000 token输入上限 922,000
最大输出128,000 token
知识截止2026年4月30日详见知识截止日期一览
推理强度low / medium / high / xhigh / max不支持 none
支持的功能流式输出、结构化输出、函数调用、文件检索、图像输入、Web搜索、提示词缓存
速率限制500~15,000 RPM / 500K~40M TPM取决于使用层级

输入超过 272,000 token 会加价。输入和缓存翻倍,输出为1.5倍。100万token的上下文是“用得越多单价越高”的设计,能塞进去和塞进去划算,最好当成两回事看

2.“明明是Plus却找不到”的真相——各套餐的开放情况

发布之后最常见的困扰就是这个。先说结论,Plus 也能用 Astra,但它不会出现在常规聊天界面里

以下整理依据的是 OpenAI 开发者社区的官方公告和 OpenAI 官方账号的帖子。

OpenAI 在官方账号上公告称,首日面向“有限的组织”,随后几天里扩展到 Plus / Pro / Business / Enterprise 以及 API 和 AWS。第二天又补充说“Pro、Enterprise、Business Premium 可以在 ChatGPT Work 和 Codex 中使用。API 也已经在跑。向 Plus 和 Business 的推送可能需要几天”

API

正式开放。没有门槛也不用排队,指定 gpt-6-astra 就能用。现在能确实摸到它的地方就是这里。

Pro / Enterprise / Business Premium

可在 ChatGPT Work 和 Codex 中使用。这是官方明确说过“已向全部用户提供”的范围。

Plus / Business Standard

只有 ChatGPT Work 和 Codex。常规聊天界面的模型列表里不会出现。要找的话,去 Work 或 Codex 的模型选择里找。

说到底,是找错了地方。很多人“打开 ChatGPT 看模型列表”→没有,就停在这一步了,可 Plus 的入口是 Work 和 Codex

🟡 不能写成“等几天就会出现在常规聊天里”。OpenAI 最初的公告是“几天之内面向全部 Plus 用户”,但在发布5天之后的2026年9月8日,Plus 的常规聊天里依然没有出现。OpenAI 的开发者论坛上,已经有要求说明的帖子,指出“公告说是面向全部 Plus 用户,但 Plus 的访问被限制在 Work / Codex”,也有报道称在常规聊天里使用需要 Pro。
最初的公告是“计划”,不是“确定的开放日期”——现在 Plus 上能确实用到的是 Work 和 Codex。(截至2026年9月8日。情况有变化会再补充。)

3. 价格——该怎么问“$10/$50算贵吗”

API价格是输入 $10 / 输出 $50(每100万token)。正好是 Claude Opus 5 的 $5 / $25 的两倍,只看单价属于贵的那一档。

不过 OpenAI 在同一份文档里主张,“因为用更少的输出token就能得到更好的结果,每个任务的预估API成本反而更低”。推理模型的账单由“单价 × 实际吐出的token数”决定,所以就算单价翻倍,只要输出不到一半,总额还是会下降

这里不要照单全收。“输出少所以便宜”是OpenAI 自己的估算,不是第三方的实测。而且任务性质一变就很容易反过来——大量发送简短回答的用途,单价会原封不动地压上来;而让它长考的设置(xhigh / max)会让输出token变多。
拿自己有代表性的任务跑10次,看账单——除此之外没有别的确认办法。

4. 基准测试——并排比较为什么不成立

OpenAI 就 Astra 表示“取得了最先进结果”的指标如下(OpenAI 开发者社区的官方公告)。指标名是公开的,但这份公告里并没有附上数值表。

Agents' Last Exam
AutomationBench
ScreenSpot Pro
FrontierMath Tier 4
ARC-AGI 3
TerminalBench-4.0
Terminal-Bench Science 0.1
HealthBench Pro

看这一排会发现一件事。以计算机操作、终端、智能体方向的指标为主,几乎没有所谓的知识问答类。这和第1章“重心放在长时间运行的工作”的说明是一致的。

没有刊出数值的理由

各处的解读文章里都有 “Astra 74.1% 对 Claude Opus 5 96%”这样的表格。本文不刊登它,因为它作为比较并不成立

① 尺子不一样

OpenAI 在编码上举的是 DeepSWE 系,Anthropic 举的是 SWE-bench Verified。这是只有名字相似的两套不同测试,难度和评分方式都不同。把一边的数字摆到另一边旁边的那一刻,这张表就已经失去意义了。

② 追溯不到出处

流传的数值里有很多是综述文章之间的相互抄录,打开发布方的页面会发现,有些数值在那里根本找不到。本站的方针是追溯不到发布方的数值就不刊登

③ 混进了已经饱和的指标

在头部模型清一色贴到90%后段的指标上,1~2个百分点的差距没有意义。哪怕能写成“赢了”,也和实际使用中的体感对不上。

那么该拿什么来比?只有同一把尺子上双方都公布了数值的项目。比如本站在 Opus 5 的文章里处理过的 DeepSWE v1.1,Opus 5 是 68.8%,GPT-5.6 Sol 是 72.7%,同一套测试的数值摆在一起,比较才成立。Astra 在同一指标上的数值,等能在发布方页面确认之后再补充。

5. 首个网络安全能力达到“Critical”的模型

比规格更大的新闻,也许是这一条。OpenAI 把 GPT-6 Astra 定位为在自家 Preparedness Framework 中首个达到“网络安全能力 Critical”的模型OpenAI Deployment Safety Hub,系统卡发布于2026年9月3日)。

按官方的说明,Astra 已经达到能找出尚未被人知晓的漏洞,并在没有人逐步指示的情况下,针对加固过的系统想出利用它们的新方法的水平。在移除安全措施的评估里,记载了它在加固过的浏览器上走通了任意代码执行的路径,以及在加固过的操作系统上完成了权限提升。

OpenAI 公开的数值GPT-6 AstraGPT-5.6 Sol
ExploitBench(一次就成功)88.0%55.9%
ExploitBench(4次以内成功)99.2%68.7%
Gray Swan IPI Arena 攻击成功率
(越低说明防得越好)
8.5%27.0%
HealthBench Professional(长度校正后)63.4
Codex 模拟中严重度3以上的偏离0.063%(54,218件中34件)

攻击方的能力提高了,另一方面作为被攻击的一方反而更结实了。间接提示词注入的攻击成功率,从 Sol 的 27.0% 降到了 8.5%。在让智能体读取外部网页的用途上,这是实际能感受到的改善。

OpenAI 采取的应对不是“把能力压下去”,而是“按用途划线”。对安全代码审查、打补丁这类防御侧的工作会响应,而像为已知漏洞编写概念验证代码这种偏攻击的请求则会拒绝。此外还加上了对全部工具使用推理的监控扩展、对重大操作的用户确认、面向18岁以下的安全边界调整,并且针对生物学研究和网络安全研究另外准备了需要审核的有限访问通道。

这种“划线的方式”,在9月推出的其他新模型上也是共通的。各家都在最危险的能力周围围起栅栏,只对有资质的对象打开。“全部功能发给所有人”的时代正在结束——在这次三连发布中,我认为最容易被忽略的变化就在这里。

6. 面向开发者——迁移时会坏掉的地方

从现有代码切换过去的话,有些地方照原样就会报错。OpenAI 的模型指南里写明的变更点如下。

去掉采样类的参数

temperature top_p top_logprobs 之类不要传。在推理模型上不仅不起作用,还可能被拒绝。

改用 Responses API

Chat Completions 的工具支持有限。用在智能体场景上,基本可以说是必须的。

没有 none 这一档推理强度

如果之前用的是 noneminimal,官方的指示是low 开始,再比较结果

缓存设置改了名字

prompt_cache_retention 改成了 prompt_cache_options.ttl。虽然只是名字变了,但要是被默默忽略,缓存不起作用,只有账单在涨

在行为方面,官方写明Astra 比以前更容易向用户反问。有人在旁边的对话里,这是让人省心的性格,但在无人值守的批处理里会成为卡住的原因。想让它自主执行,就在提示词里把这一点写清楚。

还有一点,Fast 模式在欧盟数据驻留环境下无法使用。而且不附带延迟方面的SLA。如果设计上以响应速度为前提,请多加注意。

7. 与 Claude Opus 5 / Gemini 3.8 Flash 的比较

2026年9月1日到3日,Anthropic、Google、OpenAI 连续三天推出了新模型。下面把现役阵容中能确认到公开数值的项目列出来。

模型发布日期输入/输出(每100万token)知识截止上下文
GPT-6 Astra2026年9月3日$10 / $502026年4月30日1,050,000
Claude Opus 52026年7月24日$5 / $252026年5月1,000,000
Claude Fable 5.12026年9月1日$10 / $502026年6月1,000,000
Gemini 3.8 Flash2026年9月2日$0.75 / $3.75 (导入价格,至2026年12月31日)2026年3月1,000,000

可以读出三件事。

① 最顶层的价格统一到了 $10/$50。Astra 和 Fable 5.1 同价。另一方面,Anthropic 并没有改变“大多数用途都从 Opus 5 开始”的说法,所以$5/$25 的 Opus 5 才是实际主战场的格局仍在延续。

② 知识的新鲜度是 Fable 5.1 领先。2026年6月,后面依次是 Opus 5(5月)、Astra(4月30日)、Gemini 3.8 Flash(3月)。不过在配合Web搜索的用法里,这个差距对实际工作几乎没有影响。截止日起作用的时候,是关掉搜索的时候。

③ 差出数量级的是价格。Gemini 3.8 Flash 的导入价格,在输入上大约是 Astra 的十三分之一。按“聪明程度”排会挤成一团,按“成本”排就以数量级分开——这就是2026年秋天的实际样貌,比上一代的比较那时候差距更明显。

8. 注意事项——本文没有刊出的数字

老实写在这里。本文里没有一些在别处解读中能看到的数字。

🟡 编码、数学方向的主要分数

DeepSWE、FrontierMath、ARC-AGI 的具体数值,因为没能追溯到发布方的页面所以没有刊登。数字一经确认就会补上。

🟡 各套餐的使用次数

“每5小时多少条”这样的数字在流传,但没能在官方帮助页面的记载中确认到。它也属于在推送期间会变动的那类数值

✅ 刊登了的内容

规格、价格、迁移时的变更点来自API文档和模型指南,安全性的数值来自Deployment Safety Hub。全都在发布方的页面上确认过。

还有一点。刚发布的信息是会动的。开放范围以天为单位变化,价格和限制也可能修订。本文是截至2026年9月的内容。

9. 按用途推荐——什么时候该选 Astra

Astra 适合的场景

长时间自主运行的工作。跨浏览器和业务软件的多步骤作业、终端作业、让它读取外部网页的智能体(因为对提示词注入的抵抗力提高了)。

先用 Opus 5 就够

想把单价压到一半的时候。在文字质量和一般编码上,在目前公开的范围内看不到决定性的差距。如果 Opus 5 够用,那样更省钱。

要跑量就用 Flash 系

以数量级见效的是价格。在大量处理摘要、分类、草稿的用途上,Gemini 3.8 Flash 的导入价格是压倒性的。也可以参考Gemini 的全貌

先免费试一遍

付费之前先确认手感。用各家的免费额度都摸一遍再决定也不迟。三家免费额度的比较

最后写一下最靠谱的决定方法。与其盯着基准测试的表格看,不如拿自己有代表性的10个任务,用相同的输入跑2~3个模型来得快。花掉的时间、账单的金额,还有跑出来的东西的质量。这三样亲眼看过,就会得到比任何表格都更准确的答案。

FAQ

Q1. GPT-6 Astra 现在已经能用了吗?

API 从2026年9月3日起正式开放,没有门槛也不用排队。ChatGPT 侧是逐步推送,Pro、Enterprise、Business Premium 可以在 ChatGPT Work 和 Codex 中使用。Plus 和 Business Standard 也在范围内,但 OpenAI 公告说推送可能需要几天。

Q2. 明明是 ChatGPT Plus,模型列表里却没有它。

很可能是找错了地方。Plus 能用的是 ChatGPT Work 和 Codex,常规聊天界面的模型列表里不会出现。请确认那边的模型选择。另外,OpenAI 最初的公告是“几天之内面向全部 Plus 用户”,但在发布5天之后的2026年9月8日,常规聊天里依然没有出现,OpenAI 的开发者论坛上已经有要求说明的帖子。也有报道称在常规聊天里使用需要 Pro,所以不能断定“等着就会来”。

Q3. 和 Claude Opus 5 相比,哪个更强?

取决于用途。而且在现阶段,靠公开的数值无法断定优劣。因为 OpenAI 和 Anthropic 在编码上用的是不同的基准测试(DeepSWE 系和 SWE-bench Verified),把两家的数字并排放的比较表并不成立。价格方面 Astra 是 $10/$50,Opus 5 是 $5/$25,Opus 5 更便宜。

Q4. 价格是 Opus 5 的两倍,实际真的会更贵吗?

看任务。OpenAI 说明“因为输出token大幅减少,每个任务的预估成本反而更低”,但这是自家的估算。大量发送简短回答的用途会原封不动地承受单价,用 xhigh 或 max 让它长考的话输出会变多。请拿自己有代表性的任务实测账单。

Q5. 从现有代码迁移时,什么会坏掉?

主要是4点。去掉 temperature、top_p 等采样类的参数;用 Responses API 而不是 Chat Completions;推理强度的 none 不能用了(官方指示从 low 开始比较);prompt_cache_retention 改成了 prompt_cache_options.ttl。最后一点如果被默默忽略,缓存不起作用而只有账单在涨,请特别注意。

Q6.“网络安全能力达到 Critical”,是说这个模型很危险吗?

它指的是 OpenAI 的 Preparedness Framework 中的能力等级,不是对危险性的判定。Astra 是首个达到该等级的模型,因此 OpenAI 按用途划了线。对安全代码审查、打补丁等防御侧的工作会响应,但像编写概念验证代码这类偏攻击的请求会拒绝。反过来说,作为被攻击的一方它变结实了,间接提示词注入的攻击成功率从 GPT-5.6 Sol 的 27.0% 降到了 8.5%。

Q7. 100万token的上下文,是不是用得越多越划算?

不是。输入超过 272,000 token 会加价,输入和缓存翻倍,输出变成1.5倍。比起把冗长的上下文整个塞进去,挑出需要的部分再传过去更便宜的场合更多。

参考来源

本文的数值全部是在下列发布方的页面上确认过的。不包含从综述文章抄来的内容。