目录
- 1. GPT-6 Sol 和 Luna 是什么——发布日期、规格与定位
- 2. 在哪里能用——Work、Codex 和 API,常规 Chat 里没有
- 3. 价格——“Astra 的五分之一和百分之一”只在 token 数相同时成立
- 4. 官方建议——Sol 从 Medium、Luna 从 High、Astra 从 Light 开始
- 5. OpenAI 自己的数字——Sol xhigh 胜过 Astra low 的那项评测
- 6. 第三方的数字——Artificial Analysis 的对比
- 7. 我们的小规模实测——短任务用便宜的设置就够了
- 8. 按自己的工作来选——判断的分界点在哪里
- FAQ
2026年9月22日(美国时间;日本时间为9月23日凌晨),OpenAI 发布了 GPT-6 Sol 和 GPT-6 Luna(OpenAI 的公告)。它们与9月3日推出的顶级模型 GPT-6 Astra 同属一条训练路线,是更快、更便宜的模型。
本文尤其写给目前在 Codex 或 ChatGPT Work 里用 Astra low(应用里显示为“Light”)的人。先说结论:统一用 Astra low 并不算错。不过 OpenAI 自己按用途给出的建议是:日常工作和复杂编程用 Sol,定义明确的重复性工作用 Luna,最难的工作用 Astra;而“Astra 从 Light 开始”的意思是“如果用 Astra,就先从 Light 起步”,并不是建议把所有工作都交给 Astra。
文中的数字按发布方分开写:OpenAI 的评测、Artificial Analysis 的第三方评测,以及我们自己做的小规模测试,方法和题目完全不同。
GPT-6 Sol / GPT-6 Luna
2026年9月22日发布(美国时间)/ API、ChatGPT Work、Codex
1. GPT-6 Sol 和 Luna 是什么——发布日期、规格与定位
按 OpenAI 的介绍,Sol 面向复杂编程和智能体工作流,Luna 是它效率最高的模型,用于目标明确、数量庞大的工作。公告把这次发布定位为:把 Astra 的长处(专业工作、事实准确性、编程和电脑操作)带到更快、更实惠的模型上;同时也写明,要求最高、风险最大的项目仍然需要 Astra 的深度。
| 项目 | GPT-6 Sol | GPT-6 Luna | 参考:GPT-6 Astra |
|---|---|---|---|
| 模型ID | gpt-6-sol | gpt-6-luna | gpt-6-astra |
| 上下文 | 1,050,000 | 1,050,000 | 1,050,000 |
| 最大输入 / 最大输出 | 922,000 / 128,000 | 922,000 / 128,000 | 922,000 / 128,000 |
| 知识截止 | 2026年4月20日 | 2026年5月18日 | 2026年4月30日 |
| 推理强度(API) | none 至 max(默认 medium) | none 至 max(默认 medium) | low 至 max(没有 none) |
| 输入 / 输出 | 文本、图像 / 文本 | 文本、图像 / 文本 | 文本、图像 / 文本 |
出处:OpenAI API 文档中的模型页面(Sol、Luna、Astra)。确认日期:2026年9月24日。
意外的是知识截止:Luna(5月18日)比 Astra(4月30日)更新。不过如果配合联网搜索使用,这点差别几乎没有影响(主要 AI 模型的知识截止日期)。
给开发者提个醒。Sol 和 Luna 在 API 中接受 none(不推理),但在 Chat Completions 里使用函数调用时必须设为 none;内置工具和函数调用,OpenAI 建议改用 Responses API。
2. 在哪里能用——Work、Codex 和 API,常规 Chat 里没有
把公告和 Models、Pricing 两个页面合起来看,情况如下。入口是 ChatGPT Work 和 Codex;常规聊天界面(Chat)里不会出现这两个模型。
在 ChatGPT Work 和 Codex 中可用 Sol 和 Luna。从发布当天开始,在一天之内逐步开放;如果还看不到,OpenAI 建议稍后再查看。Enterprise 和 Edu 可能需要管理员启用 Luna。
只有 Luna,而且只在桌面应用中(标准速度,按开放进度提供)。不含 Sol。
以 gpt-6-sol 和 gpt-6-luna 提供,按用量计费。
不可用。公告说目前尚未在 Chat 中提供,Models 页面也写明可在 Work 和 Codex 中使用,但 Chat 中没有。
旧模型不会马上消失。Models 页面说明,GPT-5.6 Sol、Terra 和 Luna 在过渡期内仍可使用。另一方面,GPT-5.5 将于2026年10月14日从 ChatGPT、ChatGPT Work 和 Codex 下线(API 不受影响),页面给出的替代是:付费套餐(Plus、Pro、Business、Enterprise、Edu)换成 Sol,Free 和 Go 的桌面应用换成 Luna。如果在配置文件或定时任务里写了 gpt-5.5,需要在那之前改掉(ChatGPT Models)。
3. 价格——“Astra 的五分之一和百分之一”只在 token 数相同时成立
| 模型 | API 输入 | 缓存输入 | API 输出 | Codex 积分(输入 / 缓存 / 输出) |
|---|---|---|---|---|
| GPT-6 Astra | $10 | $1 | $50 | 250 / 25 / 1,250 |
| GPT-6 Sol | $2 | $0.20 | $10 | 50 / 5 / 250 |
| GPT-6 Luna | $0.10 | $0.01 | $0.50 | 2.5 / 0.25 / 12.5 |
每100万token,标准速度。出处:OpenAI API 文档中的模型页面,以及 ChatGPT / Codex Pricing。确认日期:2026年9月24日。
每一行都是Sol 恰好为 Astra 的五分之一,Luna 为百分之一,Codex 积分也是同样的比例。OpenAI 把相对上一代的降价说成比 GPT-5.6 的促销价低50%,但严格来说,Sol 的输入和输出都是半价,而 Luna 输入是半价,输出是 $1.20 → $0.50(降了约58%)。
单价之比不等于一项工作的费用之比。账单是单价 × 实际用掉的 token,而便宜的模型有时会想得更久、输出更多。在 Artificial Analysis 的第三方实测中(第6节),Luna high 每个任务用掉的输出 token 约为 Astra low 的5倍,每个任务的费用是约二十七分之一,而不是百分之一。Sol medium 同样是约三分之一,而不是五分之一。
这些比例只适用于 token 数相同的算术。例如输入10万 token(其中8万命中缓存)、输出1万 token 时,API 费用为 Astra $0.78、Sol $0.156、Luna $0.0078。另有几个条件:输入超过272,000 token 时,输入和缓存输入的单价翻倍,输出变为1.5倍;API 的缓存写入按输入单价的1.25倍计费(Codex 积分不单独收写入费);Fast 模式在 API 中是2倍,在 Codex 积分中是2.5倍。
单价说明不了订阅套餐能用多少
通过 ChatGPT 套餐使用时,不能说 Sol 能用的量是 Astra 的5倍、Luna 是100倍。Codex 自己的价格页面就写着:订阅包含多少用量,不是只由积分单价决定的。
同一页面给出了每5小时消息数的大致范围。Plus 为 Astra 5–45 条、Sol 15–150 条、Luna 350–3,000 条。下限对下限、上限对上限比较,Sol 约为 Astra 的3倍,Luna 约为67–70倍,和单价推出来的5倍、100倍对不上。此外 OpenAI 还注明,这些不是固定上限,同类任务的消耗也会因模型、上下文、推理、工具使用和缓存而不同。自己的工作到底能用多少条,只能看用量界面。
4. 官方建议——Sol 从 Medium、Luna 从 High、Astra 从 Light 开始
关于该用哪个模型,OpenAI 的 Models 页面给了明确的指引。归纳如下:
横跨代码、应用和调研、需要一路保持判断力的长时间工作。起点:Light(设置值 low)。
模糊、困难、价值高的工作(复杂的代码修改、深入调研、需要打磨的文档)。起点:Medium。范围窄的任务,要给它清楚的完成标准。
知道好结果长什么样的大批量工作(抽取、分类、转换、固定格式的摘要)。起点:High。
这里有三样东西容易混淆。
- 按用途的起点:上面的“Sol 从 Medium、Luna 从 High、Astra 从 Light 开始”。
- 应用的默认预设:桌面应用和网页版的 Power 预设共6个——Luna High、Sol Light、Sol Medium、Astra Light、Astra Medium、Astra Extra High,默认选中的是 Sol Light(部分付费套餐没有 Astra Extra High)。
- API 的默认值:Sol 和 Luna 都是
medium。
三者各不相同,但并不矛盾。默认预设是“先求快、先求轻”;按用途的建议是“要在这类工作上拿到结果,该从哪里起步”。OpenAI 还说明,推理强度的档位在不同世代之间并不一一对应,建议先用较低的设置跑熟悉的任务,再逐步调整。不能拿“GPT-5.6 Sol 开 high”的手感去给新的 Sol 选设置。和上一代的比较,可参考Astra low 与 GPT-5.6 Sol high 的实测对比(那是与本文 GPT-6 Sol 不同的模型)。
怎么理解“Astra 从 Light 开始”。这是已经决定用 Astra 之后的起点,并不是说所有工作都该交给 Astra。如果想省去切换的麻烦、把能力放在第一位,统一用 Astra low 是合理的选择。但把用量上限和等待时间都算进去之后是否最优,是另一个问题;如果在意这一点,就值得考虑和 Sol、Luna 分工。
5. OpenAI 自己的数字——Sol xhigh 胜过 Astra low 的那项评测
OpenAI 的公告里,把 Sol 和 Astra 放在一起比较的数字只有一个:AutomationBench 1.0.6,一项评测跨业务应用工作流的基准。
| 模型(推理强度) | 得分 | 每个任务的费用 |
|---|---|---|
| GPT-6 Sol(xhigh) | 33.2% | $0.27 |
| GPT-6 Astra(low) | 30.3% | Sol 的3.9倍 |
| Claude Opus 5(max) | 26.9% | Sol 的11.1倍 |
出处:OpenAI 公告中的表格(厂商自己的评测)。
仅就这项评测而言,让 Sol 多想一些,就能以约四分之一的费用超过 Astra low。不过要注意,比较用的是 xhigh 的 Sol,而不是 medium 或 low。OpenAI 给出的其他数字如下:
- DeepSWE v1.1(在真实代码库中做软件开发):Sol max 68.8%,Luna max 66.6%。
- Agents' Last Exam(长时间的专业任务):Sol max 56.4%。
- OSWorld 2.0 offline(操作电脑):Sol xhigh 60.5%。OpenAI 自己也说,电脑操作仍然是 Astra 最强。
- 事实准确性:在一项用用户标记过错误的历史对话构建的内部评测中,Sol 的错误约为上一代(GPT-5.6 Sol)的一半。
读这些数字时有两点要留意。事实准确性评测是专门收集容易出错的对话,OpenAI 自己也注明它不代表一般用法。OpenAI 还说明,这些评测是在研究环境或通过 API 进行的,ChatGPT 正式产品使用不同的系统指令和工具,输出可能略有差异。不能把“错误减半”直接套到自己的日常工作上。
6. 第三方的数字——Artificial Analysis 的对比
独立评测机构 Artificial Analysis(下称 AA)发布了把 Sol low、Sol medium、Luna high 分别与 Astra low 对比的页面。下表取自这三个页面的数值;Astra low 的数值在三个页面上完全相同。
| 设置 | Intelligence Index | Terminal-Bench 4.0 | AutomationBench-AA | 每个任务的费用 | 每个任务的时间 |
|---|---|---|---|---|---|
| Astra low | 46 | 42% | 59% | $0.82 | 97.18秒 |
| Sol medium | 40 | 19% | 58% | $0.25 | 59.99秒 |
| Sol low | 34 | 9% | 54% | $0.13 | 34.98秒 |
| Luna high | 32 | 5% | 48% | $0.03 | 146.71秒 |
出处:Artificial Analysis 的对比页面(Sol medium 对 Astra low、Sol low 对 Astra low、Luna high 对 Astra low)。Intelligence Index v4.3.2(10项评测)。确认日期:2026年9月24日。表中数值可能会更新。
这张表里有三点值得注意。
在 Terminal-Bench 4.0 上,Astra low 为42%,Sol medium 为19%,Luna high 为5%。在以终端为主的高难度开发中,找不到全面替换 Astra 的依据。
在 AutomationBench-AA 上,Sol medium 为58%,Astra low 为59%,每个任务的费用约为三分之一。差距大小因评测而差别极大。不要把综合指数的差距换算成“聪明百分之几”。
Luna high 的费用约为 Astra low 的二十七分之一,但每个任务要146.71秒,比 Astra low 的97.18秒还长,因为它花了更多 token 去思考。
AA 的每任务时间是根据输出速度算出的生成时间,不含等待首个响应的时间和前后的其他处理。它和在你自己的环境里完成一项工作所需的时间不是一回事。在 AA 的知识准确性指标(AA-Omniscience)上,Astra low 为41,Sol low 和 medium 都是27,Luna high 为−6,差距很大,说明只看价格就选 Luna,去回答没有提供资料的事实性问题是有风险的。
7. 我们的小规模实测——短任务用便宜的设置就够了
AI Arte 也用 Codex CLI 做了一次小规模测试。这不是给模型排名次的测试。先说明条件。
任务:(1) 写一个函数,处理重复 ID 的取舍、时间戳相同时的决胜、缺失行等情况(运行24个用例评分);(2) 按资料给8条说法分类,用不同的分母计算错误率,并写一段160字以内的建议(按12项评分)。没有使用 AI 评分。
局限:没有清除缓存,大部分输入(约11,000–12,000 token)是从缓存读取的。评分代码是在拿到回答之后写的,不是预先登记的测试。
| 设置 | 通过 | 时间中位数 | 平均输出 token(含思考) | 每次的 API 换算费用(平均) |
|---|---|---|---|---|
| Astra low | 4/4 | 10.33秒 | 184.75 | $0.0447 |
| Sol low | 4/4 | 7.96秒 | 175.50 | $0.0086 |
| Sol medium | 4/4 | 10.28秒 | 266.25 | $0.0095 |
| Luna high | 4/4 | 11.52秒 | 371.25 | $0.0006 |
时间从启动 CLI 算到退出。API 换算费用不是实际被收取的金额(测试在订阅套餐下进行;这是把官方 API 单价套到 CLI 报告的 token 数上得到的参考值)。
同一天5:47到5:49,我们又另外跑了一个日语任务——在多份资料中找出日期换算和计数的错误——预先定好12个评分项,每种设置跑2次。8次全部通过,时间中位数为 Sol low 9.65秒、Sol medium 13.29秒、Astra low 13.48秒、Luna high 17.32秒(任务和时间段都与上表不同,所以没有把平均值混在一起)。
这只能说明:对于答案可以核对的短任务,存在 Sol low 或 Luna high 就够用的情况。所有设置都通过,是因为任务简单,并不能证明各模型能力相同。独立任务只有3个,每种设置分别跑了4次和2次。修改现有仓库、设计、长文写作和长时间自主工作都没有测。另外,剩余用量的显示只到整数百分比,而且与其他工作共用,所以这次测试看不出各模型消耗了多少用量上限。
尽管如此,还是能看到两点。Sol low 比 Astra low 完成得更快,API 换算费用约为五分之一。另一方面,Luna high 的 API 换算费用最低,但用时比 Astra low 更长——和 AA 表格里的规律一样。
8. 按自己的工作来选——判断的分界点在哪里
根据上面的内容(官方按用途的建议、AA 的评测和我们的小测试),下面这种分工比较实用。请把它当作建议的起点,而不是已经证明的最优解。
官方给的起点。在 AA 的业务工作流评测上比 Astra low 低1分,费用约为三分之一。对结果不满意,再升到 Astra。
要求范围窄、用测试或格式检查马上就能判断通过与否的工作。抽取、分类、转换用 Luna high。不过 Luna 并不快,嫌等得久就用 Sol low。
整体架构、原因不明的 bug、多份资料的相互核对、发布前的审查、以终端为主的开发。从 low 开始,如果出现遗漏或返工,再和 medium 及以上对比。
关键的判断标准是:这项工作的结果,你自己能不能马上核对。如果测试通过或格式正确就能说明问题,便宜的模型失败了也能立刻发现,重做的成本很低。反过来,对于错误要很晚才暴露的工作(设计决策、没有资料支撑的事实性写作、视觉质量),便宜模型带来的返工最终会比价差还贵。
如果你一直坚持用 Astra low:没有必要停下来。想试的话,稳妥的做法是只把新开的日常任务换成 Sol medium,试一周,比较需要返工的频率和用量上限下降的速度。重要工作中途的任务继续用 Astra,这样即使比较失败也不会影响正事。注意,修改配置文件里的默认值(config.toml 中的 model 和 model_reasoning_effort)只对新建的任务生效。已经建好的任务,要在各自输入框下方确认模型和推理强度。
最可靠的判断方法,是在自己有代表性的工作上做比较。从同样的初始状态出发,第一次的输出是否通过、修改了几次、自己最后检查花了几分钟?把这三项数一数,得到的答案会比任何表格都更适合你。
FAQ
Q1. GPT-6 Sol 和 Luna 现在能用了吗?
从2026年9月22日(美国时间)起,它们正在 Plus、Pro、Business、Enterprise 和 Edu 的 ChatGPT Work 与 Codex 中逐步开放。Free 和 Go 只能在桌面应用中使用 Luna。API 中以 gpt-6-sol 和 gpt-6-luna 提供。常规 Chat 中没有提供(依据截至2026年9月24日的官方页面)。
Q2. 我在用 Astra low,应该换成 Sol 吗?
并没有非换不可的理由。OpenAI 的建议是:日常工作和复杂编程用 Sol(从 Medium 开始),最难的工作用 Astra(从 Light 开始)。在 Artificial Analysis 的评测中,Sol medium 在业务工作流上只比 Astra low 低1分,但在终端工作上是19%对42%,差得很远。建议只在新开的日常任务上试 Sol medium,比较返工的频率。
Q3. Sol 的价格是 Astra 的五分之一,那能用的量是5倍吗?
不能这么说。API 单价和积分是五分之一,但 Codex 自己的价格页面写着,订阅的用量不是只由积分单价决定的。同一页面给出的 Plus 每5小时大致范围是 Astra 5–45 条、Sol 15–150 条,只有约3倍。而且这些不是固定上限,消耗会随工作内容变化。
Q4. Luna 最便宜,能什么都交给它吗?
它适合知道好结果长什么样的重复性工作(抽取、分类、转换、固定格式的摘要)。在 Artificial Analysis 的评测中,Luna high 每个任务的费用约为 Astra low 的二十七分之一,但用时更长,终端工作只有5%,知识准确性指标也大幅下降。不要只看价格,就把没有提供资料的事实性问题或长时间的自主开发交给它。
Q5. 应用默认选的是“Sol Light”,OpenAI 却说“Sol 从 Medium 开始”,这不矛盾吗?
不矛盾。Sol Light 是桌面应用和网页版 Power 预设的默认值,而“Sol 从 Medium 开始”是要在这类工作上拿到结果的起点。API 的默认值又是另一回事:Sol 和 Luna 都是 medium。简单的想法是:轻量工作保持默认,需要规划或分析的工作用 Medium 及以上。
Q6. GPT-5.6 Sol 和 GPT-5.5 会怎样?
GPT-5.6 Sol、Terra 和 Luna 在过渡期内仍可使用。GPT-5.5 将于2026年10月14日从 ChatGPT、ChatGPT Work 和 Codex 下线(API 不受影响),OpenAI 指定的替代是:付费套餐(Plus、Pro、Business、Enterprise、Edu)用 GPT-6 Sol,Free 和 Go 的桌面应用用 GPT-6 Luna。如果在配置文件或定时任务里写了 gpt-5.5,请在那之前改掉。
参考资料
本文的数字已于2026年9月24日在下列发布方的页面上核对,并结合了 AI Arte 自己的实测数据。
- OpenAI — Introducing GPT-6 Sol and Luna
定位、相对上一代的降价(Sol $4→$2 和 $20→$10,Luna $0.20→$0.10 和 $1.20→$0.50)、AutomationBench 1.0.6(Sol xhigh 33.2%、$0.27,Astra low 30.3%、3.9倍,Opus 5 max 26.9%、11.1倍)、DeepSWE v1.1(Sol max 68.8%、Luna max 66.6%)、Agents' Last Exam(Sol max 56.4%)、OSWorld 2.0(Sol xhigh 60.5%)、内部事实准确性评测及其注意事项、开放范围 - OpenAI Developer Community — GPT-6 Sol 和 Luna 的发布公告
发布时间(2026年9月22日 18:16 UTC)、在 Work、Codex 和 API 中的开放情况、Free 和 Go 的桌面版 Luna - OpenAI — GPT-6 Sol、GPT-6 Luna、GPT-6 Astra(API 文档)
模型ID、上下文、最大输入和最大输出、知识截止、推理强度及默认值、API 价格、超过272K 时的加价、缓存写入1.25倍、Fast 模式2倍 - ChatGPT — Models
按用途的建议(Sol 从 Medium、Luna 从 High、Astra 从 Light 开始)、6个 Power 预设及默认的 Sol Light、Chat 中不可用、GPT-5.6 在过渡期内可用、GPT-5.5 下线(2026年10月14日) - ChatGPT / Codex — Pricing
各套餐的开放情况、积分单价、单价不决定用量的说明、每5小时大致范围(Plus:Astra 5–45、Sol 15–150、Luna 350–3,000)、Fast 模式2.5倍 - Artificial Analysis — 对比页面(Sol medium 对 Astra low、Sol low 对 Astra low、Luna high 对 Astra low)
Intelligence Index v4.3.2、Terminal-Bench 4.0、AutomationBench-AA、AA-Omniscience、每个任务的费用、输出 token 和时间 - AI Arte 的实测(2026年9月24日,Codex CLI 0.155.0-alpha.16)
4种设置 × 2个任务 × 2次 = 16次,另加一个日语任务每种设置2次 = 8次。通过情况、时间、输出 token、API 换算费用
相关文章
- GPT-6 Astra 发布完全解读——顶级模型的价格、各套餐开放情况和基准测试
- GPT-6 Astra low 真的更便宜吗?——与上一代 GPT-5.6 Sol high 的实测对比
- GPT-5.6 发布完全解读——上一代的 Luna / Terra / Sol
- Claude Opus 5.5 发布——Anthropic 同一周推出的新模型
- 主要 AI 模型的知识截止日期——各模型的知识延伸到何时