2026 年 9 月 29 日补充:本文比较的是截至 2026 年 7 月的 GPT-5.6 Sol 与 Gemini 3.1 Pro。此后,OpenAI 于 9 月 3 日发布了 GPT-6 Astra,又于 9 月 22 日(美国时间)发布了作为本文比较对象 GPT-5.6 Sol 下一代的 GPT-6 Sol 和 GPT-6 Luna。截至 2026 年 9 月 30 日,其 API 模型列表建议:不确定从哪里开始时用 Astra,兼顾智能与成本用 9 月 29 日发布的 GPT-6.1 Sol(在 ChatGPT 中可在 Work 和 Codex 使用,聊天中没有;每百万 token 输入 $2、输出 $10),注重成本的大批量任务用 GPT-6 Luna(GPT-5.6 Sol 在过渡期内仍可使用)。Google 于 9 月 2 日全面开放了 Gemini 3.8 Flash,但 Gemini 3.1 Pro 在 API 上仍是预览版;本文称“尚未发布”的 Gemini 3.5 Pro,截至 9 月 22 日仍未出现在 Gemini API 的价格页和版本说明中。Anthropic 也于 7 月 24 日发布了 Claude Opus 5、9 月 1 日发布了 Claude Fable 5.1、9 月 22 日发布了 Claude Opus 5.5。费用方面请参阅实测比较 Astra(low)与 GPT-5.6 Sol(high)的文章。9 月 22 日,我们把 Gemini 3.1 Pro 的价格更正为 $2/$12,并把其 Terminal-Bench 成绩换成与 Sol 相同的 2.1 版数值(70.7%)。正文中的“旗舰”“现行”等说法和基准数值,除注明日期者外均为撰写时的情况。

OpenAI 的旗舰 GPT-5.6“Sol”(2026年7月9日正式提供)与 Google 的 Gemini。两者的对比,与此前的对 Claude 之战(vs Opus 4.8/vs Fable 5)局面截然不同。Sol 在智能体/终端编码上压倒性领先,Gemini 则以原生多模态和价格抗衡——两者的强项几乎不重叠。

此外还有一个重要的“时态陷阱”。Google 真正的对手 Gemini 3.5 Pro,在本文撰写时尚未正式提供(因架构全面重构而推迟至2026年7月中旬)。因此当前公正的比较对象,是现行的旗舰 Gemini 3.1 Pro。本文在明示这一前提的基础上,依据官方发布与独立基准测试,梳理两者的实力、价格、多模态以及按场景的选择方式。

FRONTIER FACEOFF · 2026

智能体 vs 多模态

— 强项几乎不重叠的两强

OPENAI
GPT-5.6 Sol
2026年7月9日 正式提供
Terminal-Bench 2.1: 88.8%
SWE-bench Pro: 64.6%
最大输出: 128K
价格: $5 / $30 per MTok
VS
GOOGLE
Gemini 3.1 Pro
2026年2月19日发布(现行 Pro)
Terminal-Bench 2.1: 70.7%
SWE-bench Pro: 54.2%
多模态: 支持语音、视频
价格: $2 / $12 per MTok

Sol: 终端、智能体编码压倒性领先 / Gemini: 以多模态和价格抗衡

1. 定位——“智能体之王 Sol”vs“多模态之王 Gemini”

GPT-5.6 Sol——终端、智能体编码的霸主

Sol 是 GPT-5.6(Luna/Terra/Sol)的旗舰型号。在自主操作终端的 Terminal-Bench 2.1 上达 88.8%,修复真实代码仓库的 SWE-bench Pro 上达 64.6%,在编码智能体领域大幅甩开 Gemini。GPQA Diamond 也以 94.6% 位居顶级(三项均为 OpenAI 评估表中的数值)。“能自主编写代码、操作终端的智能体”这一完成度是其武器(来源: OpenAI 官方发布、Vellum)。

Gemini 3.1 Pro——原生多模态与价格的巨人

Gemini 3.1 Pro 的武器,是不仅能处理文本、还能原生处理语音、视频的多模态能力、100万 token 的长上下文,以及约为 Sol 四成的单价。多语言知识问答 MMMLU 92.6%、ARC-AGI-2 77.1%(均为 Google 公布的数值),在通用知识与抽象推理上也很强。“用一个模型廉价而广泛地处理图像、语音、视频、文本”是 Gemini 的思路(来源: Google DeepMind、各类独立基准)。

2. 该和哪个 Gemini 比——3.5 Pro 尚未发布

在比较之前,需要准确把握 Gemini 现行的产品阵容。这里若判断错误,比较便无法成立。

✅ 现行旗舰 Pro
Gemini 3.1 Pro

2026年2月发布。本文的比较对象。多模态、长上下文、价格是其强项。

🟡 最新但属轻量档
Gemini 3.5 Flash

2026年5月发布的高速、低成本模型。并非旗舰 Sol 的正面对手(档次不同)。

🔴 未发布(本文时点)
Gemini 3.5 Pro

Google 真正的对手。因架构全面重构,预计2026年7月中旬 GA。截至今日尚未提供。

也就是说,若要在今日这个时点公正地比较“GPT-5.6 vs Gemini”,对手就是 Gemini 3.1 Pro。Sol 为2026年7月、Gemini 3.1 Pro 为2026年2月的模型,存在约5个月的代际差,阅读时需要打个折扣。而且一旦 Gemini 3.5 Pro 发布,尤其是编码方面的格局可能改变——请把本文当作“3.5 Pro 登场前的一张快照”来阅读。

3. 规格速查表

项目GPT-5.6 SolGemini 3.1 Pro
提供方OpenAIGoogle
发布2026年7月9日2026年2月19日
上下文长度1,050,000 tokens1,000,000 tokens
最大输出128,000 tokens64,000〜65,000 tokens
知识截止2026年2月16日官方未注明
API 价格$5 / $30 per MTok(自2026年8月21日起为期3个月的促销价为 $4 / $20)$2 / $12 per MTok(输入不超过 20 万 token;超过时为 $4 / $18)
模态文本+图像(语音为独立模型 GPT-Live)文本+图像+语音+视频(原生)
核心强项终端、智能体编码、数学、推理多模态、长上下文、价格、通用知识

* 价格、规格基于各公司官方发布。Sol 的 SWE-bench Pro(64.6%)来自 OpenAI 的 GPT-5.6 发布中的评估表;同一张表列出 Gemini 3.1 Pro 为 54.2%,与 Google 模型卡的数值一致,两款模型的 Terminal-Bench 2.1 数值也都出自这张表。与此同时,OpenAI 还发布了一份分析,认为 SWE-bench Pro 中约 30% 的任务存在缺陷。各基准的测量条件、时期不同,并非同一标准下的严格比较。

4. 基准测试详细对比

CODING & AGENT

编码/智能体方面 Sol 大幅领先

Terminal-Bench 2.1(终端自主操作)Sol 88.8% vs Gemini 70.7%
Sol
Gemini 3.1 Pro
SWE-bench Pro(真实代码仓库修复)Sol 64.6% vs Gemini 54.2%
Sol
Gemini 3.1 Pro
基准测试测量内容GPT-5.6 SolGemini 3.1 Pro胜者
Terminal-Bench 2.1终端的自主操作88.8%70.7%🥇 Sol
SWE-bench Pro真实代码仓库的缺陷修复64.6%54.2%🥇 Sol
GPQA Diamond研究生级 STEM 推理94.6%94.3%🤝 几乎持平
MMMLU多语言知识问答—92.6%—(Sol 未公布数值)
ARC-AGI-2抽象推理92.5%(2026年9月公布)77.1%🥇 Sol(测量方不同)
多模态(语音、视频)原生支持△(独立模型 GPT-Live)◎ 原生🥇 Gemini

编码/智能体是 Sol 的独角戏(Terminal-Bench +18pt、SWE-bench Pro +10pt,均为 OpenAI 评估表中同一版本的对比)。另一方面GPQA 几乎持平。ARC-AGI-2 上,OpenAI 在 2026年9月随 GPT-6 Astra 公布的 Sol 92.5%,高于 Google 为 Gemini 3.1 Pro 公布的 77.1%,但两者由不同机构测量。MMMLU 因 Sol 没有公布数值而无法比较。从基准看 Sol 占优,Gemini 的强项在于下文的多模态与价格。最终,选择与用途更接近的一方仍是正解。

5. 多模态——Gemini 的主战场

Gemini 最大的差异化在于“用一个模型即可原生处理语音、视频、图像、文本”。GPT-5.6 的文本模型本体只到图像输入,语音以独立模型 GPT-Live(全双工语音)分离提供。也就是说,在包含视频理解或语音的一体化工作流中,Gemini 在结构上更有利。

能拉开差距的具体用途: 视频内容的摘要与打标签、由语音+屏幕录制生成会议纪要、多模态客服支持、跨图像、视频、文本的检索。这些Gemini 用一个模型即可完成,而 GPT-5.6 往往需要多个模型(Sol+GPT-Live 等)的组合。

反过来,在纯粹的代码生成、终端智能体、长时间自主编码上则是 Sol 胜出。“输入输出以文本/代码为主,还是包含语音、视频”是最初的分岔点。

6. 实际成本——Gemini 单价约为 Sol 的四成

单价方面 Sol 为 $5/$30,Gemini 3.1 Pro 为 $2/$12(输入不超过 20 万 token;超过时为 $4/$18)。无论输入还是输出,Gemini 都约为 Sol 的四成。不过 Sol 处于自2026年8月21日起为期3个月的促销价($4/$20),这段时间里差距缩小到输入2倍、输出约1.7倍。在想以低成本处理大批量任务的用途上,Gemini 的成本优势会显现。

  • Gemini 占优:单价约为 Sol 的四成。输入超过 20 万 token 时 Gemini 升至 $4/$18,但仍低于 Sol。
  • Sol 一方的反驳:编码上 token 效率提升了 54%,在代码生成中输出量减少、实际成本差距会缩小的情况存在。加之若单个任务的成功率更高,返工成本上也可能实现反超。

结论是“重视便宜、多模态、通用则选 Gemini,重视编码成功率则选 Sol”。不只看单价,而是以“每完成一个任务的成本”来衡量,这一点与其他模型比较相同。若想在 GPT-5.6 一侧压低成本,不用 Sol 而用 Terra($2/$12),经 2026年7月30日的降价后,其单价与输入不超过 20 万 token 时的 Gemini 3.1 Pro 相同($2/$12)。

7. 强项、弱项一览图

STRENGTHS & WEAKNESSES

智能体之王 Sol,多模态之王 Gemini

GPT-5.6 SOL
◯ 强项
  • ·终端/智能体编码大幅领先
  • ·SWE-bench Pro、数学、GPQA 都很强
  • ·最大输出 128K,可一口气产出长成果
  • ·token 效率+54%(编码)
△ 弱项
  • ·语音、视频非原生支持(需独立模型)
  • ·单价约为 Gemini 的 2.5 倍
  • ·MMLU、SWE-bench Verified 等未公布
GEMINI 3.1 PRO
◯ 强项
  • ·连语音、视频都原生的多模态
  • ·单价约为 Sol 的四成
  • ·GPQA 与 Sol 几乎持平(94.3%)
  • ·Google Workspace 联动
△ 弱项
  • ·终端/智能体编码大幅落后
  • ·最大输出 64K〜,只有 Sol 的一半
  • ·代际偏旧(2026年2月,等 3.5 Pro)

8. 按使用场景选择

使用场景推荐模型理由
终端、自主编码智能体SolTerminal-Bench 88.8%、SWE-bench Pro 64.6%,大幅领先
真实代码仓库的缺陷修复、大 PRSol代码修复的成功率更高
数学、严格推理Sol数学占优,GPQA 持平
包含视频、语音的多模态处理Gemini一个模型即可原生支持到语音、视频
重视成本的大批量处理、长上下文Gemini单价约为 Sol 的四成。GPT 一侧的 Terra 价格相同
以 Google Workspace 为中心的业务Gemini生态系统联动顺畅

总结

  • GPT-5.6 Sol: 在终端/智能体编码上压倒性领先(Terminal-Bench 88.8% vs 70.7%、SWE-bench Pro 64.6% vs 54.2%)。数学、GPQA 也很强。不过语音、视频要靠独立模型,单价约为 2.5 倍。
  • Gemini 3.1 Pro: 连语音、视频都原生的多模态,单价约为 Sol 的四成。GPQA 几乎持平,但编码上大幅落后。
  • 时态提醒:Gemini 真正的对手 3.5 Pro 在本文时点尚未发布(原定7月中旬 GA,但截至2026年9月22日仍未提供)。登场后尤其编码格局可能改变。
  • 选择方式:编码/智能体=Sol,多模态/低成本/通用=Gemini。强项不重叠,因此选“与用途更接近的一方”。
  • 成本对策:若想在 GPT 一侧压低单价,不用 Sol 而用 Terra($2/$12),即与 Gemini(不超过 20 万 token 时 $2/$12)同价。

FAQ

Q1. GPT-5.6 Sol 和 Gemini,编码哪个更强?

Sol 明显更强。终端自主操作的 Terminal-Bench 2.1 为 88.8% 对 70.7%,真实代码仓库修复的 SWE-bench Pro 为 64.6% 对 54.2%(均为 OpenAI 评估表中的数值),均由 Sol 大幅领先。若用于自主编码智能体,Sol 是首选。

Q2. 为什么和“Gemini 3.1 Pro”比,而不是“3.5 Pro”?

因为Gemini 3.5 Pro 在本文撰写时尚未正式提供(因架构全面重构,预计2026年7月中旬 GA)。现行的旗舰 Pro 是 3.1 Pro,因此公正的比较对象是它。一旦 3.5 Pro 发布,尤其编码上的差距可能缩小。截至2026年9月22日,Gemini API 的价格页和版本说明中仍没有 3.5 Pro。

Q3. 多模态(语音、视频)哪个更擅长?

是 Gemini。用一个模型即可原生处理语音、视频、图像、文本。GPT-5.6 的文本模型只到图像输入,语音被分离到独立模型 GPT-Live。在视频理解或含语音的一体化工作流中,Gemini 在结构上更有利。

Q4. 成本哪个更便宜?

Gemini 3.1 Pro 的单价约为 Sol 的四成(输入不超过 20 万 token 时 $2/$12 对 Sol 的 $5/$30。Sol 处于自2026年8月21日起为期3个月的促销价 $4/$20 期间差距会缩小)。不过 Sol 在编码上 token 效率提升了 54%,代码生成时输出量减少、实际成本差距也可能缩小。若想在 GPT 一侧压低单价,不用 Sol 而用 Terra($2/$12),即与 Gemini(不超过 20 万 token 时 $2/$12)同价(2026年7月30日降价后)。

Q5. 推理、知识哪个更强?

研究生级 STEM 的 GPQA Diamond 为 94.6% 对 94.3%,几乎持平(Sol 的数值来自 OpenAI 评估表,Gemini 的来自 Google)。抽象推理的 ARC-AGI-2 上,OpenAI 于2026年9月公布的 Sol 92.5% 高于 Gemini 3.1 Pro 的 77.1%,但两者由不同机构测量。多语言知识问答 MMMLU(Gemini 92.6%)因 Sol 没有公布数值而无法比较。

Q6. 到底该选哪个?

按用途来定。代码生成、终端智能体、数学选 Sol,视频/语音的多模态、低成本、Google Workspace 联动选 Gemini。强项不重叠,因此不看综合分,而选“与自己主用途更接近的一方”才是正解。按任务分工同时使用两者也很有力。

Q7. 若把 Claude 也算进来会怎样?

在真实生产级编码上,Claude 阵营(Fable 5 的 SWE-bench Pro 在 OpenAI 评估表和 Anthropic 的系统卡中均为 80.0%)在某些场景也会超越 Sol。详情请参考Sol vs Claude Opus 4.8/vs Claude Fable 5。2026年,“按用途在 GPT/Claude/Gemini 之间分工”的多模型运用已成为标准。

相关文章