2026年7月8日,OpenAI 面向全球发布了刷新 ChatGPT 语音体验的新模型 “GPT-Live”(OpenAI 官方公告)。这是先于次日9日 GPT-5.6 正式开放之前的发布,其最大特点是“边听边说、可同时进行”的全双工(full-duplex)架构。

此前的 AI 语音都是“等你说完再回应”的轮流制。GPT-Live 则像人类对话一样,会附和、能接住打断、不会打断你思考时的沉默。本文将基于官方公告,讲解 GPT-Live 究竟是什么、与传统 Advanced Voice Mode 有何不同、如何运作、哪些套餐可用,以及目前还做不到什么。

截至 2026 年 9 月 25 日的补充:发布之后,后台使用的模型和语音用量上限有了变化(9 月 9 日),API 开始正式提供(9 月 10 日),ChatGPT Work 也支持了语音(9 月 23 日)。本文保留发布时的说明,并对与现在不同的地方加上日期重写(出处:OpenAI 发布说明、ChatGPT Voice 帮助文章、API 更新日志)。

FULL-DUPLEX VOICE · 2026

轮流制的终结

— 边听边说,走向像人一样的对话

全双工
听与说同时进行
可附和、可打断
人类评估
明显比 Advanced Voice Mode 更受青睐
以 5–10 分钟对话对比
2款模型
Live-1 / Live-1 mini
免费也能用 mini
委托
搜索和深度推理交给另一个模型
后台模型随新模型推出而更新

1. GPT-Live 是什么——“边听边说”的全双工语音

GPT-Live 是承担 ChatGPT 语音对话的全新语音模型系列。它以替代传统语音功能(Advanced Voice Mode)的形式,从2026年7月8日起在 ChatGPT 的 iOS、Android 与 Web 端面向全球推出。

其核心在于“全双工(full-duplex)”这一设计。就像打电话一样,在处理输入(你的声音)的同时,持续生成输出(AI 的声音)。因此——

  • 在你说话的过程中,能返回“嗯嗯”“原来如此”之类的附和
  • AI 说到一半时你打断它,它也会认真听并调整方向
  • 你思考而陷入沉默时,它不会误判为“说完了”而打断你

简而言之,GPT-Live 实现的是没有“排队等待”的实时对话。

2. 与传统 Advanced Voice Mode 有何不同

此前的 AI 语音(Advanced Voice Mode)是轮流制(半双工)。受机制所限,它有这样一些弱点。

维度传统:Advanced Voice Mode新:GPT-Live
基本方式轮流制(半双工)——等你说完全双工——边听边同时说
说完的判定基于静音(沉默)不等明确的停顿——边听边跟踪停顿、打断与语速变化,当场判断
思考的沉默容易误判为“结束了”而打断不打断,能等待
附和基本没有会返回“mhmm”“yeah”等
打断有时会被不自然地切断接住并进行调整
判断频率以轮次为单位每秒多次(说/听/留白/打断/调用工具)

据 OpenAI 称,在由人类对5~10分钟同等条件对话进行评价的对比中,GPT-Live-1、GPT-Live-1 mini 都明显比 Advanced Voice Mode 更受青睐。此外,在 GPQA(专业科学推理)、BrowseComp(智能体式 Web 检索)以及客户支持类任务上也报告了改进。

3. 工作原理——每秒的判断与委托给后台模型

GPT-Live 在连续处理语音输入的同时生成语音输出,并每秒多次判断“此刻该怎么做”——是说,还是继续听,是留白,是打断,还是调用工具。这种高频次的决策,造就了像人一样的节奏感。

另一项重要设计在于“把深度处理委派给后台模型”。对话的即时响应由 GPT-Live 承担,而当需要 Web 检索、深度推理或复杂作业时,就在后台把处理交给更大的模型(发布时为 GPT-5.5),出结果后再回到对话中。这是一套让对话不中断的同时兼顾“思考”的机制。

OpenAI 在发布公告中写道“随着我们推出新的前沿模型,会持续更新 GPT-Live 所用的模型”,实际上自 2026 年 9 月 9 日起,语音也改用 GPT-5.6 或 GPT-6 Astra(OpenAI 发布说明)。也就是说,后台模型的名字还会不断变化。值得记住的不是名字,而是“负责对话的角色”和“负责思考的角色”是分开的这一结构。回答有多聪明取决于后台模型,说起话来是否顺畅取决于 GPT-Live。

发布时,推理深度是在 Instant(GPT-5.5 Instant)/ Medium / High(GPT-5.5 Thinking)三档里选。这套语音专用的三档已于 2026 年 9 月 9 日废止,现在要用与文字聊天相同的控件来选择模型和推理强度(可选范围取决于套餐,OpenAI 发布说明)。轻松闲聊求快、复杂咨询让它多想,这种用法本身没有变。

4. 两款模型与分套餐提供

套餐发布时(2026 年 7 月 8 日)截至 2026 年 9 月 25 日(Chat 中的语音,每 24 小时)
免费版GPT-Live-1 miniGPT-Live-1 mini(有限额度,上限可能变化)
GoGPT-Live-1GPT-Live-1 mini 3 小时
PlusGPT-Live-1GPT-Live-1 3 小时
ProGPT-Live-1$100 套餐 15 小时,$200 套餐不限(GPT-Live-1)
Business / Enterprise / Edu不提供视工作区设置可用。Business Standard 为 3 小时、Premium 为 15 小时,超出部分每分钟消耗 1.25 点数

要点是:免费套餐也能用 mini 版 GPT-Live。自然的全双工对话并不限于付费用户。发布时 Go/Plus/Pro 默认是 GPT-Live-1,但自 2026 年 9 月 9 日起 Go 改为 GPT-Live-1 mini,Plus 和 Pro 达到语音上限后也不再切换到 mini(OpenAI 发布说明)。发布时不在范围内的 Business、Enterprise、Edu 工作区,现在也可以视设置使用(OpenAI Help)。可在 ChatGPT 的 iOS、Android 和 ChatGPT.com 上使用,在全球分阶段推送。上限数值会调整,使用前请先查看帮助文章里的表格。

5. 主要进化点

🗣️ 附和(反向通道)

在你说话时回应“嗯嗯”,让人产生被倾听的感觉。

⏱️ 快速的你来我往

每秒多次判断是开口还是继续听,回应跟得上对话节奏。OpenAI 的发布文章和模型页面都没有给出延迟数值。

✋ 跟随打断

在话说到一半时打断,它也会听并修正内容方向。

🤫 不打断沉默

不会把思考的停顿误判为“说完了”,而是耐心等待。

6. 当前的限制——如实说明

期待容易跑在现实前面,所以也要坦白说清它做不到什么。下面把发布时的限制分成“现在仍然存在”和“已经解决”两类(截至 2026 年 9 月 25 日)。

  • 🟡 不支持视频和屏幕共享:与发布时相同,Live 不处理视频输入和屏幕共享(OpenAI Help)。需要时,请在 iOS 或 Android 应用里切换到旧的 Advanced 语音。
  • 🟡 完整的多语言支持还要等:发布时 OpenAI 写道,GPT-Live 针对最常用的语言做了优化,部分语言可能有非母语口音或不够流利。
  • 🟡 面向一对一对话:还没有针对多人同时说话进行优化,有时会对人与人之间的对话作出反应(OpenAI Help)。
  • 🟢 API 已经提供:发布时是“即将推出”,2026 年 9 月 10 日已正式提供(详见第 8 章)。
  • 🟡 分阶段推送:能用哪些功能、何时能用,取决于套餐、地区、工作区设置和应用版本。

这些预计会在后续更新中扩展,但需要理解的是“视频与屏幕并非现在就能用”这一点。

7. 适用场景

  • 免提的咨询与自我梳理:一边走路、一边作业,把想法说出来加以整理。因为沉默不会被打断,思路不易中断。
  • 外语会话练习:有了附和与自然的打断,可以进行更接近真实对话的练习。
  • 用语音做调研和总结:深度搜索会委托给后台模型,所以可以边聊边查资料。
  • 开口就能派活:自 2026 年 9 月 23 日起,在 web 和手机端的 ChatGPT Work 里也能用语音说话,请它制作文档、幻灯片和表格。挂断通话时若任务还没完成,会转为文字继续(需要同时有 Voice 和 Work 的使用权限,OpenAI 发布说明)。
  • 无障碍:在打字不便的场景下,节奏良好的语音界面很有帮助。

OpenAI Help 里也写了具体的使用技巧。

  • 想边想边说,就先打招呼:对话一开始就说“等我让你回答时再回答”,它就会等着。不过长时间沉默或周围的声音仍可能让它开口。
  • 老被打断就换个环境:戴耳机、换到安静的地方、调高设备音量。iPhone 上可以打开控制中心,选择“麦克风模式”,开启“语音突显”。
  • 想要口述成文就用听写:语音对话的文字记录不是逐字稿,可能与实际说的话不一致。想先检查、修改再发送时,听写(Dictation)比语音对话(Voice)更合适。
  • 了解录音如何处理:音频片段与聊天记录一起保存,保留 30 天。只有你自己开启共享时,片段才会被用于训练(Business、Enterprise、Edu 无法共享)。文字记录是否被使用,取决于“为所有人改进模型”的设置。

8. API 提供状况与 GPT-Realtime 的区别

发布时 GPT-Live 的 API 是“即将推出”,开发者和企业只能登记等待通知。之后在 2026 年 9 月 10 日,它在 API 中正式提供(OpenAI API 更新日志)。根据 2026 年 9 月 25 日的模型页面,模型 ID 是 gpt-live-1,通过专用的 Live 端点(v1/live/sessions)使用,语音会话每分钟 $0.05(按秒计费)。后台思考的模型和工具另行计费。

在 API 中也和 ChatGPT 一样,由负责对话的 GPT-Live 和负责思考的后端分工组合。后端既可以交给 OpenAI 的模型来跑,也可以接入你自己的智能体或服务(官方指南)。权限检查以及涉及自家系统的处理,仍由应用一侧负责。

容易混淆,这里整理一下:API 里还有与 GPT-Live 不同的语音模型 GPT-Realtime-2.1 / GPT-Realtime-2.1 mini(2026 年 7 月 6 日提供),它们是在 Realtime API 上使用、支持推理和工具调用的语音模型。两者的构造不同:GPT-Live=边听边说、把思考交给后端的全双工对话角色,GPT-Realtime=基于 Realtime API 的语音智能体基础。该选哪个,OpenAI 的语音智能体指南里有比较。

总结

  • GPT-Live 是把 ChatGPT 的语音从“轮流制”变为全双工(边听边说)的新模型(2026年7月8日,全球)。
  • 凭借附和、打断、容许沉默,实现接近人类的对话节奏。比 Advanced Voice Mode 明显更受青睐。
  • 对话的即时响应由 GPT-Live 负责,深度推理和搜索委托给后台模型(发布时是 GPT-5.5,2026 年 9 月 9 日起为 GPT-5.6 或 GPT-6 Astra)。
  • 免费版和 Go 用 GPT-Live-1 mini,Plus 和 Pro 用 GPT-Live-1(截至 2026 年 9 月 25 日)。Business、Enterprise、Edu 也可视设置使用。可在 ChatGPT 的 iOS/Android/Web 上使用。
  • 现有限制:不支持视频和屏幕共享,完整的多语言支持尚未实现。API 已于 2026 年 9 月 10 日正式提供(每分钟 $0.05)。GPT-Realtime-2.1 是另一条 API 语音模型产品线。

FAQ

Q1. GPT-Live 免费也能用吗?

可以。免费套餐能有限地使用 GPT-Live-1 mini。截至 2026 年 9 月 25 日,Go 也是 GPT-Live-1 mini(每天最多 3 小时),Plus 和 Pro 则是更高一级的 GPT-Live-1。可在 ChatGPT 的 iOS、Android 和 Web 上使用(分阶段推送)。

Q2. “全双工”具体是什么?

是像打电话一样能同时进行听与说的方式。与传统的轮流制(等你说完再回应)不同,它能在你说话时返回附和、接住打断,也能不打断你思考的沉默、耐心等待。

Q3. 与传统 Advanced Voice Mode 最大的不同是什么?

是判定“说完”的方法。传统方式基于静音(沉默),容易把思考的停顿误判为“结束了”而打断。GPT-Live 则不等明确的停顿,边听边跟踪停顿、打断与语速变化,每秒多次判断是回应还是继续听(OpenAI 系统卡),因此更不易被打断、更自然。在人类评价中也明显更受青睐。

Q4. 难题它也能回答吗?

可以。对话的即时响应由 GPT-Live 负责,需要网页搜索或深度推理时,会把处理委托给后台模型,再把结果带回对话。发布时后台模型是 GPT-5.5,自 2026 年 9 月 9 日起改用 GPT-5.6 或 GPT-6 Astra,模型和推理强度用与文字聊天相同的控件来选。

Q5. 能进行视频或屏幕共享吗?

截至 2026 年 9 月 25 日仍然不行。Live 不支持视频和屏幕共享,需要时请在 iOS 或 Android 应用里切换到旧的 Advanced 语音(OpenAI Help)。OpenAI 在发布时表示正在努力加入这些功能。

Q6. 能通过 API 接入我自己的应用吗?

可以。GPT-Live 的 API 已于 2026 年 9 月 10 日正式提供,模型 ID 为 gpt-live-1,价格为语音会话每分钟 $0.05(后台模型和工具另计)。另外还有别的产品线 GPT-Realtime-2.1 / mini,可以根据你更看重对话的自然程度,还是想沿用现有的 Realtime API 来选择。

Q7. 与谷歌的 Gemini Live 相比如何?

谷歌的 Gemini Live 可以在对话时共享摄像头画面或手机屏幕(Gemini Live 帮助)。截至 2026 年 9 月 25 日,GPT-Live 不支持视频和屏幕共享,所以想一边展示眼前的画面一边对话的话,Gemini Live 占优。OpenAI 为 GPT-Live 强调的优势是全双工对话的自然度:边听边给出回应,话说到一半被打断也能接住,你思考时的沉默也会耐心等待。OpenAI 没有公布延迟数值,因此无法比较回应速度。详情也可参阅GPT-5.6 vs Gemini 对比。

相关文章

若要把已有 MP3 或 M4A 附加到对话,请参阅 ChatGPT 音频上传指南,了解支持格式、付费套餐、逐字稿核对方法、API 单独计费和存储注意事项。