目录
2026年7月8日,OpenAI 面向全球发布了刷新 ChatGPT 语音体验的新模型 “GPT-Live”(OpenAI 官方公告)。这是先于次日9日 GPT-5.6 正式开放之前的发布,其最大特点是“边听边说、可同时进行”的全双工(full-duplex)架构。
此前的 AI 语音都是“等你说完再回应”的轮流制。GPT-Live 则像人类对话一样,会附和、能接住打断、不会打断你思考时的沉默。本文将基于官方公告,讲解 GPT-Live 究竟是什么、与传统 Advanced Voice Mode 有何不同、如何运作、哪些套餐可用,以及目前还做不到什么。
截至 2026 年 9 月 25 日的补充:发布之后,后台使用的模型和语音用量上限有了变化(9 月 9 日),API 开始正式提供(9 月 10 日),ChatGPT Work 也支持了语音(9 月 23 日)。本文保留发布时的说明,并对与现在不同的地方加上日期重写(出处:OpenAI 发布说明、ChatGPT Voice 帮助文章、API 更新日志)。
轮流制的终结
— 边听边说,走向像人一样的对话
1. GPT-Live 是什么——“边听边说”的全双工语音
GPT-Live 是承担 ChatGPT 语音对话的全新语音模型系列。它以替代传统语音功能(Advanced Voice Mode)的形式,从2026年7月8日起在 ChatGPT 的 iOS、Android 与 Web 端面向全球推出。
其核心在于“全双工(full-duplex)”这一设计。就像打电话一样,在处理输入(你的声音)的同时,持续生成输出(AI 的声音)。因此——
- 在你说话的过程中,能返回“嗯嗯”“原来如此”之类的附和
- AI 说到一半时你打断它,它也会认真听并调整方向
- 你思考而陷入沉默时,它不会误判为“说完了”而打断你
简而言之,GPT-Live 实现的是没有“排队等待”的实时对话。
2. 与传统 Advanced Voice Mode 有何不同
此前的 AI 语音(Advanced Voice Mode)是轮流制(半双工)。受机制所限,它有这样一些弱点。
| 维度 | 传统:Advanced Voice Mode | 新:GPT-Live |
|---|---|---|
| 基本方式 | 轮流制(半双工)——等你说完 | 全双工——边听边同时说 |
| 说完的判定 | 基于静音(沉默) | 不等明确的停顿——边听边跟踪停顿、打断与语速变化,当场判断 |
| 思考的沉默 | 容易误判为“结束了”而打断 | 不打断,能等待 |
| 附和 | 基本没有 | 会返回“mhmm”“yeah”等 |
| 打断 | 有时会被不自然地切断 | 接住并进行调整 |
| 判断频率 | 以轮次为单位 | 每秒多次(说/听/留白/打断/调用工具) |
据 OpenAI 称,在由人类对5~10分钟同等条件对话进行评价的对比中,GPT-Live-1、GPT-Live-1 mini 都明显比 Advanced Voice Mode 更受青睐。此外,在 GPQA(专业科学推理)、BrowseComp(智能体式 Web 检索)以及客户支持类任务上也报告了改进。
3. 工作原理——每秒的判断与委托给后台模型
GPT-Live 在连续处理语音输入的同时生成语音输出,并每秒多次判断“此刻该怎么做”——是说,还是继续听,是留白,是打断,还是调用工具。这种高频次的决策,造就了像人一样的节奏感。
另一项重要设计在于“把深度处理委派给后台模型”。对话的即时响应由 GPT-Live 承担,而当需要 Web 检索、深度推理或复杂作业时,就在后台把处理交给更大的模型(发布时为 GPT-5.5),出结果后再回到对话中。这是一套让对话不中断的同时兼顾“思考”的机制。
OpenAI 在发布公告中写道“随着我们推出新的前沿模型,会持续更新 GPT-Live 所用的模型”,实际上自 2026 年 9 月 9 日起,语音也改用 GPT-5.6 或 GPT-6 Astra(OpenAI 发布说明)。也就是说,后台模型的名字还会不断变化。值得记住的不是名字,而是“负责对话的角色”和“负责思考的角色”是分开的这一结构。回答有多聪明取决于后台模型,说起话来是否顺畅取决于 GPT-Live。
4. 两款模型与分套餐提供
| 套餐 | 发布时(2026 年 7 月 8 日) | 截至 2026 年 9 月 25 日(Chat 中的语音,每 24 小时) |
|---|---|---|
| 免费版 | GPT-Live-1 mini | GPT-Live-1 mini(有限额度,上限可能变化) |
| Go | GPT-Live-1 | GPT-Live-1 mini 3 小时 |
| Plus | GPT-Live-1 | GPT-Live-1 3 小时 |
| Pro | GPT-Live-1 | $100 套餐 15 小时,$200 套餐不限(GPT-Live-1) |
| Business / Enterprise / Edu | 不提供 | 视工作区设置可用。Business Standard 为 3 小时、Premium 为 15 小时,超出部分每分钟消耗 1.25 点数 |
要点是:免费套餐也能用 mini 版 GPT-Live。自然的全双工对话并不限于付费用户。发布时 Go/Plus/Pro 默认是 GPT-Live-1,但自 2026 年 9 月 9 日起 Go 改为 GPT-Live-1 mini,Plus 和 Pro 达到语音上限后也不再切换到 mini(OpenAI 发布说明)。发布时不在范围内的 Business、Enterprise、Edu 工作区,现在也可以视设置使用(OpenAI Help)。可在 ChatGPT 的 iOS、Android 和 ChatGPT.com 上使用,在全球分阶段推送。上限数值会调整,使用前请先查看帮助文章里的表格。
5. 主要进化点
在你说话时回应“嗯嗯”,让人产生被倾听的感觉。
每秒多次判断是开口还是继续听,回应跟得上对话节奏。OpenAI 的发布文章和模型页面都没有给出延迟数值。
在话说到一半时打断,它也会听并修正内容方向。
不会把思考的停顿误判为“说完了”,而是耐心等待。
6. 当前的限制——如实说明
期待容易跑在现实前面,所以也要坦白说清它做不到什么。下面把发布时的限制分成“现在仍然存在”和“已经解决”两类(截至 2026 年 9 月 25 日)。
- 🟡 不支持视频和屏幕共享:与发布时相同,Live 不处理视频输入和屏幕共享(OpenAI Help)。需要时,请在 iOS 或 Android 应用里切换到旧的 Advanced 语音。
- 🟡 完整的多语言支持还要等:发布时 OpenAI 写道,GPT-Live 针对最常用的语言做了优化,部分语言可能有非母语口音或不够流利。
- 🟡 面向一对一对话:还没有针对多人同时说话进行优化,有时会对人与人之间的对话作出反应(OpenAI Help)。
- 🟢 API 已经提供:发布时是“即将推出”,2026 年 9 月 10 日已正式提供(详见第 8 章)。
- 🟡 分阶段推送:能用哪些功能、何时能用,取决于套餐、地区、工作区设置和应用版本。
这些预计会在后续更新中扩展,但需要理解的是“视频与屏幕并非现在就能用”这一点。
7. 适用场景
- 免提的咨询与自我梳理:一边走路、一边作业,把想法说出来加以整理。因为沉默不会被打断,思路不易中断。
- 外语会话练习:有了附和与自然的打断,可以进行更接近真实对话的练习。
- 用语音做调研和总结:深度搜索会委托给后台模型,所以可以边聊边查资料。
- 开口就能派活:自 2026 年 9 月 23 日起,在 web 和手机端的 ChatGPT Work 里也能用语音说话,请它制作文档、幻灯片和表格。挂断通话时若任务还没完成,会转为文字继续(需要同时有 Voice 和 Work 的使用权限,OpenAI 发布说明)。
- 无障碍:在打字不便的场景下,节奏良好的语音界面很有帮助。
OpenAI Help 里也写了具体的使用技巧。
- 想边想边说,就先打招呼:对话一开始就说“等我让你回答时再回答”,它就会等着。不过长时间沉默或周围的声音仍可能让它开口。
- 老被打断就换个环境:戴耳机、换到安静的地方、调高设备音量。iPhone 上可以打开控制中心,选择“麦克风模式”,开启“语音突显”。
- 想要口述成文就用听写:语音对话的文字记录不是逐字稿,可能与实际说的话不一致。想先检查、修改再发送时,听写(Dictation)比语音对话(Voice)更合适。
- 了解录音如何处理:音频片段与聊天记录一起保存,保留 30 天。只有你自己开启共享时,片段才会被用于训练(Business、Enterprise、Edu 无法共享)。文字记录是否被使用,取决于“为所有人改进模型”的设置。
8. API 提供状况与 GPT-Realtime 的区别
发布时 GPT-Live 的 API 是“即将推出”,开发者和企业只能登记等待通知。之后在 2026 年 9 月 10 日,它在 API 中正式提供(OpenAI API 更新日志)。根据 2026 年 9 月 25 日的模型页面,模型 ID 是 gpt-live-1,通过专用的 Live 端点(v1/live/sessions)使用,语音会话每分钟 $0.05(按秒计费)。后台思考的模型和工具另行计费。
在 API 中也和 ChatGPT 一样,由负责对话的 GPT-Live 和负责思考的后端分工组合。后端既可以交给 OpenAI 的模型来跑,也可以接入你自己的智能体或服务(官方指南)。权限检查以及涉及自家系统的处理,仍由应用一侧负责。
总结
- GPT-Live 是把 ChatGPT 的语音从“轮流制”变为全双工(边听边说)的新模型(2026年7月8日,全球)。
- 凭借附和、打断、容许沉默,实现接近人类的对话节奏。比 Advanced Voice Mode 明显更受青睐。
- 对话的即时响应由 GPT-Live 负责,深度推理和搜索委托给后台模型(发布时是 GPT-5.5,2026 年 9 月 9 日起为 GPT-5.6 或 GPT-6 Astra)。
- 免费版和 Go 用 GPT-Live-1 mini,Plus 和 Pro 用 GPT-Live-1(截至 2026 年 9 月 25 日)。Business、Enterprise、Edu 也可视设置使用。可在 ChatGPT 的 iOS/Android/Web 上使用。
- 现有限制:不支持视频和屏幕共享,完整的多语言支持尚未实现。API 已于 2026 年 9 月 10 日正式提供(每分钟 $0.05)。GPT-Realtime-2.1 是另一条 API 语音模型产品线。
FAQ
Q1. GPT-Live 免费也能用吗?
可以。免费套餐能有限地使用 GPT-Live-1 mini。截至 2026 年 9 月 25 日,Go 也是 GPT-Live-1 mini(每天最多 3 小时),Plus 和 Pro 则是更高一级的 GPT-Live-1。可在 ChatGPT 的 iOS、Android 和 Web 上使用(分阶段推送)。
Q2. “全双工”具体是什么?
是像打电话一样能同时进行听与说的方式。与传统的轮流制(等你说完再回应)不同,它能在你说话时返回附和、接住打断,也能不打断你思考的沉默、耐心等待。
Q3. 与传统 Advanced Voice Mode 最大的不同是什么?
是判定“说完”的方法。传统方式基于静音(沉默),容易把思考的停顿误判为“结束了”而打断。GPT-Live 则不等明确的停顿,边听边跟踪停顿、打断与语速变化,每秒多次判断是回应还是继续听(OpenAI 系统卡),因此更不易被打断、更自然。在人类评价中也明显更受青睐。
Q4. 难题它也能回答吗?
可以。对话的即时响应由 GPT-Live 负责,需要网页搜索或深度推理时,会把处理委托给后台模型,再把结果带回对话。发布时后台模型是 GPT-5.5,自 2026 年 9 月 9 日起改用 GPT-5.6 或 GPT-6 Astra,模型和推理强度用与文字聊天相同的控件来选。
Q5. 能进行视频或屏幕共享吗?
截至 2026 年 9 月 25 日仍然不行。Live 不支持视频和屏幕共享,需要时请在 iOS 或 Android 应用里切换到旧的 Advanced 语音(OpenAI Help)。OpenAI 在发布时表示正在努力加入这些功能。
Q6. 能通过 API 接入我自己的应用吗?
可以。GPT-Live 的 API 已于 2026 年 9 月 10 日正式提供,模型 ID 为 gpt-live-1,价格为语音会话每分钟 $0.05(后台模型和工具另计)。另外还有别的产品线 GPT-Realtime-2.1 / mini,可以根据你更看重对话的自然程度,还是想沿用现有的 Realtime API 来选择。
Q7. 与谷歌的 Gemini Live 相比如何?
谷歌的 Gemini Live 可以在对话时共享摄像头画面或手机屏幕(Gemini Live 帮助)。截至 2026 年 9 月 25 日,GPT-Live 不支持视频和屏幕共享,所以想一边展示眼前的画面一边对话的话,Gemini Live 占优。OpenAI 为 GPT-Live 强调的优势是全双工对话的自然度:边听边给出回应,话说到一半被打断也能接住,你思考时的沉默也会耐心等待。OpenAI 没有公布延迟数值,因此无法比较回应速度。详情也可参阅GPT-5.6 vs Gemini 对比。
相关文章
- GPT-5.6 发布完全解读 — 同期的主角模型群
- GPT-5.6 Sol vs Gemini — 多模态/语音的对比维度
- Google Gemini 是什么 — 竞品的基础
- ChatGPT Work 是什么 — 制作文档、表格、幻灯片的“工作智能体”,现在也能用语音派活
若要把已有 MP3 或 M4A 附加到对话,请参阅 ChatGPT 音频上传指南,了解支持格式、付费套餐、逐字稿核对方法、API 单独计费和存储注意事项。