你可以将录音附加到 ChatGPT,要求它生成逐字稿、摘要或会议纪要草稿。 此功能适用于受支持的付费套餐。它不同于与 ChatGPT 语音交谈的 Voice,也不同于边工作边录音的 Record。若要使用已有的 MP3、M4A 等录音,应先附加文件。
从录音到会议纪要:3 个步骤
上传音频文件
检查格式和大小
先使用录音原语言
标明听不清的部分
决定、负责人、截止时间
对照录音核实关键内容
大小上限为 512MB。文件没有超限,并不代表整段录音都能被准确转写。
我们于 2026 年 10 月 7 日完整阅读了 OpenAI 官方英文帮助文档。本文解释规格和实用流程,未使用真实音频测量转写准确率或处理时间。来源:音频上传、支持格式与限制。
目录
1. 支持的套餐与四种音频功能
OpenAI 官方帮助说明,音频上传适用于 ChatGPT 付费订阅与工作区,包括 Enterprise,不包括 Free。能免费附加文档或图片,不代表音频文件也适用相同条件。是否可用还取决于地区、工作区设置、应用或网页版本以及所选模型。
已有录音 → 音频上传
将 MP3、M4A 等文件附加到对话,要求生成逐字稿或询问录音内容。本文介绍的是这一流程。
与 ChatGPT 交谈 → Voice
与 ChatGPT 进行语音对话。语音对话记录不等于上传录音的完整逐字稿。
口述提示词 → 听写
通过麦克风将口述提示词转为文字,再编辑并发送。这与选择已有录音文件不同。
现场录音 → Record
录制并整理会议或语音笔记。官方 Record 指南介绍的是 macOS 应用。其录音时长和存储规则应与附加文件的规则分开核对。
来源:Voice、听写、Record。有关语音对话所用模型与技术,请参阅我们的GPT-Live 指南。
上传会议录音,也不同于让工具自动加入会议。要比较录音流程和专用服务,请参阅AI 会议纪要与自动化指南。
2. 格式、文件大小与长录音
| 检查项目 | 官方说明 |
|---|---|
| 支持的音频 | WAV、MP3/MPEG、OGG/OGA、PCM、FLAC、AAC、M4A,以及仅含音频的 WebM 或 MP4。 |
| 文件大小 | 音频最大 512MB。 |
| 含视频的文件 | 被识别为视频的 WebM 和 MP4 不受此音频上传功能支持。 |
| 录音时长 | 可使用 Data Analysis 时,长录音可能分段处理。非常长的录音可能在处理完成前超时。 |
| 准确率 | 准确率因语言而异,可能出现转写错误或说话人识别错误。 |
来源:OpenAI 音频上传规格。文件必须包含可读取的音频数据。更改扩展名不会改变实际格式,也不会移除视频。
附加前,可在文件属性或信息面板查看大小。
即使文件大小未超限,长录音也可能处理超时。官方帮助没有给出保证成功处理的录音时长。
如果长文件处理失败,可尝试在本地切成较短片段,按顺序附加。切分不能保证成功。记录每段的顺序、在原录音中的起点及少量重叠,方便之后发现遗漏和重复。在使用外部服务切分前,先确认是否允许向其发送含机密信息的录音。
3. 如何附加音频并要求转写
- 检查文件。 用本地播放器试听开头、中段和结尾,确认有声音,并记录格式、大小和时长。
- 使用受支持的付费账户打开对话。 通过输入框的附件控件选择支持的音频文件。按钮名称和位置因应用版本而异,不要与听写麦克风混淆。
- 随附件一起发送提示词。 先要求生成逐字稿。如果一开始只要求简短摘要,后续与录音核对所需的细节会被省略。
- 检查结果,并在同一对话中继续提问。 将逐字稿整理成会议纪要或邮件草稿前,先改正错误。上传成功不代表整段录音已被分析,应确认回答覆盖哪些部分。
官方基本流程是:附加文件 → 说明需求 → 检查回答并继续提问。以下提示词由编辑团队按此流程编写。仅靠提示词无法保证结果没有错误。
请按录音原语言转写附加的音频。
第一轮不要摘要或翻译,保留发言内容与顺序。
听不清的地方标为 [听不清],不要猜测补全。
只有能可靠区分说话人时才添加说话人标签,
否则标为 [说话人不明]。
列出未能分析的部分;如无法确认整段录音都已处理,请明确说明。
录音语言:中文
录音时长:(已知时填写)
提供时长有助于核对输出覆盖了多少内容,但不保证该长度的录音可以处理。若提供术语拼写,应说明只有录音中确实出现时才能使用,避免凭术语编造缺失的发言。
4. 会议、采访与讲座的提示词
核对逐字稿后,再按用途调整输出。关键是区分录音中的事实与 AI 提出的建议。下面展示不同工作流程的示例,并非实际生成结果。
会议:区分决定、提议与未解决问题
请根据刚才核对过的逐字稿整理会议纪要。
包含:会议目的 / 已确认的决定 / 未解决问题 / 后续行动。
将后续行动整理为表格:行动、负责人、截止时间、对应发言。
不要把提议写成决定。
如未提及负责人或截止时间,写“尚未确定”。
AI 的建议另设标题,不要混入录音中的事实。
虚构示例:“最好在周五前检查一下。”
断言“截止时间是周五,Alex 负责”,就添加了发言中未提及的负责人。
记录为:“有人提议在周五前检查,负责人和已确认的截止时间仍需核实。”
采访:区分原话引用与编辑后的摘要
按主题整理已经核对的逐字稿。
明确区分直接引用与摘要。
不要为使文字流畅而改写引语。
仅在录音或我已核实的信息能确定身份时使用说话人姓名。
另列出发布前需要重新听录音核实的专有名词、数字和不清楚的片段。
打算引用的内容应对照录音检查。编辑可提高可读性,但改动限定条件、否定表达或句尾可能改变原意。“说话人 A”这样的标签本身不能确定身份。
讲座:区分学习笔记与补充说明
根据已核对的逐字稿制作学习笔记。
分别整理讲座内容、术语和检验理解的问题。
录音中没有的解释标为“补充说明”。
不明确的公式、人名和术语应标注待核对,不要当成确定事实。
先用原语言整理,不要翻译。
如果需要翻译,先纠正原始逐字稿。将识别错误翻译出来,可能更难发现需要修改的内容。字幕文件或视频编辑请参阅转写与字幕工具指南。可以要求 ChatGPT 输出 SRT,但这不保证时间码准确。
5. 核对说话人、数字和遗漏
官方指南也提醒,转写可能出错,说话人身份可能无法确定。不要只让 AI 自查错误:要将输出与原始音频逐项对照。 即使摘要读起来流畅,也应核实以下项目。
日期、金额、人数和百分比。对照录音确认发音相近的数字与单位。
“不会”“如果”“还没决定”。省略这些词可能改变发言含义。
确认没有弄混说话人,区分提议与已确认的承诺。
寻找开头、中段和结尾的主题,检查是否提前停止处理或漏掉内容。
抽查开头、中段和结尾,可快速发现大段遗漏,但不能证明全文准确。涉及合同、交付日期等重要事项时,应重听每段相关发言。作为正式记录使用前,请参与者确认内容。
若不清楚的内容集中在噪声或多人同时讲话处,先在本地试听。反复要求 AI 改写回答,可能只是改善文笔,错误仍然保留。本文未实测日语转写准确率,也未与具体服务比较,因此不作排名。
6. 价格、用量限制与 API
在 ChatGPT 对话中附加音频,与调用开发者 API,计费和限制分别计算。 附加文件不需要 API 密钥。若将转写集成到自己的应用中,API 独立于 ChatGPT 订阅使用。
| 比较项目 | 附加到 ChatGPT 的音频 | 转写 API |
|---|---|---|
| 流程 | 将文件附加到对话并发送提示词。 | 通过程序发送音频。 |
| 订阅与计费 | 需要受支持的 ChatGPT 付费订阅或工作区。 | API 用量单独计费,不含在 ChatGPT 月费内。 |
| 文件大小限制 | 音频为 512MB。 | File transcription 指南规定为 25MB。 |
| 查看规格的位置 | ChatGPT 音频上传帮助。 | API File transcription 指南与价格页。 |
来源:ChatGPT 与 API 分开计费、转写 API 文件大小限制。不要把 API 的 25MB 限制用于 ChatGPT 附件,也不要认为 Pro 包含 API 费用。
音频附件价格与限制仍有哪些不明确之处
官方音频上传帮助未列出面向个人用户的每分钟附加费,也未列出各套餐的音频专用处理时长或上传次数。这不能证明一定存在额外收费;同样,我们也未能确认 Pro 无限制,或每种订阅都保证零额外费用。
同一帮助页的文档与图片上传次数表,明确针对文档、电子表格、演示文稿、文本和图片,不能当成音频上传次数。如遇限制或错误,应查看订阅及工作区说明。Voice 通话时长限制也不能用来衡量附加音频的处理量。
7. 无法上传或读取文件时的排查
无法选择文件、提示无法分析附件、处理到一半停止,需要不同检查。更改订阅前,先区分症状。以下顺序基于官方条件,但不保证能确定原因。
| 症状 | 先检查 | 下一步 |
|---|---|---|
| 无法附加音频 | 付费套餐是否支持音频上传,格式与大小是否符合要求。 | 也检查地区、模型、应用版本和组织设置。能附加文档不代表音频附件可用。 |
| 无法读取附件 | 音频能否在本地播放,MP4 或 WebM 是否被识别为视频。 | 用正确导出的短音频排查。仅改扩展名不会转换音频格式。 |
| 长录音中途停止或缺失内容 | 回答覆盖了多少内容,是否包含结尾。 | 考虑将原录音切成短片段,记录顺序与起点,再重新处理。 |
| 上传次数超限错误 | 账户、订阅、存储用量与 OpenAI 服务状态。 | 避免短时间内反复重试。官方说明指出,失败的上传也可能计入限制。 |
来源:官方上传故障排查。若问题持续,向支持团队提供日期、时间和时区、设备及浏览器、所选模型、格式、大小、时长、错误截图,以及可获得的请求 ID。截图不要包含不必要的录音内容或个人信息。
短测试应使用自己准备且不含机密信息的音频。区分是所有文件都失败,还是仅特定格式或时长失败。上传失败未必需要升级套餐,也可能是环境限制或文件本身的问题。
8. 训练用途、存储与删除
上传前,应向参与者解释用途,取得必要同意,并核对雇主或组织的信息处理规则。音频可能包含你未在提示词提及的姓名、地址、客户信息和背景对话。 先判断能否去除多余片段,以及是否允许将材料发送到云服务。
个人用户服务可能按设置将内容用于训练。Pro 的训练条款也不同于企业订阅。
删除对话后,录音文件可能仍保存在 Library。应检查各个存储位置。
按官方一般政策,个人版 ChatGPT 服务的内容可能用于训练。关闭“Improve the model for everyone”可排除新对话,但主动提交反馈存在例外。Business、Enterprise、Edu 和 API 默认不使用输入或输出训练模型。来源:各服务的训练政策。
不过,我们检查的音频上传帮助没有明确说明:附件音频本身的训练用途,与 Voice 的“Include your audio recordings”设置是什么关系。因此应避免将 Voice 语音片段或 Record 录音的说明直接套用于 MP3、M4A 附件。有关设置和已提交信息的评估,请参阅ChatGPT、Codex 的训练用途与机密信息指南。
如果文件保存在 Library,删除对话不会删除 Library 中的副本。逐字稿和摘要也可能留在对话中,应分别检查存储位置。归档不等于删除。来源:对话与文件保留及删除规则。还应区分退出训练与阻止录音离开设备:前者不等于后者。
总结:上传后先核对逐字稿,再使用
要在 ChatGPT 使用已有录音,将音频附加到对话,并先要求逐字稿。实用顺序是:对照录音核实决定和引语,再整理成会议纪要、文章或学习笔记。
- 适用范围:音频上传面向付费订阅,不要假设 Free 或所有环境都可用。
- 源文件:检查支持的音频格式和 512MB 上限,区分含视频的 MP4 和 WebM。
- 质量:对照录音检查说话人、数字、否定表达,并确认逐字稿包含结尾。
- 费用与数据:API 独立于 ChatGPT 计费。部分音频附件价格和用量细节未公布,对话与文件可能分开存储。
常见问题
免费版 ChatGPT 能转写 MP3 吗?
我们检查的官方帮助说明,音频文件上传适用于付费订阅和工作区,不包括 Free。这与免费语音对话的可用性是两回事。
可以附加 M4A 或 MP4 吗?
M4A 属于支持格式。MP4 和 WebM 必须仅含音频;被识别为视频的文件不受此功能支持,文件还需包含可读取的音频数据。
只要小于 512MB,几小时的录音就能可靠处理吗?
不能仅凭大小判断。官方指南提到长录音分段处理,以及非常长录音的超时问题。文件大小、可处理时长和整篇逐字稿准确率是不同问题。
ChatGPT Pro 包含转写 API 吗?
不包含。API 独立于 ChatGPT 订阅计费,应区分对话中的音频附件与程序中的 API 调用。