你可以将录音附加到 ChatGPT,要求它生成逐字稿、摘要或会议纪要草稿。 此功能适用于受支持的付费套餐。它不同于与 ChatGPT 语音交谈的 Voice,也不同于边工作边录音的 Record。若要使用已有的 MP3、M4A 等录音,应先附加文件。

从录音到会议纪要:3 个步骤

01 附加文件

上传音频文件
检查格式和大小

02 转写

先使用录音原语言
标明听不清的部分

03 整理纪要

决定、负责人、截止时间
对照录音核实关键内容

大小上限为 512MB。文件没有超限,并不代表整段录音都能被准确转写。

我们于 2026 年 10 月 7 日完整阅读了 OpenAI 官方英文帮助文档。本文解释规格和实用流程,未使用真实音频测量转写准确率或处理时间。来源:音频上传、支持格式与限制。

1. 支持的套餐与四种音频功能

OpenAI 官方帮助说明,音频上传适用于 ChatGPT 付费订阅与工作区,包括 Enterprise,不包括 Free。能免费附加文档或图片,不代表音频文件也适用相同条件。是否可用还取决于地区、工作区设置、应用或网页版本以及所选模型。

已有录音 → 音频上传

将 MP3、M4A 等文件附加到对话,要求生成逐字稿或询问录音内容。本文介绍的是这一流程。

与 ChatGPT 交谈 → Voice

与 ChatGPT 进行语音对话。语音对话记录不等于上传录音的完整逐字稿。

口述提示词 → 听写

通过麦克风将口述提示词转为文字,再编辑并发送。这与选择已有录音文件不同。

现场录音 → Record

录制并整理会议或语音笔记。官方 Record 指南介绍的是 macOS 应用。其录音时长和存储规则应与附加文件的规则分开核对。

来源:Voice、听写、Record。有关语音对话所用模型与技术,请参阅我们的GPT-Live 指南。

上传会议录音,也不同于让工具自动加入会议。要比较录音流程和专用服务,请参阅AI 会议纪要与自动化指南。

2. 格式、文件大小与长录音

检查项目官方说明
支持的音频WAV、MP3/MPEG、OGG/OGA、PCM、FLAC、AAC、M4A,以及仅含音频的 WebM 或 MP4。
文件大小音频最大 512MB。
含视频的文件被识别为视频的 WebM 和 MP4 不受此音频上传功能支持。
录音时长可使用 Data Analysis 时,长录音可能分段处理。非常长的录音可能在处理完成前超时。
准确率准确率因语言而异,可能出现转写错误或说话人识别错误。

来源:OpenAI 音频上传规格。文件必须包含可读取的音频数据。更改扩展名不会改变实际格式,也不会移除视频。

文件大小上限:512MB

附加前,可在文件属性或信息面板查看大小。

长录音可能处理到一半就停止

即使文件大小未超限,长录音也可能处理超时。官方帮助没有给出保证成功处理的录音时长。

如果长文件处理失败,可尝试在本地切成较短片段,按顺序附加。切分不能保证成功。记录每段的顺序、在原录音中的起点及少量重叠,方便之后发现遗漏和重复。在使用外部服务切分前,先确认是否允许向其发送含机密信息的录音。

3. 如何附加音频并要求转写

  1. 检查文件。 用本地播放器试听开头、中段和结尾,确认有声音,并记录格式、大小和时长。
  2. 使用受支持的付费账户打开对话。 通过输入框的附件控件选择支持的音频文件。按钮名称和位置因应用版本而异,不要与听写麦克风混淆。
  3. 随附件一起发送提示词。 先要求生成逐字稿。如果一开始只要求简短摘要,后续与录音核对所需的细节会被省略。
  4. 检查结果,并在同一对话中继续提问。 将逐字稿整理成会议纪要或邮件草稿前,先改正错误。上传成功不代表整段录音已被分析,应确认回答覆盖哪些部分。

官方基本流程是:附加文件 → 说明需求 → 检查回答并继续提问。以下提示词由编辑团队按此流程编写。仅靠提示词无法保证结果没有错误。

请按录音原语言转写附加的音频。
第一轮不要摘要或翻译,保留发言内容与顺序。
听不清的地方标为 [听不清],不要猜测补全。
只有能可靠区分说话人时才添加说话人标签,
否则标为 [说话人不明]。
列出未能分析的部分;如无法确认整段录音都已处理,请明确说明。
录音语言:中文
录音时长:(已知时填写)

提供时长有助于核对输出覆盖了多少内容,但不保证该长度的录音可以处理。若提供术语拼写,应说明只有录音中确实出现时才能使用,避免凭术语编造缺失的发言。

4. 会议、采访与讲座的提示词

核对逐字稿后,再按用途调整输出。关键是区分录音中的事实与 AI 提出的建议。下面展示不同工作流程的示例,并非实际生成结果。

会议:区分决定、提议与未解决问题

请根据刚才核对过的逐字稿整理会议纪要。
包含:会议目的 / 已确认的决定 / 未解决问题 / 后续行动。
将后续行动整理为表格:行动、负责人、截止时间、对应发言。
不要把提议写成决定。
如未提及负责人或截止时间,写“尚未确定”。
AI 的建议另设标题,不要混入录音中的事实。

虚构示例:“最好在周五前检查一下。”

这句话不能确定承诺

断言“截止时间是周五,Alex 负责”,就添加了发言中未提及的负责人。

只记录发言能够支持的内容

记录为:“有人提议在周五前检查,负责人和已确认的截止时间仍需核实。”

采访:区分原话引用与编辑后的摘要

按主题整理已经核对的逐字稿。
明确区分直接引用与摘要。
不要为使文字流畅而改写引语。
仅在录音或我已核实的信息能确定身份时使用说话人姓名。
另列出发布前需要重新听录音核实的专有名词、数字和不清楚的片段。

打算引用的内容应对照录音检查。编辑可提高可读性,但改动限定条件、否定表达或句尾可能改变原意。“说话人 A”这样的标签本身不能确定身份。

讲座:区分学习笔记与补充说明

根据已核对的逐字稿制作学习笔记。
分别整理讲座内容、术语和检验理解的问题。
录音中没有的解释标为“补充说明”。
不明确的公式、人名和术语应标注待核对,不要当成确定事实。
先用原语言整理,不要翻译。

如果需要翻译,先纠正原始逐字稿。将识别错误翻译出来,可能更难发现需要修改的内容。字幕文件或视频编辑请参阅转写与字幕工具指南。可以要求 ChatGPT 输出 SRT,但这不保证时间码准确。

5. 核对说话人、数字和遗漏

官方指南也提醒,转写可能出错,说话人身份可能无法确定。不要只让 AI 自查错误:要将输出与原始音频逐项对照。 即使摘要读起来流畅,也应核实以下项目。

数字与单位

日期、金额、人数和百分比。对照录音确认发音相近的数字与单位。

否定与条件

“不会”“如果”“还没决定”。省略这些词可能改变发言含义。

负责人和截止时间

确认没有弄混说话人,区分提议与已确认的承诺。

是否包含录音结尾?

寻找开头、中段和结尾的主题,检查是否提前停止处理或漏掉内容。

抽查开头、中段和结尾,可快速发现大段遗漏,但不能证明全文准确。涉及合同、交付日期等重要事项时,应重听每段相关发言。作为正式记录使用前,请参与者确认内容。

若不清楚的内容集中在噪声或多人同时讲话处,先在本地试听。反复要求 AI 改写回答,可能只是改善文笔,错误仍然保留。本文未实测日语转写准确率,也未与具体服务比较,因此不作排名。

6. 价格、用量限制与 API

在 ChatGPT 对话中附加音频,与调用开发者 API,计费和限制分别计算。 附加文件不需要 API 密钥。若将转写集成到自己的应用中,API 独立于 ChatGPT 订阅使用。

比较项目附加到 ChatGPT 的音频转写 API
流程将文件附加到对话并发送提示词。通过程序发送音频。
订阅与计费需要受支持的 ChatGPT 付费订阅或工作区。API 用量单独计费,不含在 ChatGPT 月费内。
文件大小限制音频为 512MB。File transcription 指南规定为 25MB。
查看规格的位置ChatGPT 音频上传帮助。API File transcription 指南与价格页。

来源:ChatGPT 与 API 分开计费、转写 API 文件大小限制。不要把 API 的 25MB 限制用于 ChatGPT 附件,也不要认为 Pro 包含 API 费用。

音频附件价格与限制仍有哪些不明确之处

官方音频上传帮助未列出面向个人用户的每分钟附加费,也未列出各套餐的音频专用处理时长或上传次数。这不能证明一定存在额外收费;同样,我们也未能确认 Pro 无限制,或每种订阅都保证零额外费用。

同一帮助页的文档与图片上传次数表,明确针对文档、电子表格、演示文稿、文本和图片,不能当成音频上传次数。如遇限制或错误,应查看订阅及工作区说明。Voice 通话时长限制也不能用来衡量附加音频的处理量。

7. 无法上传或读取文件时的排查

无法选择文件、提示无法分析附件、处理到一半停止,需要不同检查。更改订阅前,先区分症状。以下顺序基于官方条件,但不保证能确定原因。

症状先检查下一步
无法附加音频付费套餐是否支持音频上传,格式与大小是否符合要求。也检查地区、模型、应用版本和组织设置。能附加文档不代表音频附件可用。
无法读取附件音频能否在本地播放,MP4 或 WebM 是否被识别为视频。用正确导出的短音频排查。仅改扩展名不会转换音频格式。
长录音中途停止或缺失内容回答覆盖了多少内容,是否包含结尾。考虑将原录音切成短片段,记录顺序与起点,再重新处理。
上传次数超限错误账户、订阅、存储用量与 OpenAI 服务状态。避免短时间内反复重试。官方说明指出,失败的上传也可能计入限制。

来源:官方上传故障排查。若问题持续,向支持团队提供日期、时间和时区、设备及浏览器、所选模型、格式、大小、时长、错误截图,以及可获得的请求 ID。截图不要包含不必要的录音内容或个人信息。

短测试应使用自己准备且不含机密信息的音频。区分是所有文件都失败,还是仅特定格式或时长失败。上传失败未必需要升级套餐,也可能是环境限制或文件本身的问题。

8. 训练用途、存储与删除

上传前,应向参与者解释用途,取得必要同意,并核对雇主或组织的信息处理规则。音频可能包含你未在提示词提及的姓名、地址、客户信息和背景对话。 先判断能否去除多余片段,以及是否允许将材料发送到云服务。

训练用途

个人用户服务可能按设置将内容用于训练。Pro 的训练条款也不同于企业订阅。

存储与删除

删除对话后,录音文件可能仍保存在 Library。应检查各个存储位置。

按官方一般政策,个人版 ChatGPT 服务的内容可能用于训练。关闭“Improve the model for everyone”可排除新对话,但主动提交反馈存在例外。Business、Enterprise、Edu 和 API 默认不使用输入或输出训练模型。来源:各服务的训练政策。

不过,我们检查的音频上传帮助没有明确说明:附件音频本身的训练用途,与 Voice 的“Include your audio recordings”设置是什么关系。因此应避免将 Voice 语音片段或 Record 录音的说明直接套用于 MP3、M4A 附件。有关设置和已提交信息的评估,请参阅ChatGPT、Codex 的训练用途与机密信息指南。

如果文件保存在 Library,删除对话不会删除 Library 中的副本。逐字稿和摘要也可能留在对话中,应分别检查存储位置。归档不等于删除。来源:对话与文件保留及删除规则。还应区分退出训练与阻止录音离开设备:前者不等于后者。

总结:上传后先核对逐字稿,再使用

要在 ChatGPT 使用已有录音,将音频附加到对话,并先要求逐字稿。实用顺序是:对照录音核实决定和引语,再整理成会议纪要、文章或学习笔记。

  • 适用范围:音频上传面向付费订阅,不要假设 Free 或所有环境都可用。
  • 源文件:检查支持的音频格式和 512MB 上限,区分含视频的 MP4 和 WebM。
  • 质量:对照录音检查说话人、数字、否定表达,并确认逐字稿包含结尾。
  • 费用与数据:API 独立于 ChatGPT 计费。部分音频附件价格和用量细节未公布,对话与文件可能分开存储。

常见问题

免费版 ChatGPT 能转写 MP3 吗?
我们检查的官方帮助说明,音频文件上传适用于付费订阅和工作区,不包括 Free。这与免费语音对话的可用性是两回事。

可以附加 M4A 或 MP4 吗?
M4A 属于支持格式。MP4 和 WebM 必须仅含音频;被识别为视频的文件不受此功能支持,文件还需包含可读取的音频数据。

只要小于 512MB,几小时的录音就能可靠处理吗?
不能仅凭大小判断。官方指南提到长录音分段处理,以及非常长录音的超时问题。文件大小、可处理时长和整篇逐字稿准确率是不同问题。

ChatGPT Pro 包含转写 API 吗?
不包含。API 独立于 ChatGPT 订阅计费,应区分对话中的音频附件与程序中的 API 调用。