先更新认知:Advanced Voice 已被替换
网上大量教程还在讲 Advanced Voice Mode 怎么开、怎么调。2026 年 7 月 8 日起,它被 GPT-Live 整体替换了——OpenAI 的说法是「不是增量改进,而是架构更换」。
三个实质变化:
- 全双工:能一边听一边说。你可以随时插话打断,不用等它说完。
- 语音里能联网搜索:这是第一次。以前语音会话是封闭的。
- 更自然的对话感:语气、停顿、接话时机更接近人。
发布时的两个空缺:不支持视频与屏幕共享(OpenAI 表示后续补上),没有 API。
各档能用什么
| 档位 | 语音模型 | 额度 |
|---|---|---|
| Free | GPT-Live-1 mini | 约 15 分钟/天(第三方整理),用完降到标准语音,次日重置 |
| Go($8) | GPT-Live-1 | 约为免费层 10 倍 |
| Plus($20) | GPT-Live-1 | 明显更高,OpenAI 未公布固定值 |
| Pro($100 / $200) | GPT-Live-1 | 约为 Plus 的 5 倍 / 20 倍 |
模型对应关系来自 OpenAI 官方发布页;分钟数来自第三方整理,OpenAI 未公布固定值,以账号内提示为准。
一个对重度用户重要的细节:语音与文字的用量是分开计算的。 文字额度撞顶时语音可能还有,反过来也一样。不必为了省文字额度而回避语音。
Go 这一档在语音上的性价比不错——$8 拿到和 Plus 同款的 GPT-Live-1,只是额度低。 但 Go 没有 Deep Research、Agent Mode 和自定义 GPTs,如果语音之外还有别的需求,还是看套餐对比。
三个用得好的方法
① 把它当对话,不是当命令行
全双工的意义在于你能随时插话。说错了直接纠正、想到了直接追问,不用等它说完一整段。 实践上句子短一点、语速慢一点,比一口气说一大段效果好得多。
② 需要资料时直接让它搜
「查一下今天的汇率」「搜一下这个药的禁忌」——它会边说边搜。 但请记住:语音里的引用不比文字更可靠,关键信息仍然要自己核实。
③ 翻译靠提示
没有翻译界面、没有语言对选择器。直接说「把我接下来说的翻成英文」就行,所有档位可用。 日常交流够用;正式会议的同传级别它还达不到。 语言支持方面 OpenAI 只说「针对最常用的一批语言做了优化,部分语言可能有口音或流畅度缺口」,没有公布清单。
国内用户的三个注意
- 网络稳定性比文字模式敏感得多。全双工语音对延迟和抖动很敏感,出口不稳会频繁掉线;同时频繁跨国切换出口本身也是账号风控信号(见 封号风控指南)。
- 中文口音与流畅度可能不如英文。OpenAI 明确说部分语言存在缺口,中文体验以实际为准。
- 生成的音频带 SynthID 水印。7 月 31 日起 ChatGPT Voice 与 API 生成的音频都有。这只是隐式标识——在境内发布 AI 生成音频,显式标识义务仍要自己履行,逻辑与图片相同,见 标识办法实操。
顺带一提:听写也换了模型
与 GPT-Live 同期,ChatGPT 的语音听写(speech-to-text)也换了新模型,全档位推出,跨语言和口音的识别有提升。 这是幕后更新,不需要你改任何设置。
和 Claude 的关系
Claude 没有语音对话。连同图像生成,这是 ChatGPT 相对 Claude 最硬的两块差异—— 如果你的场景离不开语音,选型就没有悬念。完整对比见Claude vs ChatGPT 2026 下半年对比。
一句话总结
Advanced Voice 已被 GPT-Live 替换:能打断、能搜索、能按提示翻译;Go 起就能用 GPT-Live-1,语音与文字额度互不占用。发布时没有视频和屏幕共享,语言清单没公布,分钟数以账号内提示为准。