OpenAI 给 GPT-Live 语音加上隐形水印:SynthID 音频验证上线,EU AI Act 前一天踩点交付
7 月 31 日,OpenAI 为 GPT-Live 语音模型新增了 SynthID 音频水印,同时开放了验证 API。从现在起,所有通过 ChatGPT Voice 和 OpenAI API 生成的语音,都自动携带一种人耳听不到、但机器可以检测的来源标记。第三方开发者和组织也可以通过 API 自动查询一段音频是否由 OpenAI 生成。
这次更新的时间点很微妙——正好卡在 EU AI Act Article 50 透明度义务在 27 个成员国生效的前一天。
GPT-Live:OpenAI 的全双工语音模型
GPT-Live 是 OpenAI 在 7 月 8 日发布的新一代语音模型,替代了此前的 Advanced Voice Mode,成为 ChatGPT 语音功能的默认驱动。它采用全双工架构,可以同时听和说,每秒做出多次交互决策——是继续说话、继续倾听、暂停、打断,还是调用工具。目前每周有超过 1.5 亿人使用 ChatGPT 的语音和听写功能。
SynthID 音频水印:藏在频谱里的"身份证"
和图片水印直接修改像素不同,音频水印需要在频谱域(spectrogram)里操作。具体分三步:
- 波形转频谱:把音频波形转换成时频表示,展示信号在不同时间的频率分布
- 嵌入水印:利用心理声学掩蔽原理,把水印模式编码到频谱中——简单说,就是把标记藏在人耳听不到的频段里,原理和 MP3 压缩时删掉人耳感知不到的信息类似
- 重建波形:从修改后的频谱重建音频,水印信号对人耳完全不可闻
水印采用扩频方式,在多个频段和时间位置分布冗余副本,这使得它对压缩、噪声和常见音频处理都有较强的鲁棒性。
验证 API:让第三方也能查
这次更新不只是"加了水印",更重要的是开放了验证能力。任何开发者或组织都可以通过 API 查询一段音频是否包含 OpenAI 的来源标记,并集成到自己的工作流中——比如内容审核、合规检查、媒体溯源等场景。
OpenAI 此前已经在 5 月为图片生成上线了 C2PA 清单和 SynthID 水印,音频是第二步。从产品节奏看,OpenAI 正在系统性地为所有生成内容加上可追溯标记。
EU AI Act 的时间节点
EU AI Act Article 50 要求 AI 生成的音频、视频和图片内容必须可被识别为 AI 生成。这项义务在 8 月 1 日正式生效。OpenAI 选择在生效前一天完成 SynthID 音频水印的部署,时间点很难说是巧合。
这也不是 OpenAI 一家的动作。Google 也在 Gemini 生成的内容中嵌入 SynthID,行业正在形成"合规驱动水印落地"的共识。对于面向欧洲市场的 AI 产品来说,可追溯标记正在从"加分项"变成"必选项"。
对谁有用,有什么限制
对开发者:验证 API 可以直接集成到内容审核、合规检查等流程中,不需要自己训练检测模型。
对企业:如果业务涉及 AI 生成语音(客服、营销、播客等),现在有了合规层面的技术保障。
需要注意的限制:SynthID 目前只能检测 OpenAI 生成的音频,不能识别其他平台(如 ElevenLabs、Google)的生成内容。水印也不是万能的——极端的音频处理可能破坏标记。此外,验证 API 的误检率(假阳性/假阴性)还需要在实际使用中验证。
---
基于 TechTimes 及 OpenAI 官方公告整理。