语音模型

阿里云栖大会升级 Qwen-Audio 3.1:能听懂情绪、按脚本生成整段有声内容,同传延迟压到 2.5 秒

2026年9月23日0 次阅读
阿里云栖大会升级 Qwen-Audio 3.1:能听懂情绪、按脚本生成整段有声内容,同传延迟压到 2.5 秒

9月22日的云栖大会上,阿里巴巴把语音模型家族 Qwen-Audio 3.1 一整套换了新架构,涵盖语音转写、语音合成、实时语音交互三大系列,还头一回亮出了同声传译模型。以下内容基于多家媒体转述整理(新浪科技、富途、Bastille Post 等),功能细节以官方后续公布为准。

这次升级了什么

简单说,阿里的语音模型这次不是只换引擎,而是把"听、说、翻译"三件事一起做了换代:

  • 听懂声音(Qwen-Audio-3.1-ASR-Next):新版音频理解模型不只是把语音转成文字,还能识别人物情绪、音乐、环境声和机械声,可以回答"这段录音里的人情绪怎么样"这类问题,也支持声音描述、事件定位和音频问答。
  • 直接生成整段有声内容(Qwen-Audio-3.1-TTS-Next):这是变化最大的一块。给一段文字脚本,模型能直接生成把对白和环境声融合在一起的完整音频——接近"电影级声景"。以前做有声书、影视、播客要配音、配环境音、再混音,现在一步生成。
  • 实时交互更强(Qwen-Audio-3.1-Realtime):能"边听、边想、边说",增强了多语言交互、角色扮演和共情能力。这类能力直接决定语音助手和 Agent 听起来像不像在"对话"而不是在"放录音"。
  • 同声传译首秀(Qwen3.8-LiveTranslate):人类同传的平均延迟在 4 秒以上,这个新模型能把延迟压到 2.5 秒以内,对实时跨语言沟通是实质性改善。

为什么值得注意

过去语音 AI 的重心在"把话听清、把字念顺",这次升级把重点移到了声音场景理解和有声内容生成上。对做有声书、影视、播客、游戏的团队来说,从脚本直接出成品音频意味着制作成本和时间都会下降;对语音 Agent 开发者来说,更低的延迟和更强的多语言能力,直接决定产品能不能上线用。

已经落地在哪些产品

媒体转述称,Qwen-Audio 3.1 系列已应用于千问办公和 Qoder,并接入 QwenNote A2 随身助理、QwenNote Eva 桌面机器人和千问 AI 眼镜等硬件;LiveTranslate 则接入千问 AI 眼镜、QwenNote A2 和钉钉耳机。同场发布的还有面向手机的全栈 AI 方案 Qwen Intelligence。这说明阿里的策略很明确:语音模型要尽快跑进终端,而不是停在 API 演示阶段。

需要注意的限制

本次信息来自多家媒体对云栖大会现场的转述,目前尚未见到官方基准数据、定价或开放下载的说明。功能描述(如"电影级声景")是厂方说法,实际效果仍要以官方文档和实测为准。

参考来源

  • 新浪科技:阿里云下代语音模型发布,Qwen落地多款智能终端(2026-09-22)
  • 富途:阿里语音模型家族 Qwen-Audio-3.1 全新升级
  • Bastille Post:Alibaba Unveils Roadmap on Full-Stack AI Strategy(Qwen3.8-LiveTranslate / Qwen-Audio-3.1-TTS-Next)

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...