Azure AI Speech 推出 LLM Speech 2607:多语种更准、延迟快 3 倍的语音识别更新
微软在 2026 年 9 月 10 日发布了 Azure AI Speech 语音识别模型的最新版本 LLM Speech 2607。这是继 2605 之后的又一次例行更新,部署在服务端,用户不需要改任何代码,现有应用会自动用上新模型。
这是什么?
Azure AI Speech 是微软云上的语音识别(Speech-to-Text)服务,被广泛用于语音助手、会议转写、呼叫中心和在线会议等场景。LLM Speech 2607 是这个服务的底层识别模型更新,核心改进集中在三件事:多语种识别更准、行业术语抓得更牢、响应更快。
为什么值得注意?
在第三方权威评测 HuggingFace OpenASR 排行榜上,LLM Speech 2607 目前排在第 2 位。对于要处理大量真实语音的企业来说,识别准确率和响应速度的每一次提升,都会直接反映在最终体验上。
具体更新了什么?
1. 混说场景识别更稳
现实对话里经常出现说话中途切换语言的情况——比如中文里夹英文术语,或者跨国会议里英日文混着讲。2607 在这类"混说"音频上的识别准确率有明显提升。
2. 小语种质量补齐
Tier 2 和 Tier 3 语言的转写质量改善明显,尤其是大小写、标点、数字和日期的转写更可靠。做小语种市场的应用是这轮更新最直接的受益者。
3. 人名、品牌、术语识别更准
模型具备领域感知能力,能更准确地识别企业专有人名、品牌名和行业术语。客服和垂直行业场景里,这类词恰恰是最容易错的地方。
4. 延迟最多快 3 倍
相比上一版 2605,2607 的响应延迟最多降低到原来的三分之一。对实时字幕、语音助手这类需要"边说边出字"的交互场景,这个提升非常实在。
5. 语音列表(Phrase List)用法简化
以前想把"重要词汇"喂给模型,得把自定义词表塞进一个万能 prompt 里。现在改成了专用参数,可以直接传入识别提示词,最多支持 2000+ 个实体,生产环境里更好维护。比如调用转写 API 时,把 "Contoso"、"Jessie" 这样的关键词通过 phraseList 字段直接传进去即可。
怎么用上?
LLM Speech 2607 通过 Fast API(批量快速转写)和 Real-Time API(实时流式转写)两个入口都可用。已经是 Azure AI Speech 用户的,什么都不用做,服务端已自动部署;想试效果的,可以直接在 Azure Foundry Playground 里传一段音频体验,或者参考官方 REST API / SDK 文档接入。
总结
这次更新没有发布会式的"大新闻",但它代表了大厂语音识别的节奏:小步快跑、自动上线、持续变准。对正在搭建语音 Agent、会议转写或呼叫中心系统的开发者来说,2607 值得直接测一轮混说场景和小语种素材,看看准确率有没有实际提升。
---
来源:Microsoft Foundry 官方博客《Announcing Azure AI Speech LLM 2607: Better Multilingual Accuracy, Easier Customization》(2026-09-10)