微软发布 MAI-Transcribe-2:号称全球最快最准最便宜的语音转文字模型,超越 GPT-Transcribe 和 Gemini
2026-09-04 · 基于多家媒体转述整理
这是什么?
MAI-Transcribe-2 是微软 AI 团队于 2026 年 9 月 3 日发布的语音识别模型,主打"实时转录 + 批量处理"两大场景。它的核心卖点是三句话:更快、更准、更便宜。
根据微软官方博客披露,MAI-Transcribe-2 在 Artificial Analysis 的语音识别榜单上取得了多项第一:词错误率(WER)低至 2.0%,在保持高精度的同时,处理速度达到行业领先水平——批量模式下比 OpenAI GPT-Transcribe 快 10 倍、比 ElevenLabs Scribe v2 快 7 倍、比 Google Gemini 3.5 Transcribe 快 5 倍。
为什么重要?
语音转文字这个赛道,过去两年一直是 OpenAI(Whisper)、Google(Gemini Transcribe)和 ElevenLabs(Scribe)三足鼎立的局面。微软这次用 MAI-Transcribe-2 直接下场,而且开出的价码相当激进——约 0.1 美元/小时的实时转录费用,按 24/7 Wall St. 的报道换算约为 1.67 美元/千分钟,远低于同赛道的竞争对手。
功能层面,MAI-Transcribe-2 支持说话人分离(diarization),可以自动识别对话中的不同说话者;还支持可配置的转录风格(比如正式会议记录 vs 口语化转写)、词级时间戳,以及多语言混合输入的场景。这些特性让它在医疗病历、法律庭审、访谈整理等垂直领域有很强的实用性。
对谁有用?
- 内容创作者和媒体——播客、采访、纪录片需要的字幕和文稿,以前靠人工或按分钟计费的 API,现在 Microsoft 给出的价格几乎是白送。
- 企业和开发者——呼叫中心、客服录音、会议记录自动化,大规模调用时成本优势会非常明显。
- 医疗、法律、教育等垂直领域——需要高精度转录 + 说话人分离 + 多语言支持的专业场景,MAI-Transcribe-2 的功能矩阵基本全覆盖。
背景与对比
有意思的是,就在同一天(9 月 3 日),站内另一篇 T8star 精选视频(ID 693)介绍了 Breeze 2 TTS 开源模型——但那是"语音合成"方向,也就是把文字变成声音;MAI-Transcribe-2 是反方向的"语音识别",把声音变成文字。两条赛道不同,但都在 AI 语音领域的大潮里。
微软在语音领域并非新手。开源模型 Whisper 推出后,微软一直在自己的 Azure 云平台上集成和优化语音服务。这次 MAI-Transcribe-2 直接对标 GPT-Transcribe 和 Gemini Transcribe,等于把"语音转文字"这个细分市场的价格底线进一步拉低——对行业来说是好事,对用户更是利好。
怎么用?
MAI-Transcribe-2 目前通过 Microsoft AI 平台以 API 形式开放,开发者可以在 Microsoft AI 官网注册后调用。官方博客没有公布具体的定价页链接,但 Neowin 和 24/7 Wall St. 的转述确认了约 0.1 美元/小时的价格区间,这对需要大规模转录的用户来说几乎是颠覆性的降价。
· WER(词错误率):2.0%(Artificial Analysis 榜单第 2 名)
· 相对速度:10× GPT-Transcribe、7× Scribe v2、5× Gemini 3.5 Transcribe
· 价格:约 0.1 美元/小时(或 1.67 美元/千分钟)
· 功能:说话人分离、可配置风格、词级时间戳、多语言
说明:本文基于 Microsoft AI 官方博客及 Neowin、24/7 Wall St. 等多家媒体在近 24 小时内的交叉转述整理。事件时间以微软官方发布日期(2026-09-03)为准。