微软 AI 于 2026 年 9 月 3 日发布了自研语音识别模型 MAI-Transcribe-2。在多语种基准测试 FLEURS 中,该模型在 60 种语言上的平均词错误率为 5.2%,位居首位,定价为每小时音频 0.10 美元(约 16 日元)。语音转写领域长期存在精度、速度与价格三者难以兼顾的问题,这次微软是冲着三项一起去的。
※1 美元 = 156 日元(截至 2026 年 9 月 4 日)
每小时 0.10 美元的定价
最先引人注意的是价格。转写 1 小时音频花费 0.10 美元,折合日元不到 20 日元。即便每天处理 10 段 1 小时的会议录音,月度支出也只在数百日元的量级。不过这个价格是截至年底的限时优惠,微软并未说明之后的常规价格。计划引入的团队需要在常规价格公布后重新测算。
微软将这一定价归因于处理速度。如果 1 小时音频能在约 10 秒内返回,同一块 GPU 单位时间内可处理的任务量大幅增加,单次成本自然下降。
10 秒返回 1 小时音频
速度方面的依据来自第三方评测机构 Artificial Analysis 的测量结果。按照这些数据,MAI-Transcribe-2 的处理速度是 OpenAI GPT-Transcribe 的 10 倍、ElevenLabs Scribe v2 的 7 倍、谷歌 Gemini 3.5 Transcribe 的 5 倍,同时精度还更高。
具体数字为错误率 2.0%、速度系数 403.6。速度系数 403.6 意味着处理速度约为实时的 400 倍,即 1 小时音频约 10 秒即可返回。在以精度和速度为两轴的分布图上,微软称 MAI-Transcribe-2 单独位于最有利的象限。若单看 Artificial Analysis 的词错误率排行榜,该模型排名第二。
60 种语言精度不下滑
多语种能力的衡量标准是公开基准测试 FLEURS。微软报告称,MAI-Transcribe-2 在全部 60 种受测语言上都保持了较高精度,以平均词错误率 5.2% 位列第一。微软表示,尚无其他模型能在如此广的语言范围内保持精度。
对于目前按语言切换模型的开发者来说,这一点在工程上意义不小。处理多语种音频的服务通常先做语言识别,再分发到对应模型,每一次分支都会加重实现与运维负担。若一个模型即可覆盖,这些分支可以整体去掉;也不必按语言分别预留 GPU 资源,闲置率随之下降。
语言指定为可选项,默认由模型自动识别所说语言。像 Hinglish、Spanglish 这类在同一句话中混用两种语言的语码转换,也属于自动处理范围。微软文档建议,仅在自动识别失败时才显式指定语言。
面向实际业务的细致选项
功能上准备了不少面向业务场景的参数。启用说话人分离后,录音会按说话人切分,并返回带有起始位置与时长信息的分段。时间戳可在词级、分段级和不返回三档之间选择。
还提供了短语列表机制。事先传入专业术语、缩写和专有名词,模型会更倾向于识别出这些词。文档特别注明,这些只是提示,并不强制输出结果。
转写风格同样可切换。默认是 verbatim,即完全照录所说内容,包括语气词和重复表达,适用于合规审查、质量管理、会话分析等关注实际措辞的场景。另一档 clean 则去除口头禅并自动整理为易读形式,更适合字幕、会议纪要和对外发布的转写稿。官方列出的应用场景包括视频字幕、会议、诊疗记录、呼叫中心记录、无障碍、内容创作和语音智能体。
抗噪能力被描述为模型自身具备的特性,因此在录音环境无法控制的现场音频上也能保持质量。
使用方式与当前限制
提供形式是 Azure Speech 的公开预览版。没有服务级别协议,并明确注明不建议用于生产环境。价格和性能虽有吸引力,但现阶段还不适合接入不能中断的业务流程。
调用通过 Fast Transcription API 的增强模式进行,在模型属性中指定 MAI-Transcribe-2。输入音频需小于 300 MB,格式支持 WAV、MP3 和 FLAC。使用前需要 Azure 订阅以及用于 Speech 的 Microsoft Foundry 资源。
enhanced mode model = MAI-Transcribe-2
面向语音交互的 Voice Live API 也可通过会话配置项,将 MAI-Transcribe 用于输入音频的转写。若只想先试试效果,可通过 Microsoft Foundry、MAI Playground 以及 OpenRouter 体验演示。
版本管理方面同样在推进。MAI-Transcribe-2 与 MAI-Transcribe-1.5 并存提供,初代 MAI-Transcribe-1 已于 2026 年 8 月 20 日起标记为弃用。仍在使用旧版本构建流程的团队,应确认迁移期限。
总结
MAI-Transcribe-2 的要点有三:60 种语言精度不下滑、1 小时音频约 10 秒返回、每小时 0.10 美元的年内限时价格。把原本按语言切换的模型收拢为一个,对运营多语种服务的开发者而言直接减少了实现量。另一方面,目前仍是预览状态且没有服务级别协议。较为现实的顺序是先在测试环境用自己的音频数据测量精度与速度,等常规价格明确后再判断是否投入生产。
