智能工具库

微软发布实时转录新标杆:MAI-Transcribe-2-Streaming 首发

微软发布实时转录新标杆:MAI-Transcribe-2-Streaming 首发

微软推出首个实时流式语音转写模型 MAI-Transcribe-2-Streaming,凭借 2.5% 的词错误率和 0.13 秒的极低延迟,在基准测试中击败 ElevenLabs 和 Grok,适用于客服与实时字幕场景。

2026-10-02 0来源:IT之家

微软发布实时转录新标杆:MAI-Transcribe-2-Streaming 首发

IT之家 10 月 2 日消息,微软昨日(10 月 1 日)正式发布了其首个实时流式语音转写模型——MAI-Transcribe-2-Streaming。这一发布标志着微软在 AI 语音交互领域迈出了关键一步,旨在解决传统语音识别“听完后才能写”的痛点,实现真正的实时对话与字幕生成。

极致性能:0.13 秒延迟与 2.5% 词错率

在性能指标上,MAI-Transcribe-2-Streaming 表现惊艳。根据 Artificial Analysis 的测试数据,该模型的最终转录延迟仅为 0.13 秒,最终词错误率(WER)为 2.50%。这两个数据使其在 28 个参赛的流式语音转文字模型中拔得头筹,领先于 Grok Voice Transcribe 2.0 Streaming(2.73%)和 ElevenLabs Scribe v2 Realtime(3.59%)。

延迟技术解析

对于用户而言,0.13 秒意味着什么?这意味着从用户开口说话到文字出现在屏幕上,几乎实现了“所见即所得”的同步感。微软的技术说明显示,该模型在接收到音频后约 100 多毫秒内就会生成首批部分文本,并在语句结束后快速提交稳定结果。这种极低的延迟为语音应用的交互逻辑带来了质的飞跃,使得系统可以更敏锐地捕捉用户的表达节奏。

核心特性:多语言与自动检测

功能层面,该模型支持 60 种语言,并具备自动、连续的语言检测能力。用户无需在会话开始前手动指定语言,系统可以智能识别语音内容的变化,这对于跨国会议或多语言交流场景极具价值。

实用价值:为谁创造价值?

对开发者与产品经理来说,这项技术的核心价值在于“提前感知”。

由于延迟极低,语音应用无需等待用户说完一句话,就可以利用上下文信息提前理解用户意图。这为以下场景提供了强大的支持:

  • 智能客服: 客服智能体可以在来电者尚未说完投诉时,就开始识别问题类型并启动相应的处理流程,无需等待用户挂断。
  • 实时字幕: 字幕系统可以更紧密地跟随语速,减少卡顿,提升观看体验。
  • 实时交互工具: 语音助手可以在对话中途精准捕捉指令,提升人机协作效率。

定价与接入方式

值得注意的是,微软此前推出了非流式的 MAI-Transcribe-2,主要针对录音文件和会议记录。相比之下,MAI-Transcribe-2-Streaming 专为实时对话设计,虽然单价略高于非流式版本(优惠价约 0.54 美元/小时,约合 3.6 元人民币),但其带来的实时交互体验是前者无法替代的。

目前,开发者可以通过 Microsoft Foundry、MAI Playground 或 OpenRouter 等渠道接入该模型,体验这一行业新标杆的性能。

总结

MAI-Transcribe-2-Streaming 的发布,不仅刷新了流式语音转写的性能记录,更展示了 AI 在处理实时语音时的潜力。它证明了在极低延迟下保持高准确率是可行的,这将为未来的智能语音应用打开新的想象空间。

本文基于 IT之家 的公开内容,由 AI 辅助整理改写后发布。

原标题:流式转录 AI 新标杆:微软 MAI-Transcribe-2-Streaming 登场,2.5% 词错误率、0.13 秒延迟夺冠

阅读原文