微软发布实时语音转写模型 MAI-Transcribe-2-Streaming:支持 60 种语言,低延迟转录瞄准实时 AI 应用
据 IT之家 10 月 2 日消息,微软于 10 月 1 日发布公告,推出其首个实时流式语音转写模型 MAI-Transcribe-2-Streaming。该模型面向语音进行中的即时转写场景,可在用户讲话时持续输出文本,支持 60 种语言,并具备自动语言检测能力。来源显示,在 Artificial Analysis 的流式语音转文字测试中,该模型最终转录延迟为 0.13 秒、最终词错误率为 2.50%,在参与测试的 28 个流式语音转文字模型中位居首位。
这意味着微软正在把语音识别能力从“录音后处理”进一步推向“实时交互”。对于 AI 客服、会议字幕、语音助手、多语言沟通工具等应用来说,流式转写并不只是把声音变成文字,更会直接影响后续大模型理解、推理和调用工具的速度。
从非流式到流式:微软补齐实时语音入口
微软此前已经推出过非流式的 MAI-Transcribe-2,主要适合录音文件、会议记录、临床文书等完整音频转写任务。非流式模式通常需要等待音频上传或处理完成后,再一次性返回结果;而这次的 MAI-Transcribe-2-Streaming 则面向实时返回,在讲话尚未结束时即可生成部分文本。
来源摘要显示,该模型会在接收到音频后约 100 多毫秒内生成首批“部分文本”,并随着更多上下文进入而持续修正,待语句结束后再提交较稳定的最终结果。微软还称,在其实时评估中,文字最快可在语音出现后约 320 毫秒显示。对用户体感而言,这类能力会让实时字幕更接近“边说边显”,也能让语音应用更早判断用户意图。
价格方面,MAI-Transcribe-2-Streaming 目前处于优惠阶段,费用为每小时 0.54 美元,约合每 1,000 分钟 9 美元。开发者可通过 Microsoft Foundry、MAI Playground、OpenRouter 等渠道体验或接入。作为对比,微软此前非流式 MAI-Transcribe-2 在 Azure Speech 公共预览阶段的价格为每小时 0.10 美元。两者面向场景不同,流式版本更强调低延迟与持续输出,成本结构也更接近实时应用服务。
核心能力:低延迟、多语言与自动语言检测
从公布信息看,MAI-Transcribe-2-Streaming 的重点不只是识别准确率,还包括稳定的实时输出能力。Artificial Analysis 于 9 月 28 日公布的流式语音转文字排行榜显示,该模型最终词错误率为 2.50%,低于 Grok Voice Transcribe 2.0 Streaming 的 2.73% 和 ElevenLabs Scribe v2 Realtime 的 3.59%。微软同时强调,该模型在最终转录和首次部分转录两个指标上均排名第一。
- 实时输出:讲话过程中即可返回部分文本,适合对话式 AI、字幕和语音交互。
- 低延迟表现:测试中最终转录延迟为 0.13 秒,微软称首批部分文本可在接收音频后约 100 多毫秒生成。
- 多语言覆盖:支持 60 种语言,并可自动、连续检测语言变化。
- 开发者接入:可通过 Microsoft Foundry、MAI Playground、OpenRouter 等渠道体验或集成。
自动语言检测尤其值得关注。传统语音识别系统往往需要在会话开始前指定语言,跨语言场景下体验并不流畅。微软此次强调模型可根据语音内容识别语言变化,意味着它更适合多语言会议、跨国客服、教育陪练和国际化产品中的语音入口。
影响解读:语音将成为 AI Agent 的低延迟触发器
对于 AI 应用开发者而言,流式转写能力的价值在于把语音输入变成更及时的结构化信号。过去,很多语音助手需要等待用户说完整句话再识别、再交给大模型处理,这会造成明显等待感。若转写模型能够在讲话过程中持续输出文本,后端大模型就可以提前理解上下文、准备回复,甚至预先调用检索、工单、数据库或自动化工具。
这对客服智能体的意义尤其直接。来电者尚未完整说完诉求时,系统就可能开始识别问题类型、匹配知识库、准备转人工或执行流程。实时字幕系统也能获得更短的显示延迟,使在线会议、直播、课堂等场景的可用性提升。对硬件厂商来说,耳机、会议设备、车载系统和智能终端也有机会通过接入云端流式转写,增强语音交互体验。
不过,流式转写也带来新的产品设计问题:部分文本会随着上下文不断修正,应用需要在“快”和“准”之间做界面与逻辑取舍。例如字幕可以接受轻微修改,但自动下单、工单提交、医疗记录等高风险场景则需要等待稳定结果再执行。因此,低延迟并不等于所有场景都应立即自动决策,开发者仍需结合业务风险设置确认机制。
总体来看,MAI-Transcribe-2-Streaming 的发布显示微软正在强化实时语音 AI 基础设施。随着语音识别、对话模型和工具调用能力进一步融合,未来的 AI Agent 将不再只是“读文本、回文本”,而是更自然地接收连续语音输入,并以更短链路完成理解与行动。