孤本网
/ 1 阅读
0

微软发布 MAI-Transcribe-2-Streaming 与 MAI-Voice-2.1 语音模型,瞄准低延迟实时交互场景

一句话结论

微软发布三款 MAI 系列语音模型,主打低延迟与多语言支持,降低实时语音智能体落地门槛。

关键要点

  • MAI-Transcribe-2-Streaming 支持 60 种语言的实时转录,首次部分结果延迟仅 100 余毫秒。
  • 微软称该模型在 Artificial Analysis 平台准确率排名第一。
  • MAI-Voice-2.1 支持以同一声音角色说 23 种语言,且每种语言带有原声口音。
  • MAI-Voice-2.1-Flash 版本延迟达 150 毫秒,单价由 $22 降至每百万字符 $15。
  • 所有新语音模型均支持基于数秒参考音频的声音克隆,并内置防滥用安全机制。

背景与事实

微软人工智能团队近日推出新一代语音处理模型组合,核心目标是提升实时语音交互的响应速度与多语言覆盖能力。其中,MAI-Transcribe-2-Streaming 定位为流式转录模型,可将 60 种语言的语音实时转为文本。官方数据显示,该模型在 Artificial Analysis 评估中准确率位居榜首,首次输出部分结果耗时控制在 100 多毫秒。这意味着语音智能体可在用户尚未说完当前句子的情况下,即开始生成并执行回复动作,从而消除传统“说完再听”的交互等待感。在定价方面,微软宣布在 2025 年底之前,按小时计费的音频转录服务引入价为每小时 $0.54,显著低于市场常规水平,意在鼓励开发者早期集成。

与此同时,微软发布了两款文本转语音(TTS)模型:MAI-Voice-2.1 与 MAI-Voice-2.1-Flash。MAI-Voice-2.1 的核心特性是跨语言一致性——同一虚拟角色可以切换 23 种语言发声,且每种语言均保留自然的母语口音,避免“一种口音说所有语言”的违和感。MAI-Voice-2.1-Flash 则专为低延迟场景优化,端到端延迟压缩至 150 毫秒,适合对响应速度敏感的客服、导航等实时对话系统。价格上,Flash 版本单价从每百万字符 $22 下调至 $15,降幅约 31.8%。

在功能层面,三款新语音模型均支持声音克隆能力,仅需数秒参考音频即可生成相似音色。微软同步部署了内置安全护栏,防止克隆功能被用于欺诈或恶意用途。这些模型已正式上线 Microsoft Foundry、MAI Playground 等微软自有平台,其中两款 TTS 模型同步接入 OpenRouter 生态。在一项用户盲测中,约半数参与测试的 4,000 名用户判断这些合成语音来自真实人类,显示出较高的自然度水平。

影响分析

这是分析判断。对中文开发者而言,MAI-Transcribe-2-Streaming 的 60 语言支持覆盖中英日韩等主要市场,100 毫秒级延迟使实时字幕、会议转写、语音助手等应用可摆脱“先说完再响应”的瓶颈,尤其利好需要多语言即时交互的出海企业。MAI-Voice-2.1 的“同角色多语言”特性直接解决跨国产品本地化配音成本高、风格不统一痛点,一套角色素材即可覆盖 23 国市场,大幅压缩本地化制作周期。Flash 版 150 毫秒延迟与降价策略,使实时语音客服、智能硬件对话等对成本与速度双敏感的场景具备商业可行性。声音克隆配合安全护栏,为个性化语音交互提供合规路径,但开发者需评估自身业务是否触发滥用风险。

适用边界

这是分析判断。上述结论不适用于离线批处理场景——MAI-Transcribe-2-Streaming 以流式实时为设计目标,若需求为“上传整段音频离线转写”,其“首包 100ms”指标无实际意义;MAI-Voice-2.1-Flash 的 150ms 延迟在纯离线 TTS 渲染中并非核心指标。此外,60 语言与 23 语言支持不意味着所有语种精度与准确率等同,低资源语种可能存在数据偏差;声音克隆依赖参考音频质量,嘈杂或过短样本可能导致效果劣化。OpenRouter 接入仅覆盖两款 TTS 模型,转录模型需通过 Microsoft Foundry 调用,集成路径不同。

孤本观察

这是编辑判断。微软将 TTS 模型同步上架 OpenRouter,是少数厂商主动接入第三方模型路由平台的动作,暗示其试图以“生态可见性”对冲单一平台锁定,该策略在语音模型商用层面尚属少见。

微软发布 MAI-Transcribe-2-Streaming 与 MAI-Voice-2.1 语音模型,瞄准低延迟实时交互场景

微软发布 MAI-Transcribe-2-Streaming 与 MAI-Voice-2.1 语音模型,瞄准低延迟实时交互场景

常见问题

MAI-Transcribe-2-Streaming 支持多少种语言?首次部分结果延迟是多少?

支持 60 种语言的实时转录,首次部分结果延迟仅 100 余毫秒。

MAI-Voice-2.1-Flash 版本的延迟和价格是多少?

端到端延迟为 150 毫秒,单价从每百万字符 $22 降至 $15。

微软的新语音模型是否支持声音克隆?有哪些安全限制?

支持基于数秒参考音频的声音克隆,并内置防滥用安全机制,防止用于欺诈或恶意用途。

MAI-Voice-2.1 在跨语言发声时有什么特点?

同一声音角色可说 23 种语言,且每种语言保留原声口音,避免一种口音说所有语言的违和感。

哪些模型已接入 OpenRouter 生态?

MAI-Voice-2.1 与 MAI-Voice-2.1-Flash 两款 TTS 模型同步接入 OpenRouter,转录模型需通过 Microsoft Foundry 调用。

来源:The Decoder