微软 MAI 语音与转录模型发布
TECH

微软 MAI 语音与转录模型发布

35+
Signals

战略概览

  • 01.
    2026年10月1日,微软人工智能(Microsoft AI)推出了其首款流式语音转文本模型 MAI-Transcribe-2-Streaming,以及两款文本转语音模型 MAI-Voice-2.1 和 MAI-Voice-2.1-Flash,均可通过微软 Foundry 获取。
  • 02.
    MAI-Transcribe-2-Streaming 支持60种语言,具备自动连续语言检测功能,并在接收到音频后仅略超过100毫秒即可生成首个部分转录结果。
  • 03.
    该模型的最终词错误率为2.5%,首次部分转录错误率为2.8%,在说话人停止讲话后0.13秒内完成最终转录。
  • 04.
    MAI-Transcribe-2-Streaming 的定价为每小时音频0.54美元,有效期至2026年底,可通过 Microsoft Foundry、MAI Playground、Vercel 和 Azure Voice Live 获取。
  • 05.
    这三款模型也可通过 OpenRouter 获取,LiveKit 支持预计即将上线。
  • 06.
    MAI-Voice-2.1 支持23种语言和26个区域,允许单个合成语音以所有这些语言发声,同时保持母语口音和一致的说话人身份,定价为每百万字符22美元。
  • 07.
    MAI-Voice-2.1-Flash 定价为每百万字符15美元,可生成45秒音频,端到端延迟为150毫秒,在推理速度上比同类模型快约55%,成本低约60%。
  • 08.
    在一项涉及4,000名听众的图灵测试中,50.3%的听众认为 MAI-Voice 的输出与真实人类录音相比同样或更像人类。
  • 09.
    MAI-Voice-2.1 和 MAI-Voice-2.1-Flash 均支持通过短参考片段进行零样本语音克隆,系统级强制执行同意机制,确保仅授权或获得许可的语音才能被合成。

经不起全面验证的基准声明

微软将 MAI-Transcribe-2-Streaming 宣传为市场上最准确的实时转录模型,引用了 Artificial Analysis 的 AA-WER Streaming 排行榜第1名的成绩——2.5%的最终词错误率,2.8%的首次部分错误率,且在音频到达后约100毫秒即显示部分假设 [1][2]。该排名真实且由独立测量得出 [3]。但同一基准测试发布的比较数据却使情况复杂化:在其价格-最终性能指标中,ElevenLabs 的 Scribe v2 Realtime 以6.50美元的价格实现3.6%的 WER 和0.14秒延迟,在特定子指标上优于微软,尽管微软在总排名上领先 [3]。另一份报告使用简称“MAI-Transcribe-2”,声称其价格为每小时0.10美元,并宣称在速度上超越 OpenAI、Google 和 ElevenLabs,但这与其它地方引用的0.54美元/小时价格不符 [4]——可能是不同 SKU 或后期调价所致,但也提醒我们应核查原始基准数据而非新闻稿摘要。

亚200毫秒数字背后的技术机制

延迟优势并非单一技巧,而是一整套技术堆叠的结果。MAI-Transcribe-2-Streaming 在音频到达约100毫秒后即开始输出部分转录,说话人停止讲话后仅0.13秒即完成完整转录,其首次部分错误率(2.8%)仅略高于最终准确率(2.5%)[1][2]。在文本转语音方面,MAI-Voice-2.1-Flash 进一步推进这一理念:端到端延迟150毫秒,可生成长达45秒的音频,据称推理速度快约55%,成本低约60% [2]。在一项4,000名听众参与的盲测中,50.3%的参与者认为该语音输出与真实录音相比同样或更像人类 [1]——这一门槛已被勉强跨越,而非接近。

真正动机:削减 Anthropic 的账单

苏莱曼对微软持续推出自研语音与转录模型的原因表述异常直接:他们希望停止为此向其他实验室付费。“我们付给 Anthropic 大量资金,因此我们的目标是减少并最终消除这项成本,”他在此次发布期间表示 [5]。这一表态嵌入了一个更广泛的模式:微软公开构建与自身同时转售并投资的 OpenAI 和 Anthropic 系统相竞争的模型 [6]。低成本、低延迟的转录与 TTS 是一个合乎逻辑的切入点——语音代理属于高吞吐量、对成本敏感的工作负载,每字符节省几分之一美分的成本会迅速累积,使得 MAI 成为 Copilot 内部更具吸引力的默认选项,而非调用外部实验室的附加 API。

每几个月就发布一次的模型家族

这并非一次性发布,而是大约十四个月内的第四次迭代。微软人工智能于2025年8月首次推出 MAI-Voice-1 和 MAI-1-preview,随后在2026年4月推出 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2,明确旨在与 OpenAI 和 Google 竞争 [7]。到2026年6月的 Build 大会,MAI-Voice-2 增加了系统级同意保障的零样本语音克隆功能 [8],同年7月,微软通过投入25亿美元、组建6,000名工程师的‘前沿公司’(Frontier Company),将 AI 部署专长直接嵌入企业客户,进一步支持这一战略 [9]。这种节奏显示出紧迫感而非例行更新——尽管 Gartner 的伊万·麦金太尔(Ewan McIntyre)指出,包括 MAI 在内的整个科技巨头约6,500亿美元的 AI 基础设施支出,尚未解决更难的问题:“真正的挑战不是采用,而是创造有意义的价值” [10]。

历史背景

穆斯塔法·苏莱曼宣布微软人工智能推出的首批自研模型 MAI-Voice-1 和 MAI-1-preview。
微软在微软 Foundry 中推出三款新的基础模型:MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2,作为直接与 OpenAI 和 Google 竞争的战略的一部分。
在微软 Build 2026 大会上,穆斯塔法·苏莱曼发布了七款新的 MAI 模型,包括 MAI-Voice-2 和 MAI-Transcribe-1.5,其中 MAI-Voice-2 增加了零样本语音克隆和同意保护机制。
微软启动了一项25亿美元的运营实体,配备6,000名工程师,将 AI 部署专长直接嵌入企业客户内部,此举效仿了亚马逊、OpenAI 和 Anthropic 的类似行动。
微软发布了 MAI-Transcribe-2-Streaming 以及 MAI-Voice-2.1 和 MAI-Voice-2.1-Flash,即本研究的主题。

关键关系图

关键玩家
主题

微软 MAI 语音与转录模型发布

事实来源

12 条引用
  1. [1] Microsoft Launches MAI-Transcribe-2-Streaming and Two MAI-Voice Models
  2. [2] Microsoft launches MAI-Transcribe-2-Streaming
  3. [3] New streaming speech-to-text benchmark: AA-WER Streaming
  4. [4] Microsoft AI's MAI-Transcribe-2 undercuts OpenAI, Google, and ElevenLabs on price and speed
  5. [5] Microsoft targets ultra-realistic voice agents with its first streaming transcription model
  6. [6] Microsoft is openly competing with OpenAI, Anthropic more than ever
  7. [7] Microsoft takes on AI rivals with three new foundational models
  8. [8] MAI-Voice-2
  9. [9] Microsoft launches its own AI deployment company with $2.5 billion commitment
  10. [10] Microsoft Builds Its Own AI Model Stack To Reduce OpenAI Dependence
  11. [11] Microsoft AI Releases Impressive Transcription and Voice Models
  12. [12] Today We're Announcing 3 New World-Class MAI Models Available in Foundry

来源文章

Top 5

THE SIGNAL.

Analysts

“将新转录模型定位为全球最准确的实时选项,并明确将 MAI 的建设与削减微软对 Anthropic 等第三方模型提供商的支出联系起来。引述:“我们付给 Anthropic 大量资金,因此我们的目标是减少并最终消除这项成本””

Mustafa Suleyman (CEO, Microsoft AI)
微软人工智能领导层

“认为尽管大型科技公司在 AI 基础设施上投入了约6,500亿美元,包括 MAI 等举措,但真正的瓶颈并非模型能力或采用率,而是将这些投资转化为有意义的企业价值。引述:“真正的挑战不是采用,而是创造有意义的价值””

Ewan McIntyre (VP Analyst, Gartner)
行业分析师,对整体 AI 基础设施的批判

“声明其 AA-WER Streaming 榜单通过实时 API 测试衡量真实世界准确性,而非厂商自报数据,且其自身数据显示,即使微软在总排名上领先,ElevenLabs Scribe v2 Realtime 在特定子指标上仍优于微软。”

Artificial Analysis
独立基准测试机构
The Crowd

“Introducing 3 new models: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 and MAI-Voice-2.1-Flash. Accurate streaming transcription. Natural speech and less waiting between turns. Build voice agents that keep the conversation moving!”

@@MicrosoftAI1578

“Microsoft AI has released MAI-Transcribe-2-Streaming, taking the #1 spot for Final Transcript accuracy and First Partial Transcript accuracy on AA-WER Streaming with 2.5% WER at 0.13s after end of speech MAI-Transcribe-2-Streaming is @MicrosoftAI's new streaming Speech to Text”

@@ArtificialAnlys700

“Microsoft AI's first live transcription model ranks first of 38 for accuracy on Artificial Analysis's streaming board, at a 2.51% word error rate. MAI-Transcribe-2-Streaming costs $0.54 an hour, and two new voices speak 23 languages.”

@@YFarmX6

“Microsoft launched 3 new models: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 and MAI-Voice-2.1-Flash.”

@u/saaswarrior1
Broadcast
MAI-Voice-2.1 and MAI-Transcribe-2: Microsoft's New Voice AI Tested

MAI-Voice-2.1 and MAI-Transcribe-2: Microsoft's New Voice AI Tested

Microsoft New AI Is 60X Faster Than Real Time (Beats Top Models)

Microsoft New AI Is 60X Faster Than Real Time (Beats Top Models)

Microsoft Launches New MAI AI Models: Text, Image, Voice & Speech in Foundry

Microsoft Launches New MAI AI Models: Text, Image, Voice & Speech in Foundry