Skip to main content

微软发布最强语音转写模型MAI-Transcribe-2:60种语言,错误率仅5.2%,每小时0.67元

微软最近放了个大招,正式发布了他们最新的语音转写模型——MAI-Transcribe-2。按照官方的说法,这不仅是他们最快的模型,还是最准、最划算的一个。听起来有点王婆卖瓜?别急,我们来看看数据。

先说说大家最关心的价格。目前这款模型搞了个限时优惠,每小时只要0.10美元,换算下来大概0.67元人民币。这个价格在同类产品里确实挺能打的,而且优惠会持续到2026年底。

Image

准确率和速度:双料冠军?

在FLEURS这个国际通用的测试集上,MAI-Transcribe-2的平均词错率只有5.2%,而且无论是在强制语言模式还是自动语言检测模式下,表现都一样稳。作为对比,Gemini 3.1 Pro的成绩是5.3%和5.8%,GPT-Transcribe是10.4%和10.6%,而老牌的Whisper v3-Large则高达22.8%和23.5%。这么一看,差距还是挺明显的。

速度方面,微软引用了Artificial Analysis的评测数据,说MAI-Transcribe-2比GPT-Transcribe快10倍,比Scribe v2快7倍,比Gemini 3.5 Transcribe快5倍。虽然这些数字听起来有点夸张,但至少说明在性能上,微软是下了功夫的。

功能亮点:不只是转写

除了又快又准,MAI-Transcribe-2还加了不少实用功能。比如说话人分离,它能自动识别录音里有几个人在说话,并且把每句话归到对应的人名下。这对于采访、会议记录来说,简直是神器。

还有词级时间戳,每个词都能精确到时间点,方便你做音频搜索、剪辑或者字幕对齐。想象一下,以后剪视频找素材,直接搜关键词就能定位到具体位置,省时省力。

更贴心的是,模型提供了两种转写风格:一种是“逐字模式”,会把“嗯”、“啊”这类语气词和口误都保留下来,适合需要严谨记录的合规或分析场景;另一种是“干净模式”,自动去掉这些冗余,生成更易读的文本,适合做字幕、笔记或者公开发布的内容。

另外,它还支持关键词偏置、自动语言识别、多语言混合对话,甚至在嘈杂环境下也能保持不错的转写效果。支持的语言多达60种,而且你不需要提前指定语言,模型自己就能判断录音里说的是什么话。

如何体验?

目前,开发者已经可以通过Microsoft Foundry、MAI Playground和OpenRouter这几个平台来调用或试用这款模型了。如果你经常需要处理音频转文字的工作,不妨去试试看,说不定能省下不少时间和银子。

关键要点

  • 价格优势:每小时0.10美元(约0.67元),限时优惠至2026年底。
  • 性能领先:FLEURS测试平均词错率5.2%,速度比GPT-Transcribe快10倍。
  • 功能丰富:支持说话人分离、词级时间戳、多种转写风格,覆盖60种语言。
  • 使用便捷:可在Microsoft Foundry、MAI Playground和OpenRouter上直接体验。