微软自研全双工语音模型曝光:能听能说,16种语言自由切换
微软在语音AI领域又有新动作。据科技媒体TestingCatalog报道,微软正在测试其首个自研实时语音模型MAI Realtime。这款模型支持16种语言和两种语音风格,最大的亮点是能实现边听边说,对话中还能自动检测语言并切换。换句话说,用户不用等AI说完再开口,对话体验越来越接近真人交流。

从“轮流说话”到“同时听说”
传统语音助手大多是“你一句,我一句”的轮流模式——用户说完,模型再回答。但MAI Realtime采用了双向全双工交互,打破了这种模式。系统通过端点检测技术识别语音的开始、暂停和结束。当用户中途插话时,模型能立即调整输出,实现同步听和说。
这对微软的MAI语音模型家族来说,是个关键转折。此前发布的MAI-Voice-2和MAI-Transcribe-1.5只能完成单向任务,比如语音合成或语音识别。而MAI Realtime让语音交互从单向走向双向,迈出了重要一步。
16种语言,两种语音风格
在语言覆盖上,MAI Realtime支持中文、英文、日文、韩文、法文、德文、阿拉伯语等16种语言。用户既可以主动指定对话语言,也可以开启自动检测功能,让模型在对话中自动识别并切换语言。
语音风格方面,测试版提供了Victoria和Grant两种声音。据称,这两种声音比Copilot目前的语音模式更自然。不过,目前模型还不会唱歌,功能上更侧重于自然对话。
对用户意味着什么?
想象一下,你正在和AI助手讨论一个复杂问题,说到一半突然想补充一句,不用等它说完,直接开口就行。这种体验就像和真人聊天一样自然。MAI Realtime的推出,让AI语音交互更接近人类的交流方式,也为未来的智能助手、实时翻译等应用打开了更多可能性。
当然,目前MAI Realtime还在测试阶段,具体何时正式发布、会应用到哪些产品中,微软尚未透露。但可以预见的是,语音交互正在经历一场从“机械问答”到“自然对话”的进化。
关键要点
- 全双工交互:MAI Realtime支持同时听和说,用户可随时插话,无需等待。
- 16种语言:覆盖中英日韩法德阿等主流语言,支持自动检测和切换。
- 两种语音风格:Victoria和Grant,比Copilot现有语音更自然。
- 技术突破:从单向任务(语音合成/识别)转向双向实时对话,是MAI语音模型家族的重要升级。
- 测试阶段:目前尚未正式发布,具体应用场景待定。