微软测试首款自研全双工AI语音MAI Realtime模型:支持16种语言实时交互
8月4日,据报道,微软正悄然测试其首款自研原生实时语音模型MAI Realtime,采用全双工交互架构,支持16种语言同步听说,并允许用户在对话中随时切换语言——这意味着AI语音助手正在告别“一人说完另一人再说”的对讲机模式,向真人对话的自然节奏靠拢。
与微软此前发布的MAI语音模型不同——MAI-Voice-2专注于语音合成、MAI-Transcribe-1.5专注语音识别,两者均为单向任务——MAI Realtime是微软首次将“听”与“说”整合到同一模型中的产品。它采用双向全双工交互,系统通过端点检测技术识别说话的开始、停顿和结束,当用户中途插话时能即时调整输出,无需等待一方完整说完再回应。
在语言覆盖层面,MAI Realtime支持包括中文、英语、日语、韩语、法语、德语、阿拉伯语在内的16种语言。用户可以主动指定对话语言,也可以启用自动检测功能,让模型在对话过程中自动识别并切换语言。语音风格方面,测试版本提供Victoria和Grant两种声音选项,据称比Copilot目前使用的语音模式更加自然。
目前,微软已邀请部分合作伙伴在MAI Playground平台进行测试,但何时上线Microsoft Foundry、何时扩展至Copilot语音功能,尚无明确时间表。该模型定位为对话系统,不支持唱歌或生成非语音音效。调试面板可实时显示延迟数据、模型思考内容和处理步骤,样本分享功能有望在测试范围扩大后向更多平台用户开放。
微软在自研AI模型上的布局正在加速。2025年8月,微软发布首款自研基础模型MAI-1和语音生成模型MAI-Voice-1,标志着其减少对OpenAI依赖的战略转型。而此次MAI Realtime的曝光,则将自研语音能力的竞争从“语音自然度”推向了“交互实时性”层面——在AI语音助手日趋同质化的当下,能否像真人一样边听边想、边想边答,正在成为衡量下一代语音产品的关键指标。