问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年8月,微软正在测试旗下首款原生实时语音模型MAI Realtime,该产品首次采用双向全双工交互架构,打破传统语音助手轮流对话模式,支持16种语言自动识别切换、听说并行功能,用户无需等待AI完成输出即可插话,交互体验接近真人交流,是微软MAI语音家族从单向任务向双向交互迭代的核心产品。

据行业测试平台近期披露的信息,微软已在小范围启动MAI Realtime的灰度测试,首批参与测试的开发者已经放出了多段交互演示视频:测试者在AI播报法语旅游指南的中途,直接用中文提问目的地防疫政策,模型立刻中断原有输出,切换为中文给出准确回答,全程没有等待间隙。
长期以来,主流语音交互产品均采用半双工的轮次对话逻辑:用户说完指令后AI才会启动识别、输出回应,若用户中途插话,系统要么完全无法识别,要么需要重启对话流程,交互割裂感极强。
此前微软推出的MAI-Voice-2语音合成模型、MAI-Transcribe-1.5语音识别模型,均属于单方向的语音能力产品,无法实现交互场景下的联动,此次MAI Realtime的推出,正是微软补全实时语音交互短板的关键动作。
MAI Realtime的核心能力在于双向全双工的实时交互架构:系统搭载的端点检测技术可毫秒级识别用户说话的开始、停顿与结束状态,实现“边听边说”的并行处理,用户无需等待AI完成当前输出即可随时插话,模型会立刻调整回应内容,完全模拟真人对话的打断、接话逻辑。
在多语言支持上,该模型可自动识别16种不同语言的输入,无需用户手动切换语言设置即可跨语言回应。目前模型提供两种偏向日常对话的自然语音风格,暂不支持唱歌、拟声等特色输出功能,相关能力将在后续迭代中逐步上线。
据业内人士预测,MAI Realtime正式落地后,将首先被整合进微软Azure云服务、Office Copilot等B端产品线,覆盖智能客服、跨国会议同传、车载语音交互等多个场景,后续也可能接入消费级的Windows系统语音助手、Bing搜索等产品,降低用户跨语言交流的门槛。
值得注意的是,全双工语音交互已经成为全球AI厂商的布局重点,此次微软的技术落地,也将推动整个行业加快真人级语音交互产品的迭代速度,未来两到三年内,主流语音助手的交互体验有望迎来全面升级。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。