字节跳动发布Seeduplex全双工语音大模型 已落地豆包亿级用户

2026年4月9日,字节跳动Seed团队正式推出原生全双工语音大模型Seeduplex,突破传统语音交互的回合制限制,实现“边听边说”的同步处理能力。目前该技术已在旗下AI产品豆包App全量上线,完成亿级用户规模化落地。相比传统半双工方案,其误回复率与误打断率降低50%,判停延迟缩短约250ms,抢话比例下降40%。

日常使用智能语音助手时,很多人都遇到过类似的尴尬:嘈杂环境下指令识别完全跑偏、话说到一半就被助手强行打断、每轮对话必须等对方说完才能接话,生硬的「回合制」交互与人类自然对话的逻辑相差甚远。字节跳动此次发布的新技术,正是瞄准这一困扰行业多年的用户痛点。

和传统半双工语音交互“你说我听、你停我答”的串行逻辑不同,Seeduplex从底层架构上采用了语音与语义联合建模的原生全双工框架,支持“边听边说”的并行处理,从根源上提升了语音交互的自然度。

针对复杂环境下的识别难题,该模型的抗干扰能力实现了大幅跃升,**相比传统半双工方案,误回复率与误打断率降低了50%**,即便在导航播报、多人交谈、环境杂音等干扰场景下,也能精准锁定主用户的语音指令,排除无关信息的干扰。

在对话节奏把控上,Seeduplex引入了动态判停技术,**将判停延迟缩短约250ms,用户抢话比例下降40%**,能够敏锐区分用户对话中的“思考留白”和“发言结束”信号,避免无意义的打断或过长等待。

不同于不少仍停留在实验室测试阶段的全双工技术,Seeduplex已经完成了商业化落地的全流程验证,目前已在字节跳动旗下AI助手豆包App全量上线,覆盖亿级活跃用户,实现了全双工语音技术从技术原型到To C大规模应用的跨越。

据了解,为了支撑亿级用户的高并发访问需求,Seed团队在工程层面做了大量优化,通过投机采样、量化压缩等技术手段,在保证模型效果的前提下大幅降低了推理成本,保障了全量上线后的服务稳定性。

此前,智能语音交互始终停留在“回合制”阶段,无论是手机端的语音助手还是智能硬件的语音控制,都无法复刻人与人对话的自然感,也限制了语音交互在车载、智能家居、AI陪伴等场景的应用深度。

Seeduplex的落地意味着语音交互正式进入“实时自然交互”的新阶段,用户可以像和真人对话一样随时打断AI的发言、中途补充修正指令,无需等待AI完成整轮回复。业内认为,随着全双工语音技术的普及,语音作为最高效的自然交互入口,将覆盖更多高频率的日常使用场景,进一步推动AI服务的普惠化。

从文本大模型的能力竞赛,到多模态交互的体验升级,头部科技企业的竞争已经延伸到更细分的交互场景,字节跳动此次的技术落地,也为整个行业的语音交互进化提供了可参考的落地路径。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。