问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年4月24日,社交平台Soul旗下AI研发机构Soul AI Lab宣布开源业内首个14亿参数实时数字人生成模型SoulXFlashTalk。该模型可实现亚秒级交互延迟、每秒32帧高帧率输出,本次开放包含项目页面、技术报告、源代码与模型权重全套资源。此前Soul已开源语音合成模型SoulXPodcast,此举进一步完善了其“语音+视觉”双模态开源布局,将有效降低行业研发门槛。
当下实时数字人已经广泛落地在虚拟陪伴、直播带货、在线客服等多个To C和To B场景,行业对交互体验的要求正在持续提升。流畅的实时交互要求模型同时满足低延迟和高帧率两个核心条件,此前多数高性能实时数字人技术掌握在少数大厂手中,以闭源形式对外提供服务,中小团队很难获取可商用的高性能开源方案,行业创新门槛始终居高不下。
本次SoulXFlashTalk的最大亮点,就是在14亿参数的规模下实现了亚秒级延迟与32fps高帧率的兼顾,这也是业内首个达到该参数规模的开源实时数字人生成模型。不同于很多仅开放部分资源的开源项目,Soul AI Lab这次一次性开放了全套开发资源,从项目说明、技术报告到可运行的源代码、完整模型权重全部对外开放,开发者可直接基于模型进行二次开发。
早在2025年10月,Soul就已经开源了语音合成模型SoulXPodcast,本次数字人模型的开源,正式补全了“语音+视觉”双模态开源矩阵,让开发者可以一站式获取从语音生成到视觉驱动的全套开源解决方案。
Soul方面表示,本次开源并非单次技术输出,而是公司长期AI开放战略的一部分。通过开放核心技术, Soul希望降低中小开发者和初创企业的研发门槛,让更多团队可以将精力放在场景创新上,而非基础模型训练。未来Soul还将持续沿着开源路线推进,计划开放更多AI领域的技术成果,覆盖多模态交互更多环节。
随着实时交互需求的爆发,开源技术的涌入也将加速数字人应用在更多垂直场景的落地,催生更多创新玩法和商业可能性。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。