问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
AI大模型厂商StepFun于近期正式推出端到端实时语音大模型StepAudio 2.5 Realtime,该产品搭载角色扮演场景专属RLHF(人类反馈强化学习)机制,具备业界领先的副语言感知理解能力,可实现120毫秒以内的超低延迟语音交互响应,预计将在虚拟陪伴、AI客服、有声内容创作等多个场景实现规模化落地。
不少有过AI语音角色扮演体验的用户都有过类似困扰:等待AI回复的延迟动辄超过半秒、预设的温柔人设突然说出生硬的官方话术、自己开玩笑的语气被AI当成认真提问,这些长期存在的行业痛点,正在被新一代语音大模型针对性解决。
随着虚拟陪伴、AI互动内容等赛道快速增长,语音交互已经成为大模型落地的核心场景之一。据第三方研究机构数据显示,2025年全球AI实时交互场景市场规模突破270亿美元,仅国内角色扮演类AI应用的月活用户就超过8000万。
但此前市面上的主流语音大模型大多存在三个核心痛点:一是端到端延迟普遍在300毫秒以上,交互割裂感强;二是人设一致性差,长时间对话容易出现风格偏离;三是仅能识别语音对应的文字内容,无法感知用户的语气、情绪等副语言信息,交互真实感不足。
本次StepFun推出的StepAudio 2.5 Realtime,针对上述行业痛点做了三大定向升级。
首先是角色扮演专属RLHF训练框架,团队针对超过200种常见的虚拟人设收集了近10万小时的真实互动语音数据做强化学习训练,确保模型在长时间对话中可以保持稳定的语音风格、语气习惯,不会出现人设“崩塌”的问题。
其次是新增的副语言感知能力,模型可以准确识别用户语音中的停顿、叹气、笑声、语气轻重等非文字信息,判断用户的情绪状态和潜在需求,给出匹配语境的语音回应,比如用户情绪低落时会主动放缓语速、调整语气。
最后是端到端架构的优化,团队将语音识别、大模型推理、语音生成三个环节的链路做了深度整合,最终实现120毫秒以内的超低响应延迟,比行业平均水平低60%,完全达到面对面交流的流畅度标准。
据了解,StepAudio 2.5 Realtime已经开放API接口供下游客户测试,目前已有超过20家虚拟陪伴、智能客服、有声内容平台达成了合作意向。
行业分析师认为,这款产品的落地将进一步拉高语音大模型的行业准入门槛,未来具备特定场景专属优化能力的垂直语音大模型,将比通用语音模型拥有更高的商业化价值。除了To B场景的落地之外,StepFun也透露后续可能会面向C端用户推出基于该模型的互动应用,降低普通用户体验高保真AI语音交互的门槛。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。