问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
近日字节跳动旗下AI研发团队Seed正式推出多模态大模型产品SeedRealtime,该产品是业内首款落地的原生音视频全双工大模型,单模型架构即可同步实现视觉感知、语音识别理解、自然语音生成能力,支持边听边说、实时响应的双向交互,端到端交互延迟较传统拼接式多模态方案降低42%,可广泛应用于智能硬件、虚拟人等多个交互场景。

不少用户都有过类似的体验:和智能语音助手对话时必须等它完成整段回复才能发出新指令,一旦中途打断就会出现识别混乱;带有视觉识别功能的智能硬件,往往需要等待数秒才能给出反馈,完全达不到自然交流的流畅度。这些痛点的核心,就在于传统多模态方案的拼接式架构瓶颈。
当前主流的音视频多模态交互系统,普遍采用“视觉识别模块+ASR语音转文字+大语言模型+TTS文字转语音”的拼接架构,不同模块之间的数据传输、格式转换会产生大量额外延迟,且很难支持全双工交互——也就是接收输入和生成输出无法同步进行。
公开数据显示,当前行业内带视觉能力的多模态产品端到端交互延迟普遍在800ms以上,部分复杂场景下甚至超过2s,远远高于真人对话200-300ms的舒适延迟阈值,这也是多数智能交互产品始终显得“生硬”的核心原因。
SeedRealtime的核心突破就在于摒弃了传统的拼接式设计,采用原生多模态统一架构训练,将视觉信号、语音信号和文本信号纳入同一个模型空间进行训练,不需要经过中间的格式转换环节。
该模型可直接同步输入音频流、视频流,直接输出连续的语音回复,省去了ASR、TTS的中间处理耗时,同时天然支持全双工交互:用户可以随时打断模型的发言,模型也能在生成回复的同时同步接收新的音视频输入,根据用户的语气、表情、手势实时调整回应内容。
不同于此前行业内仅支持语音的全双工大模型,SeedRealtime首次将视觉感知能力纳入全双工链路,根据公开的测试数据,其端到端最低延迟可低至300ms,已经和真人对话的延迟水平基本持平。
目前SeedRealtime已经在字节跳动内部的虚拟人直播、智能硬件原型产品中开启测试,测试数据显示,在虚拟人直播场景中,使用该模型的虚拟主播响应观众互动的速度提升了3倍,观众停留时长平均上涨27%。
后续字节跳动Seed团队还将逐步开放SeedRealtime的API接口,面向智能硬件、车载交互、教育硬件、虚拟数字人等多个领域的合作伙伴提供能力支持,业内预计,原生全双工多模态模型的落地,将推动下一代智能交互产品的体验升级,催生更多不需要触控、不需要唤醒词的自然交互产品。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。