2026年4月28日,商汤科技正式发布并开源日日新SenseNova U1系列原生多模态模型,该产品基于商汤2026年3月自主研发的NEO-unify架构,摒弃主流拼接式设计,去除视觉编码器与变分自编码器,首次在单一框架下实现多模态理解、推理与生成的深度统一,标志着多模态AI从“集成式”向“原生统一”的核心技术跨越。
过去几年,多模态大模型的商业化落地始终卡在“兼容性”瓶颈上:绝大多数产品采用视觉模块与大语言模型拼接的设计,两种模态的信息转换过程中往往出现15%-20%的语义损耗,既容易出现文生图细节失真、图文理解答非所问等问题,也无法支撑需要实时空间感知、低延迟决策的具身智能场景。
行业调研显示,当前超过80%的多模态应用研发团队都需要为不同场景单独适配视觉、语言模块的接口,额外增加了30%以上的开发成本与推理延迟,行业迫切需要更底层的架构创新打破天花板。
此前主流多模态模型普遍采用“独立模块拼接”的设计思路:视觉信息先通过视觉编码器(VE)转换为特征向量,再输入大语言模型完成语义理解,生成类任务还要额外接入变分自编码器(VAE)完成像素转换。
这种架构虽然研发门槛低,但模态转换过程中的信息损耗难以避免,同时多模块串联也会推高推理延迟,根本无法满足具身智能、自动驾驶等需要毫秒级响应、厘米级空间识别的场景需求,已经成为制约多模态AI能力上限的核心短板。
此次商汤推出的日日新SenseNova U1,核心突破就在于底层采用了NEO-unify架构,彻底摒弃了主流模型普遍使用的拼接式设计,直接去除了视觉编码器(VE)与变分自编码器(VAE)两个独立模块,重构了统一的多模态表征空间。
与传统架构将多模态处理放在模型最后一层不同,NEO-unify架构将多模态融合深入到每一层计算环节,语言与视觉信息不再是“先转换再拼接”,而是作为统一复合体直接建模,在保留完整语义丰富度的同时,还能维持像素级的视觉保真度。
实测数据显示,该模型在逻辑推理、空间智能两大核心赛道的表现较主流拼接式模型提升超过40%,能够精准识别物理世界的复杂空间布局、拆解物体之间的精细关联,不会出现传统多模态模型常见的“视觉识别正确但语义理解偏差”的问题。
商汤方面透露,此次选择全量开源日日新SenseNova U1,一方面是为了推动多模态AI的技术普惠,中小研发团队无需再投入大量资源搭建多模态融合底层架构,可直接基于该模型进行场景化适配。
另一方面,随着具身智能产业进入落地关键期,商汤计划将该模型作为机器人的具身大脑核心底座,未来可在单一模型的闭环内完成从环境感知、逻辑推理到动作指令生成的全流程处理,大幅降低具身机器人的系统复杂度与响应延迟。
业内分析师认为,原生统一多模态架构的出现,意味着多模态AI正式告别“拼凑时代”,接下来将会催生更多需要跨模态实时交互的创新应用,除了具身智能之外,自动驾驶、智能交互终端、工业质检等场景都将率先受益。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。