2026年7月14日,商汤科技正式开源多任务视觉模型SenseNova-Vision-7B-MoT,该模型将目标检测、OCR、深度估计等6类核心视觉任务集成于7B参数单一架构,同时开放5000万样本语料子集与完整复现工具包,为视觉理解、GUI智能体开发提供高通用性基座支撑,引发AI视觉领域广泛关注。

过去很长一段时间,AI视觉落地都面临“多任务适配难”的普遍困境:面向同一应用场景,开发者往往需要同时部署目标检测、OCR、图像分割等多款专用模型,不仅占用大量算力资源,也会因多模型调度产生额外推理延迟,拉高了商业化落地的门槛。
在GUI智能体、工业质检、自动驾驶感知等高频场景中,多视觉能力组合已经成为刚需:比如操作电子设备的GUI智能体需要同时完成界面元素识别、文字读取、控件深度位置判断三类任务,传统方案至少要部署3款不同的视觉模型,端侧部署难度极高,这也是此前GUI智能体难以规模化落地的核心阻碍之一。
此次商汤推出的SenseNova-Vision-7B-MoT,核心优势就在于用单一架构实现了多任务能力的原生整合。7B参数的小体量下,即可覆盖目标检测、OCR、深度估计、法线估计、图像分割、多视图处理6类核心视觉任务的能力需求,无需额外挂载专用模型就能完成复杂场景的视觉信息提取。
更值得关注的是,该模型突破了传统视觉模型的任务边界,支持开发者通过自然语言定义全新的视觉任务变体,无需重新进行大规模预训练就能快速适配定制化需求,实现了视觉能力的灵活重组。
为了降低开发者使用门槛,商汤此次采取了全栈开源策略:除了模型权重完全开放外,还同步开放包含5000万个样本的SenseNova-Vision语料库子集,以及完整的数据处理、模型复现工具包,中小团队也能基于该模型快速开发定制化视觉应用。
业内分析认为,SenseNova-Vision-7B-MoT的开源,将直接降低多任务视觉应用的开发门槛,此前受限于算力成本和部署难度的细分场景,比如端侧智能交互、工业柔性质检、无人设备感知等,都将迎来落地加速。
其中受益最明显的当属快速发展的GUI智能体赛道:统一视觉基座的出现,让智能体对界面信息的感知效率提升30%以上,端侧部署的硬件要求也大幅下降,未来普通消费级设备也有望跑通完整的GUI智能体能力,人机交互模式可能会迎来新一轮变革。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。