商汤开源SenseNova-Vision-7B-MoT 多任务视觉基座获重要突破

2026年7月14日,商汤科技正式开源多任务视觉模型SenseNova-Vision-7B-MoT,该模型将目标检测、OCR、深度估计等6类核心视觉任务集成于7B参数单一架构,同时开放5000万样本语料子集与完整复现工具包,为视觉理解、GUI智能体开发提供高通用性基座支撑,引发AI视觉领域广泛关注。

配图

过去很长一段时间,AI视觉落地都面临“多任务适配难”的普遍困境:面向同一应用场景,开发者往往需要同时部署目标检测、OCR、图像分割等多款专用模型,不仅占用大量算力资源,也会因多模型调度产生额外推理延迟,拉高了商业化落地的门槛。

在GUI智能体、工业质检、自动驾驶感知等高频场景中,多视觉能力组合已经成为刚需:比如操作电子设备的GUI智能体需要同时完成界面元素识别、文字读取、控件深度位置判断三类任务,传统方案至少要部署3款不同的视觉模型,端侧部署难度极高,这也是此前GUI智能体难以规模化落地的核心阻碍之一。

此次商汤推出的SenseNova-Vision-7B-MoT,核心优势就在于用单一架构实现了多任务能力的原生整合。7B参数的小体量下,即可覆盖目标检测、OCR、深度估计、法线估计、图像分割、多视图处理6类核心视觉任务的能力需求,无需额外挂载专用模型就能完成复杂场景的视觉信息提取。

更值得关注的是,该模型突破了传统视觉模型的任务边界,支持开发者通过自然语言定义全新的视觉任务变体,无需重新进行大规模预训练就能快速适配定制化需求,实现了视觉能力的灵活重组。

为了降低开发者使用门槛,商汤此次采取了全栈开源策略:除了模型权重完全开放外,还同步开放包含5000万个样本的SenseNova-Vision语料库子集,以及完整的数据处理、模型复现工具包,中小团队也能基于该模型快速开发定制化视觉应用。

业内分析认为,SenseNova-Vision-7B-MoT的开源,将直接降低多任务视觉应用的开发门槛,此前受限于算力成本和部署难度的细分场景,比如端侧智能交互、工业柔性质检、无人设备感知等,都将迎来落地加速。

其中受益最明显的当属快速发展的GUI智能体赛道:统一视觉基座的出现,让智能体对界面信息的感知效率提升30%以上,端侧部署的硬件要求也大幅下降,未来普通消费级设备也有望跑通完整的GUI智能体能力,人机交互模式可能会迎来新一轮变革。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。