AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

商汤开源SenseNova-Vision统一视觉大模型 单模型领跑四大核心视觉任务

2026年7月13日,商汤科技正式发布并全面开源旗下日日新大模型体系全新产品SenseNova-Vision统一视觉大模型。该模型首次实现视觉能力在通用基础模型中的原生嵌入,突破了传统统一视觉方案多专家模型打包的割裂架构,单模型在四大核心视觉领域评测中性能比肩甚至超越专用专家模型,标志着视觉大模型架构实现关键升级。

长期以来,AI视觉领域始终面临“任务碎片化”困境:要实现完整的视觉感知能力,往往需要同时调用目标检测、语义分割、OCR识别等多个独立的专用模型,不仅部署成本高,不同模型的输出标准不统一还会直接影响复杂场景下的识别精度。

过去几年,行业曾推出多款号称“统一视觉”的解决方案,但其本质都是把多个独立训练的专家模型打包封装,仅给开发者提供统一的调用接口,底层参数和数据链路仍然相互割裂,无法实现跨任务的信息共享。
这种架构下,一旦遇到稠密小目标检测、长尾类别识别等复杂场景,很容易出现不同模型输出结果冲突的问题,开发者往往需要额外投入大量精力做结果对齐,反而拉高了应用落地的门槛。

本次发布的SenseNova-Vision核心变革在于,将视觉感知能力作为通用大模型的原生能力嵌入底层架构,而非在通用大模型之外外挂独立的视觉模块,所有视觉任务共享同一套底层参数,信息可以在不同任务之间自由流动,从根源上解决了多模型割裂的问题。
在公开基准测试中,该单模型同时在结构化视觉理解、稠密几何预测、语义分割、多模态交互四大核心视觉领域实现性能领跑:其中结构化视觉理解赛道的目标检测、指代检测、OCR、关键点定位等任务表现全面优于同类通用视觉模型,稠密小目标检测、长尾类别识别等传统难点场景的精度提升尤为明显;稠密几何预测赛道的深度估计、表面法向估计精度已经达到专用几何模型的同等水准,可直接适配室内外导航、工业三维建模等场景需求。

商汤本次对SenseNova-Vision采取全面开源策略,所有开发者都可以免费获取模型权重进行二次开发。对于产业端而言,单模型覆盖多任务的特性可以大幅降低AI视觉应用的部署成本,原本需要适配十余个专用模型的应用场景,现在仅需调用一个模型即可覆盖全部需求,大幅降低开发和算力成本。
此外,由于视觉能力是通用大模型的原生组成部分,该模型可以直接和大语言模型能力打通,为多模态交互、生成式AI创作等场景提供更稳定的视觉输入能力,推动通用人工智能的落地进程进一步加快。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。