近日英伟达正式推出视觉AI开发框架DeepStream 9.1版本,首次将Agentic AI(智能体AI)能力融入视觉AI开发管线,新增13项原生智能体技能、多视图3D跟踪功能以及AutoMagicCalib自动校准工具,可大幅降低多摄像头自然语言交互视觉应用的开发门槛,是当前视觉AI与智能体技术融合的代表性落地成果。

随着智能体技术在通用场景的落地成熟,行业对视觉AI的需求已经从被动的识别分析,转向主动的任务执行、多源信息联动,传统框架的适配能力已经跟不上需求增速。智慧零售、工业质检、自动驾驶感知等多摄像头部署场景,普遍面临智能交互能力弱、多设备校准流程繁琐的痛点,开发者往往需要额外集成大语言模型、3D建模工具才能实现复杂功能,项目落地周期平均超过3个月,成本较单场景应用高出60%以上。
DeepStream 9.1的核心升级是原生集成Agentic AI能力,开发者无需额外对接第三方智能体框架即可快速搭建可交互的视觉应用。本次更新自带的13项原生技能,覆盖了自然语言指令解析、跨摄像头目标追踪、异常事件主动告警、场景动态建模等高频需求,此前开发者要实现同类智能体视觉功能,需要至少对接3款以上不同的第三方工具,开发代码量超过2万行,而使用DeepStream 9.1仅需要不足3000行代码即可完成同等功能开发。
本次更新还新增了两大实用功能:其一是多视图3D跟踪技术,最多支持同时接入24路高清摄像头,可实现对移动目标的跨设备连续3D轨迹还原,定位误差小于5厘米;其二是AutoMagicCalib自动校准工具,原本需要专业工程师花费2-3天完成的多摄像头校准工作,现在仅需要15分钟即可自动完成,校准精度提升40%。
英伟达相关负责人透露,后续DeepStream还将进一步开放智能体自定义技能接口,支持开发者接入自研大语言模型和垂直行业数据集,覆盖更多细分场景的定制化需求。目前已有超过20家工业视觉、智慧安防企业启动了基于DeepStream 9.1的产品适配,预计2026年第四季度相关落地产品将正式上市,有望带动相关场景的视觉AI应用渗透率提升15个百分点左右。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。