英伟达AI团队近期推出全新免训练智能体SpatialClaw,首次将代码作为空间推理任务的动作交互接口,在20项覆盖不同应用场景的行业通用基准测试中,实现平均59.9%的推理准确率,无需额外预训练即可适配多类空间感知需求,为AI机器人、自动驾驶感知、三维场景理解等下游领域的轻量化落地提供了全新技术方案。

当前空间推理技术已经成为AI从数字场景向实体场景渗透的核心能力门槛。现有主流技术路线大多通过微调多模态大模型实现空间感知能力,仅单场景的标注训练成本就超过30万元,跨场景适配时还需要重新完成数据采集、标注、微调全流程,平均部署周期超过2周,难以满足工业、汽车等领域的柔性落地需求。
不少行业用户反馈,现有空间推理方案的适配成本已经超过硬件采购成本的3倍,成为实体AI规模化落地的核心阻碍,行业普遍期待更轻量化、适配性更强的通用方案出现。
SpatialClaw的核心创新在于打破了传统智能体依赖自然语言指令、定制化动作库完成空间推理的路径,直接将代码作为智能体与物理场景的交互接口:智能体无需针对特定场景学习专属动作指令,而是通过生成可执行代码直接调用空间感知、坐标计算等通用工具完成推理任务。
公开测试数据显示,该方案在覆盖静态三维场景识别、动态物体轨迹预判、复杂环境路径规划等20项行业通用基准测试中,平均准确率达到59.9%,较同类型免训练方案准确率提升近22个百分点,推理延迟较微调类方案降低43%,针对全新场景的部署周期可压缩至4小时以内。
业内人士分析,SpatialClaw的出现首次实现了高准确率空间推理能力的轻量化部署,未来将率先应用在工业柔性机器人、自动驾驶边缘感知、AR设备空间交互三大场景:以工业机器人场景为例,引入SpatialClaw后,产线换型时无需重新训练机器人空间识别模型,仅需上传新产线的三维参数即可完成作业路径规划,单产线适配成本可降低80%以上。
据了解,英伟达后续将把SpatialClaw的核心能力整合到旗下Isaac机器人开发平台中,下半年将向开发者开放免费调用接口。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。