7月11日,蚂蚁集团旗下具身智能业务线Robbyant正式发布原生面向物理AI的因果视频动作模型LingBot-VA 2.0。该模型搭载专属前瞻性推理框架,可实现对物理世界动态动作的提前预判与实时响应,填补了具身AI在复杂动态场景下低延迟决策领域的技术空白,为产业落地提供了全新技术底座。

过去几年,具身AI(物理AI)被视为AI产业下一个核心落地赛道,但技术瓶颈始终制约其规模化应用:此前主流的多模态大模型多基于通用架构改造,仅能实现对当前画面的感知识别,无法预判物理世界的动态变化,决策延迟普遍超过300毫秒,完全无法满足服务机器人、工业自动化等场景的低延迟需求。
在这样的行业背景下,原生适配物理世界决策逻辑的大模型,成为所有玩家攻关的核心方向。
和业内基于通用大模型改造的具身决策方案不同,LingBot-VA 2.0是国内首个底层原生面向物理AI场景设计的因果视频动作模型,从架构层面就嵌入了因果推理逻辑,不需要通过事后标注的数据反向拟合动作规律,而是可以通过连续帧的输入直接推导物体运动、动作发生的因果关系。
测试数据显示,该模型可实现最长10帧的前置动作预判,整体决策延迟比行业平均水平低62%,动态场景决策准确率提升47%,完全适配毫秒级响应需求的工业、消费级具身设备场景。
据了解,该模型首先将落地蚂蚁集团内部的智能仓储机器人、线下服务实体机器人场景,解决现有机器人在动态人流、复杂仓储环境下的避障、分拣效率问题。
未来Robbyant团队还将开放模型轻量版本的权重,面向工业自动化、智能家居机器人、自动驾驶边缘决策等领域的合作伙伴提供技术支持,进一步降低具身AI的落地门槛。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。