问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
近日,AI研究团队MirroS推出全新智能体循环框架Code-as-World,可将真实世界拍摄的视频内容自动转换为可执行的MuJoCo物理引擎程序。该框架通过自校正代理循环优化视觉语言模型的输出精度,无需人工标注即可还原视频中的物体属性、运动逻辑与物理约束,为机器人仿真、数字孪生等场景提供了全新技术路径。
---
当前机器人训练、数字孪生等领域普遍面临物理仿真环境搭建成本高、周期长的痛点:传统方案需要专业工程师手动标注物体参数、设置碰撞规则,一段10秒的多物体交互视频往往需要3-5天的人工开发周期,远远跟不上AI智能体训练的快速迭代需求。
而现有视觉语言模型虽然已经具备较强的视频内容识别能力,能准确标注出视频中的物体类别、动作类型,却无法直接输出符合物理引擎规范的可执行代码,两者之间的转换环节一直是行业公认的技术瓶颈。
Code-as-World的核心创新在于构建了闭环自校正的智能体执行链路:首先由视觉语言模型解析输入视频中的物体形状、材质、运动轨迹,初步生成MuJoCo格式的物理代码——作为目前全球机器人研发领域应用最广泛的开源物理仿真引擎,MuJoCo此前的仿真程序基本依靠专业工程师手动编写。
随后框架会自动运行生成的初步代码,将输出的仿真视频和原始输入视频做帧级比对,自动修正摩擦系数、重力参数、碰撞规则等核心参数,直到两者的运动轨迹误差控制在5%以内。整个过程完全不需要人工介入,相比传统方案效率提升超过90%,哪怕是包含多物体碰撞、柔性形变的复杂视频场景,也能在1小时内输出可直接调用的仿真程序。
目前Code-as-World框架已经在工业机器人抓取训练、数字孪生场景快速搭建两个方向完成了POC验证:某头部工业机器人厂商通过该框架,将生产线工件抓取的仿真环境搭建周期从7天压缩到了4小时,后续训练的智能体在真实场景的迁移成功率也提升了37%。
据了解,团队接下来将重点优化框架对柔性物体、流体场景的适配能力,计划在2026年第四季度开放完整的API接口,供下游开发者免费调用,进一步降低物理仿真场景的搭建门槛。
---
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。