AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

蚂蚁集团开源LingBot-Vision 破解具身智能空间感知核心难题

2026年7月,蚂蚁集团旗下具身智能公司Robbyant正式开源LingBot-Vision模型家族。该模型基于自监督视觉Transformer架构,采用创新“边界建模”技术,突破现有视觉模型偏重物体识别的局限,密集空间感知任务多项指标超越参数规模数倍的顶尖大模型,为机器人实现精准物理空间感知提供了全新技术路径。

配图

在工业分拣、家庭服务等场景的落地测试中,超过6成的具身机器人故障都来自空间感知误差:明明识别出了面前的玻璃杯,却因为误判距离碰倒容器,或是抓握时卡到杯沿导致任务失败。这一困扰行业多年的难题,最近迎来了低成本的解决方案。

过去几年,视觉大模型的语义识别能力已经达到接近人类的水平,但绝大多数通用视觉模型的训练目标都围绕“识别物体是什么”展开,对机器人交互必须的深度、轮廓、相对位置等几何信息敏感度极低。

如果要让机器人获得空间感知能力,此前行业的通用方案是搭配激光雷达、深度相机等硬件,再单独训练小模型适配,单台机器人的感知成本就超过千元,大规模落地难度极高。

此次开源的LingBot-Vision完全跳出了通用视觉模型的训练框架,首次将“边界识别”作为预训练阶段的核心目标。研发团队引入了掩码边界建模技术,在预训练阶段就优先让模型学习识别图像中信息最丰富的物体边缘、轮廓区域,不需要额外的深度数据标注,就能同步获得语义识别和几何空间感知能力。

公开测试数据显示,参数仅3B的LingBot-Vision,在密集空间感知的7项基准测试中平均得分超过了参数规模达17B的通用视觉大模型,部分涉及抓取边界识别的任务指标领先幅度超过20%,同时推理延迟仅为同类大模型的1/5,可直接部署在机器人端侧的普通算力芯片上运行。

此次Robbyant开源的内容不仅包含LingBot-Vision的全部预训练权重,还同步开放了面向工业、家用场景的微调数据集和推理部署工具,中小团队不需要投入百万级的训练成本,最快3天就能完成适配,让自己的机器人产品获得精准空间感知能力。

据了解,Robbyant后续还计划将LingBot-Vision与自研的具身动作规划框架打通,推出端到端的具身智能开发套件,预计可将服务类机器人的交互任务成功率提升至少30%,推动具身智能产品从实验室测试走向大规模商用落地。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。