问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年4月,腾讯Robotics X实验室联合腾讯混元团队正式推出专为具身智能打造的HY-Embodied-0.5基础模型,在22项行业通用具身评测中拿下16项最优成绩刷新纪录。该系列模型从架构到训练范式全链路重构,同步推出MoT-2B、MoE-32B两款主力模型,可填补通用视觉语言模型三维空间感知与物理交互能力短板,推动大模型向机器人控制领域延伸。
在人形机器人、工业自动化赛道持续升温的2026年,具身大模型的性能上限,已经成为制约机器人从封闭预演场景走向真实复杂环境的核心瓶颈。此前行业普遍采用对通用视觉语言模型进行定向微调的方案开发具身大模型,始终难以解决空间感知精度不足、交互决策延迟高的问题。
过往通用视觉语言模型(VLM)的训练数据以互联网文本、平面图像为主,缺乏对三维空间结构、物体物理属性的学习积累,直接应用到机器人场景时,经常出现对空间距离判断错误、无法预判交互动作后果的问题。
而此前行业的定制化微调方案,一方面适配成本极高,单一场景的微调就需要百万级专属数据,另一方面模型泛化能力极差,更换场景后性能跳水明显,无法支撑通用机器人的落地需求。
此次发布的HY-Embodied-0.5系列并非通用基座的简单微调,而是从底层架构到训练范式的彻底重构。团队同步推出两款定位差异的主力模型:**MoT-2B(总参数量4B,激活参数2B)主打端侧实时响应**,可直接部署在机器人本体无需联网;**MoE-32B(总参数量407B,激活参数32B)追求极致推理性能**,适配云端复杂场景决策需求。
技术层面,团队**首创视觉与语言模态非共享参数的混合Transformer(MoT)架构**,配合原生分辨率视觉编码器HY-ViT2.0与视觉潜在Token机制,有效避免了小模型在多模态训练中的灾难性遗忘问题,同时保留了足够的空间细节感知能力。训练环节则依托**超1亿条高质量具身专属数据**,结合拒绝采样微调、强化学习等方案优化模型决策精度,最终在22项行业通用具身评测中拿下16项最优,刷新了行业纪录。
业内人士认为,此次腾讯发布的具身大模型覆盖了端侧、云端两大需求场景,有望降低机器人厂商的大模型适配成本。此前腾讯Robotics X实验室已经在四足机器人、人形机器人领域积累了多年的实体研发经验,结合混元团队的大模型技术优势,该系列模型大概率会率先落地腾讯内部的机器人项目,后续大概率会向行业开放API接口,推动工业巡检、家庭服务、精密制造等多个场景的机器人商业化落地。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。