2026年4月16日,腾讯混元团队正式发布并开源新一代多模态世界模型混元3D世界模型2.0(HY-World2.0)。该版本实现了从生成视频到产出可交互、可编辑3D资产的功能升级,支持文本、图像、视频三类模态输入,可自动生成包含人、物、景的完整3D空间,兼容多种3D格式导出,能无缝对接Unity、UE等主流游戏引擎,为3D创作与游戏开发领域提供了新的开源工具。
相比此前版本,混元3D世界模型2.0最大的突破,是完成了从生成视觉片段到交付可落地开发资产的功能跨越。该模型统一了空间理解、生成与重建的全流程,带来三项关键技术升级。
端到端隐式学习方案HY-Pano-2.0模型,可在无需提前提供相机参数的情况下完成360度全景映射,大幅降低了输入门槛;自研空间Agent技术,结合视觉语言模型(VLM)与navmesh表征,让模型具备智能规划场景漫游轨迹的能力,可直接适配虚拟空间交互需求;WorldStereo机制,则解决了新增场景拼接的一致性问题,确保新生成区域与既有场景在几何结构、视觉效果上高度统一。
模型生成的3D空间支持导出Mesh、3DGS、点云等多种通用格式,能无缝接入现有产业开发流程。
当前3D内容产业长期面临共性痛点:高质量3D空间资产的生产高度依赖专业美术团队,开发周期长、成本高,中小团队和独立开发者很难负担大规模场景开发的投入。
这次腾讯混元团队将混元3D世界模型2.0完全开源,相当于把成熟的3D生成能力开放给全行业。创作者无需复杂的专业设备和高阶建模经验,只需输入文字描述、参考图或者实拍视频,就能一键生成完整的可编辑3D空间,直接用于项目开发,可将3D场景的生产周期从数周压缩到数小时,大幅降低了创作门槛,尤其为中小游戏团队、XR内容创作者留出了更多创新空间。
近年来,大语言模型技术逐步成熟后,3D世界模型已经成为全球AI领域布局的核心新赛道,这类模型能生成可交互的虚拟空间,是游戏、数字孪生、XR等下一代数字产业的核心基础技术。
此前多数公开的3D生成模型仍停留在视觉演示阶段,产出内容无法直接对接产业开发流程。混元3D世界模型2.0的开源,进一步推动了3D生成技术从实验室走向产业落地,也为全球开发者提供了可定制修改的基础模型,有望加速整个领域的技术迭代与创新落地。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。