AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

李飞飞团队发布多模态世界模型Atlas 开辟AGI技术新路径

2026年9月,人工智能领域先驱李飞飞携World Labs团队在投资机构a16z的前沿技术论坛上首次公开自研多模态世界模型Atlas。该模型打破大语言模型预测下一token、视频模型预测下一帧的传统范式,以“新视角预测”为核心,可基于少量视角图像或文本生成任意时空视角画面,原生支持多模态数据处理,被视为AGI领域的突破性方向。

作为硅谷顶级风投机构a16z每年最受关注的AI前沿论坛环节之一,李飞飞团队的这次亮相几乎承包了2026年9月初全球AI圈的全部讨论热度。毕竟在大语言模型参数迭代陷入边际效应递减、生成式AI落地场景长期集中在内容生产领域的当下,整个行业都在寻找下一个能够推动AGI落地的核心技术支点。

过去十年,AI领域的核心技术突破始终围绕两大预测逻辑展开:大语言模型以“下一token预测”为核心,实现了自然语言理解与生成能力的跃迁;视频生成模型以“下一帧预测”为核心,推动了AIGC内容生态的爆发。

但随着技术迭代深入,两大路径的固有缺陷也逐渐暴露:大语言模型始终无法完全解决幻觉问题,很难适配对精准度要求极高的工业、机器人场景;视频生成模型的长时序时空一致性问题迟迟得不到突破,传统三维重建技术又依赖高密度的多视角采集数据,落地成本居高不下,整个行业都在呼唤新的技术范式。

Atlas的核心突破,正是跳出了上述两大传统预测逻辑的框架,首次将“新视角预测”作为模型的核心优化目标。

简单来说,用户只需要向Atlas输入某一场景的若干张不同视角的照片,甚至仅输入一段描述场景的文字,模型就可以精准输出该场景内任意时空位置的画面,无需额外的采集或建模工作。

更关键的是,Atlas首次实现了“生成”与“重建”能力在同一模型内的深度融合,可以原生处理文字、图像、视频、3D数据以及相机位姿等多模态输入,不需要搭配额外的算法模块即可完成从需求到三维场景输出的全流程。李飞飞团队在现场分享中表示,“新视角预测”的核心地位,完全可以和大语言模型的“下一token预测”相提并论,是构建能够理解真实物理世界的世界模型的核心原语。

从目前披露的技术参数来看,Atlas的落地场景几乎覆盖了所有需要三维空间理解的领域:在影视、游戏内容生产领域,Atlas可以将全视角场景的制作成本降低90%以上,制作周期从数周压缩到分钟级;在机器人领域,搭载Atlas的机器人只需要对环境进行简单扫描即可构建完整的空间模型,大幅提升自主导航、复杂环境交互的能力;在AR/VR领域,Atlas可以彻底解决当前元宇宙内容供给不足的痛点,普通用户也可以快速生成可交互的全视角虚拟场景。

不过研发团队也坦言,目前Atlas仍处于早期技术验证阶段,在1000平方米以上大场景的重建精度、推理速度等方面仍有优化空间,距离大规模商用落地仍需1-2年的技术迭代。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。