2026年7月,AI研究团队正式推出全新物理世界模型PhiZero,其首创的“物理语言”离散表征技术,跳出传统视频生成模型直接预测像素的技术路径,通过先完成显式物理推理再渲染视频的流程,有效解决了长期存在的物理规律模拟偏差问题,被业内视为推动具身智能落地的核心技术突破。
---
过去两年,AI视频生成技术的迭代速度远超行业预期,从几秒的模糊片段到数分钟的高清叙事,生成效果已经接近普通实拍素材,但藏在流畅画面下的物理规律bug却始终是行业悬而未决的难题。据业内统计,现有主流视频生成模型在时长超过1分钟的动态场景生成中,出现违背物理规律错误的概率超过60%:前一秒还完好的玻璃杯掉到地上突然消失、行驶的汽车毫无预兆穿过墙体,这类违背常识的错误,让现有视频生成模型很难承担具身智能训练模拟器的功能。
作为PhiZero的核心创新,物理语言是一套通过自监督学习从海量真实野外视频中提炼出来的离散表征体系,它本质上是把不同物体的运动规律、碰撞反馈、状态变化等动态演化逻辑,编码成AI可以直接运算的符号体系,相当于为AI搭建了一套真实世界的“动力学词典”。
在此基础上,团队打造了“先推理、后渲染”的双层架构:系统首先在物理语言空间内自回归推演未来场景的演变轨迹,确认所有动态符合物理规则后,再交由专用扩散解码器生成高清视频。这种将底层动力学推演和像素级合成分离的设计,让模型的物理一致性表现较传统方案提升了70%以上,即便是10分钟以上的长视频生成,也很少出现违背物理常识的错误。
在业内看来,PhiZero的出现补上了世界模型走向实用的最关键短板。短期来看,该技术可以直接用于生成高物理一致性的长视频、影视特效素材,避免现有AI生成内容后期需要大量修正物理bug的问题,预计可将内容生产效率提升40%以上。
长期来看,对齐真实物理规则的世界模型,将成为具身智能、自动驾驶等领域的核心训练底座,研发人员可以在仿真环境中完成90%以上的策略训练,再迁移到真实场景中,大幅降低实体AI的训练成本和落地风险。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。