2026年7月,谷歌DeepMind团队推出全新多任务视觉分析模型GenCeption,该模型创新性地将视频生成AI逆向改造为视觉理解引擎,基于阿里开源的通义万相Wan2.1框架训练,仅用7500段Blender渲染的单人合成视频作为训练数据,即可通过单模型同时完成深度估计、图像分割、3D姿态估计等五项核心视觉任务,打破了过往视觉任务需独立部署专用模型的行业桎梏。

过往计算机视觉领域的商业化落地,始终绕不开“一个任务部署一套模型”的成本难题:要提取视频画面的深度信息,需要单独训练深度估计模型;要做语义分割,又要重新标注数据训练分割模型,多模型堆叠不仅算力开销大,不同模型输出的结果对齐也一直是行业痛点。此前包括OpenAI、Meta在内的科技巨头都在尝试研发通用视觉模型,但大多仍停留在有限任务兼容的阶段。
---
GenCeption的核心创新在于跳出了传统判别式模型的研发思路,转而将已经成熟的视频生成AI进行逆向改造。团队认为,生成模型在学习“如何生成真实视觉内容”的过程中,已经掌握了物体空间结构、纹理特征、运动规律等底层视觉逻辑,只需要对输出层进行调整,就能将其转化为高效的视觉理解引擎。
此次DeepMind选择基于阿里开源的通义万相Wan2.1生成框架完成训练,也侧面印证了开源生成框架在多模态复用场景下的技术潜力。GenCeption仅需一次前向传播即可输出全部五项任务的结果,用户只要输入对应的文本指令,就能同步拿到深度图、分割掩码、3D姿态参数、相机运动轨迹等多维度输出,处理效率较传统多模型组合方案提升3倍以上。
---
更让行业意外的是GenCeption的训练成本:其训练集仅包含7500段由Blender渲染的单人合成视频,没有使用任何真实世界的标注数据,训练算力开销仅为同类专用模型总和的1/5。
即便如此,该模型展现出了远超预期的泛化能力:不仅可以顺畅处理真实世界中的多人、复杂光照场景,对细节的保留精度甚至达到发丝级别,完全满足影视后期、工业质检等对精度要求极高的商用场景需求。
---
在行业人士看来,GenCeption的出现最大的价值不在于完成了多少项任务,而在于验证了“生成模型反向改造为判别模型”路径的可行性,这很可能重构整个视觉AI的研发和落地逻辑。
未来,自动驾驶的车端感知系统不需要再堆叠十余个专用模型,单模型即可输出所有环境感知参数;AR/VR设备的空间建模效率将提升数倍,时延进一步降低;而中小团队也不需要为每个视觉任务单独投入研发成本,通用多任务模型的普及将大幅降低视觉AI的落地门槛。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。