2026年4月,OpenAI旗下AI绘图模型GPT Image2凭借出众生成效果引发全球科技圈关注,其幕后核心团队首度曝光:仅13名成员,耗时4个月完成底层架构彻底重写,项目负责人陈博远将其定义为“图像领域的GPT”,实现通用性大幅突破。陈博远此前为Sora核心研发成员,曾在Google参与Gemini 2.0相关技术开发。
最近打开海外社交平台,满屏都是GPT Image2生成的精准渲染多语种文字的海报、光影细节近乎实拍的户外风景图,不少设计师用户直呼“AI绘图的最后一块短板被补上了”。这款上线仅一周就突破千万次调用量的模型,幕后团队的配置却出乎所有人意料。
不同于行业内动辄上百人的大模型研发团队,GPT Image2的核心研发团队仅由13人组成,从正式立项到产品上线只用了4个月时间。陈博远在公开演示中透露,团队没有在原有文生图模型的基础上做局部迭代,而是彻底重写了整套底层生成架构,最终实现的效果是模型对复杂指令的理解准确率提升了72%,多语种文字渲染正确率超过98%,远超目前市面主流文生图产品。
此前行业普遍认为,文生图模型要实现通用性突破,必须依靠大规模团队和超长时间的迭代训练,GPT Image2的出现打破了这一固有认知,也给不少中小团队的大模型研发提供了新的技术思路。
作为此次项目的负责人,陈博远的成长路径也堪称AI行业的励志样本。高中时期参加科研营时,他甚至还不会Python编程语言,读博期间就提出了Diffusion Forcing扩散强制生成创新范式,成为后续多款文生图、文生视频模型的核心技术基础。加入Google工作期间,他主导研发的指令微调技术,后来被直接应用到了Gemini 2.0的多模态模块中。
加入OpenAI之后,陈博远先后主导了GPT系列图像模型的全流程训练工作,同时也是Sora视频生成团队的核心成员,在多模态融合领域拥有丰富的研发经验,是这次GPT Image2能快速实现突破的核心原因。
陈博远将GPT Image2称为“图像领域的GPT”,核心指向的就是其和此前所有文生图模型本质的区别:通用性能力的飞跃。过往的文生图模型大多针对特定场景优化,一旦涉及跨领域的指令组合、小语种文字渲染、复杂逻辑的场景搭建,就很容易出现元素错乱、内容不符合要求的问题。
而GPT Image2实现了和大语言模型类似的通用理解能力,演示中仅用一句指令就生成了同时包含中、韩、孟加拉三种语言的商业海报,文字排版、字体设计完全符合专业设计标准,不少设计从业者测试后表示,这款模型已经可以覆盖80%以上的日常商用设计需求。
业内分析认为,GPT Image2的落地意味着OpenAI在多模态领域的技术布局已经形成了从图像到视频的完整链条,后续可能还会将相关技术复用至3D生成、AR内容生成等场景,进一步拓宽生成式AI的应用边界。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。