GPT Image2幕后团队首度公开:13人4个月重构AI绘图底层架构

2026年4月,OpenAI旗下AI绘图模型GPT Image2凭借出众生成效果引发全球科技圈关注,其幕后核心团队首度曝光:仅13名成员,耗时4个月完成底层架构彻底重写,项目负责人陈博远将其定义为“图像领域的GPT”,实现通用性大幅突破。陈博远此前为Sora核心研发成员,曾在Google参与Gemini 2.0相关技术开发。

最近打开海外社交平台,满屏都是GPT Image2生成的精准渲染多语种文字的海报、光影细节近乎实拍的户外风景图,不少设计师用户直呼“AI绘图的最后一块短板被补上了”。这款上线仅一周就突破千万次调用量的模型,幕后团队的配置却出乎所有人意料。

不同于行业内动辄上百人的大模型研发团队,GPT Image2的核心研发团队仅由13人组成,从正式立项到产品上线只用了4个月时间。陈博远在公开演示中透露,团队没有在原有文生图模型的基础上做局部迭代,而是彻底重写了整套底层生成架构,最终实现的效果是模型对复杂指令的理解准确率提升了72%,多语种文字渲染正确率超过98%,远超目前市面主流文生图产品。

此前行业普遍认为,文生图模型要实现通用性突破,必须依靠大规模团队和超长时间的迭代训练,GPT Image2的出现打破了这一固有认知,也给不少中小团队的大模型研发提供了新的技术思路。

作为此次项目的负责人,陈博远的成长路径也堪称AI行业的励志样本。高中时期参加科研营时,他甚至还不会Python编程语言,读博期间就提出了Diffusion Forcing扩散强制生成创新范式,成为后续多款文生图、文生视频模型的核心技术基础。加入Google工作期间,他主导研发的指令微调技术,后来被直接应用到了Gemini 2.0的多模态模块中。

加入OpenAI之后,陈博远先后主导了GPT系列图像模型的全流程训练工作,同时也是Sora视频生成团队的核心成员,在多模态融合领域拥有丰富的研发经验,是这次GPT Image2能快速实现突破的核心原因。

陈博远将GPT Image2称为“图像领域的GPT”,核心指向的就是其和此前所有文生图模型本质的区别:通用性能力的飞跃。过往的文生图模型大多针对特定场景优化,一旦涉及跨领域的指令组合、小语种文字渲染、复杂逻辑的场景搭建,就很容易出现元素错乱、内容不符合要求的问题。

而GPT Image2实现了和大语言模型类似的通用理解能力,演示中仅用一句指令就生成了同时包含中、韩、孟加拉三种语言的商业海报,文字排版、字体设计完全符合专业设计标准,不少设计从业者测试后表示,这款模型已经可以覆盖80%以上的日常商用设计需求。

业内分析认为,GPT Image2的落地意味着OpenAI在多模态领域的技术布局已经形成了从图像到视频的完整链条,后续可能还会将相关技术复用至3D生成、AR内容生成等场景,进一步拓宽生成式AI的应用边界。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。