2026年4月29日公开的SuperCLUE最新文生图模型评测结果显示,OpenAI于4月21日上线的新一代文生图模型GPT Image 2,正式超越谷歌此前的榜首产品Nano Banana2登顶全球第一。该模型在画质、指令理解、细节还原维度均实现突破,尤其汉字生成板块获93.07分、文字准确度满分,解决了海外模型汉语文本生成的长期痛点。
文生图赛道的技术迭代速度正在不断刷新行业认知,OpenAI本次推出的GPT Image 2仅上线8天就拿下全球权威评测榜首,甚至打破了谷歌Nano Banana2保持半年的冠军纪录,在全球AI开发者社区引发了广泛讨论。
本次SuperCLUE的文生图评测覆盖了画质精细度、指令遵循度、创意匹配度、文字生成能力、复杂场景还原度5大核心维度,累计测试用例超过2000条,是目前全球覆盖场景最广的中文语境文生图评测之一。测试结果显示,GPT Image 2在全部5个维度中的4个拿到最高分,其中汉字生成能力的93.07分,较第二名Nano Banana2高出11.8分,文字准确度更是拿到了满分评级,领先优势十分明显。
长期以来,海外厂商推出的文生图模型普遍存在汉字生成痛点,要么出现乱码、错字,要么生成的文字与场景材质脱节,存在明显的“漂浮感”,无法满足中文市场的商业使用需求。本次GPT Image 2针对性补齐了这块短板:不仅能精准生成笔画复杂的生僻字,还能实现文字与亚克力、青花瓷、金属浮雕等不同材质的自然融合,彻底解决了文字与场景割裂的问题。有创意从业者测试后表示,以往用海外模型生成带汉字的商业物料,后期修正成本占总工作量的60%以上,现在GPT Image 2的输出成果基本可以直接使用。
除了文字能力的突破,GPT Image 2在复杂场景的复刻上也展现了远超同类产品的指令遵循度。测试中,无论是充满烟火气的老式面包店(需要还原墙皮斑驳痕迹、玻璃水汽、价签手写字体等多重细节),还是动态感极强的非遗打铁花场景(需要准确呈现火花飞溅轨迹、人物面部的暖色反光、打铁工具的金属质感),GPT Image 2的还原准确率都超过了90%,远高于同类产品70%左右的平均水平。这种精细化的还原能力,也让文生图模型在非遗数字化、工业设计、影视概念图制作等专业领域的落地成为可能。
此次榜首易主也释放出清晰的信号:文生图赛道的竞争已经从“能不能生成”转向“生成得够不够精准”,针对特定区域市场的本地化优化、专业场景的适配能力正在成为核心竞争力。据了解,目前包括谷歌、Meta以及国内多家AI厂商都在筹备新一代文生图模型的发布,预计未来12个月内,文生图模型的画质精度、指令理解能力还会出现新一轮升级,行业的商业化落地节奏也将进一步加快。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。