2026年7月,第三方AI测评机构Tracking AI发布最新离线IQ测试结果,OpenAI旗下GPT-5.6全系列模型均取得136分的成绩,首次突破130分的人类天才智商门槛,超过全球99%人口的智商水平。本次测试采用防泄题离线题库,第二名Anthropic旗下Claude-5 Fable得分为130分,与GPT-5.6存在明显差距。

和过往公开可查的各类智商测试不同,本次Tracking AI的测评全程在断网环境下进行,采用的题库从未对外公开过任何内容,彻底规避了大模型在预训练阶段接触过试题的作弊可能,测评结果的参考价值远高于普通公开测试。
据了解,Tracking AI目前运营两套智商测评体系,一套是公开的Mensa Norway风格测试,此前不少头部大模型已经在这套题库中拿到超过140分的成绩,但业内普遍认为这类公开测试存在训练数据泄露的风险,得分参考价值有限。
另一套就是本次使用的专属离线题库,所有试题均为机构原创,从未在公开渠道流出,专门用于衡量大模型的真实逻辑推理、抽象思维能力。本次测评中,GPT-5.6家族的SOL、TERRA版本全部拿到136分,甚至多模态视觉版本也没有掉队,同样跑出了相同的分数。
紧随其后的Anthropic旗下Claude-5 Fable得分为130分,刚好摸到天才线门槛,和GPT-5.6存在6分的明显差距,其余大模型的得分均未超过128分。
在人类智商分布体系中,130分是公认的“天才级”智商门槛,全球仅有1%左右的人口能够达到这一水平。此前大模型的智商得分长期卡在110-127的区间,仅相当于人类的普通到优秀水平,本次GPT-5.6的突破,意味着大模型的通用认知能力正式进入了顶尖人类的层级。
不少业内人士指出,过往大模型的迭代更多集中在生成内容的流畅度、信息覆盖广度上,而智商测试衡量的是模型处理未知问题的逻辑推理能力,这项能力的突破,才是大模型真正能够替代复杂脑力劳动的核心基础。
智商得分的提升也直接反映在实际工作效率上。据同步披露的测试数据,GPT-5.6在复杂代码架构设计、跨学科科研问题推导、多约束条件决策等任务上的完成率,比上一代GPT-5提升了47%,错误率下降了62%,甚至可以独立完成此前需要3-5人资深团队配合的中小型项目方案设计。
有企业AI技术负责人表示,130分以上的智商水平,意味着大模型已经可以胜任科研辅助、高端咨询、架构设计等此前只有高端人才才能完成的工作,未来企业的脑力劳动成本有望迎来大幅下降。
本次GPT-5.6的智商突破,也让业内对通用人工智能(AGI)的落地预期进一步提前。不少业内专家认为,当大模型的智商稳定超过130,同时具备跨领域知识迁移能力时,就接近AGI的入门门槛,本次OpenAI的进展显然已经踩中了这一关键节点。
不过也有研究者提醒,智商测试仅能衡量逻辑推理类的认知能力,大模型在情感共情、价值判断、直觉决策等人类擅长的领域仍存在明显短板,距离真正具备人类级别的综合智能还有较长的路要走。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。