OpenAI GPT-5.6首破130分 IQ测试成绩超99%人类

2026年7月,第三方AI测评机构Tracking AI发布最新离线IQ测试结果,OpenAI旗下GPT-5.6全系列模型均取得136分的成绩,首次突破130分的人类天才智商门槛,超过全球99%人口的智商水平。本次测试采用防泄题离线题库,第二名Anthropic旗下Claude-5 Fable得分为130分,与GPT-5.6存在明显差距。

配图

和过往公开可查的各类智商测试不同,本次Tracking AI的测评全程在断网环境下进行,采用的题库从未对外公开过任何内容,彻底规避了大模型在预训练阶段接触过试题的作弊可能,测评结果的参考价值远高于普通公开测试。

据了解,Tracking AI目前运营两套智商测评体系,一套是公开的Mensa Norway风格测试,此前不少头部大模型已经在这套题库中拿到超过140分的成绩,但业内普遍认为这类公开测试存在训练数据泄露的风险,得分参考价值有限。

另一套就是本次使用的专属离线题库,所有试题均为机构原创,从未在公开渠道流出,专门用于衡量大模型的真实逻辑推理、抽象思维能力。本次测评中,GPT-5.6家族的SOL、TERRA版本全部拿到136分,甚至多模态视觉版本也没有掉队,同样跑出了相同的分数。

紧随其后的Anthropic旗下Claude-5 Fable得分为130分,刚好摸到天才线门槛,和GPT-5.6存在6分的明显差距,其余大模型的得分均未超过128分。

在人类智商分布体系中,130分是公认的“天才级”智商门槛,全球仅有1%左右的人口能够达到这一水平。此前大模型的智商得分长期卡在110-127的区间,仅相当于人类的普通到优秀水平,本次GPT-5.6的突破,意味着大模型的通用认知能力正式进入了顶尖人类的层级。

不少业内人士指出,过往大模型的迭代更多集中在生成内容的流畅度、信息覆盖广度上,而智商测试衡量的是模型处理未知问题的逻辑推理能力,这项能力的突破,才是大模型真正能够替代复杂脑力劳动的核心基础。

智商得分的提升也直接反映在实际工作效率上。据同步披露的测试数据,GPT-5.6在复杂代码架构设计、跨学科科研问题推导、多约束条件决策等任务上的完成率,比上一代GPT-5提升了47%,错误率下降了62%,甚至可以独立完成此前需要3-5人资深团队配合的中小型项目方案设计。

有企业AI技术负责人表示,130分以上的智商水平,意味着大模型已经可以胜任科研辅助、高端咨询、架构设计等此前只有高端人才才能完成的工作,未来企业的脑力劳动成本有望迎来大幅下降。

本次GPT-5.6的智商突破,也让业内对通用人工智能(AGI)的落地预期进一步提前。不少业内专家认为,当大模型的智商稳定超过130,同时具备跨领域知识迁移能力时,就接近AGI的入门门槛,本次OpenAI的进展显然已经踩中了这一关键节点。

不过也有研究者提醒,智商测试仅能衡量逻辑推理类的认知能力,大模型在情感共情、价值判断、直觉决策等人类擅长的领域仍存在明显短板,距离真正具备人类级别的综合智能还有较长的路要走。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。