问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年8月26日,科技作者Grace Huckins发布的AI能力测试结果显示,当前GPT-5、Claude 4等主流前沿大语言模型在逻辑谜题、博弈类智力测验中存在明显能力短板,平均正确率不足40%,远低于成年人类平均水平。本次测试共包含7项不同类型的趣味智力题,普通用户可直接参与答题,对比自身与AI的表现,直观感知当前AI的能力边界。

翻开这套包含7道题的测试卷,第一题是经典的“三个开关控制三盏灯”逻辑题,这道成年人类正确率超过80%的常规智力题,在GPT-5的10次重复测试里只答对了2次,甚至还给出过“用水浇灯判断温度”的违背常识的离谱答案。
从AI学科诞生之初,各类智力游戏、谜题、博弈场景就一直是衡量AI能力的核心标尺。1997年深蓝战胜国际象棋冠军卡斯帕罗夫,2016年AlphaGo击败围棋世界冠军李世石,都曾被视作AI能力跃迁的标志性节点,也让不少公众产生了“AI智力已经全面超越人类”的刻板认知。
但实际上这类封闭式规则的竞技场景,和需要灵活调用常识、打破思维定式的通用智力测试完全属于不同赛道。此前行业对大模型的能力测试大多聚焦文本生成、知识问答、代码编写等商业化落地相关的维度,很少专门针对开放逻辑的通用谜题场景做系统评估,这也导致公众对AI的能力边界始终存在认知偏差。
本次测试的7道题覆盖了文字逻辑推理、空间想象、常识陷阱、多步博弈等多个维度,测试对象包括GPT-5、Claude 4、Gemini 2等当下所有主流前沿大模型,最终统计的平均正确率仅为38%,而随机招募的200名普通成年参与者的平均正确率达到了76%,甚至12-15岁的青少年组平均正确率也有62%。
所有大模型在需要跳出常规思路、结合多领域常识做跨维度推导的题目上,错误率超过80%,不少答案甚至出现了违背基本物理常识、逻辑前后矛盾的低级错误。背后的核心原因在于,当前大语言模型的技术底层是基于训练语料的概率生成,而非人类式的主动逻辑推导,一旦遇到训练语料中没有覆盖的非常规逻辑场景,就很容易出现“幻觉”式的错误输出。
目前这类谜题测试已经获得了不少AI头部企业的关注,OpenAI、DeepSeek等团队已经将同类逻辑谜题纳入了下一代大模型的训练测试集,希望通过针对性的训练补全大模型的逻辑推导短板。毕竟要实现真正的通用人工智能,具备自主解决复杂逻辑问题的能力是必不可少的核心指标。
对于普通用户而言,参与这类门槛不高的趣味测试,也是破除AI“万能论”的好方式。只有清晰认知到当前AI的能力边界,才能在日常工作生活中更合理地使用AI工具,既充分发挥它在信息整理、重复劳动上的优势,也避免过度依赖AI处理需要复杂逻辑判断、价值取舍的核心事务。
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。