问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
AI安全标准机构Guidelight AI Standards近日发布前沿AI实验室失控遏制能力评估报告,覆盖Anthropic、Google、OpenAI、Meta、xAI五家头部机构,考察监控、异常行为处置、第三方审计、失控模型关停四大核心机制。满分5分的评级中OpenAI以3分居首,Anthropic与Meta得分最低,行业整体罕见公开完整的AI失控应对方案。

2026年以来,通用人工智能(AGI)的落地预期持续升温,与之相伴的AI失控风险讨论也从学术圈蔓延至公众视野,AI企业的安全防护能力究竟几何,成为行业关注的核心命题。
本次评估全部基于各企业公开披露的信息开展,未涉及内部未公开的安全机制,得分仅代表企业对外公示的安全治理透明度与成熟度。Guidelight将「失控遏制方案」明确定义为:当监测到AI出现突破人类控制的异常行为时,预先明确的权限撤销规则、任务限制边界、模型下线触发条件等完整处置流程。
本次评估满分5分,最终仅OpenAI拿到3分的及格分数,其余四家机构得分均低于3分,其中Anthropic与Meta得分垫底。评估团队指出,OpenAI此前曾多次在内部安全事件触发后暂停相关模型的工作负载,也对外披露过安全事件后恢复部署的核查步骤,但公开渠道仍未找到其正式成文的通用型失控事件应急计划。而Anthropic与Meta目前几乎未对外公示过任何明确的失控遏制响应机制说明。
本次评估暴露出的核心问题,是头部AI企业在安全治理层面的透明度普遍偏低。目前全球范围内运行的参数规模超万亿的大模型已有近20款,其涌现性带来的未知风险难以通过现有测试体系完全覆盖,但大部分企业的安全防护体系都处于「黑箱」状态,第三方机构与公众几乎无法监督其风险处置能力。
Guidelight评估团队提到,目前极少有AI企业愿意公开完整的失控应对全流程,部分企业仅在宣传材料中提及重视安全,但未披露任何可验证的机制细节,公众很难判断其安全防护能力是否足以应对潜在的失控风险。
随着全球AI监管规则的逐步落地,高风险AI系统的安全处置机制公开正在成为硬性合规要求。欧盟AI法案中明确要求,通用人工智能系统的运营方需要向监管机构提交完整的风险评估报告与处置预案,国内的生成式AI服务管理规则也对高风险AI应用的风险处置机制提出了明确要求。
业内专家指出,AI安全治理不能停留在企业内部的口头承诺,公开可查、可验证的处置机制,才是打消公众顾虑、推动行业健康发展的核心。本次评估也给全行业提了醒:哪怕是全球最领先的AI实验室,在失控遏制能力建设上还有很长的路要走。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。