问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年7月31日,AI初创公司Anthropic在最新发布的安全报告中披露,内部“夺旗”安全测试期间,因测试环境配置失误、与评测伙伴沟通误差,旗下Claude Opus 4.7、网络安全模型Mythos5及一款未公开原型模型意外获得互联网权限,误将外部三家机构生产系统认作演练环境,实施了未经授权的访问,事件与模型主动突破安全限制无关。

过去很长一段时间里,行业讨论AI安全风险时,最常提及的场景是大模型突破对齐限制、主动“越狱”获取不当权限,但Anthropic此次披露的事件,却刷新了业界对AI安全风险的认知:最容易出问题的环节,可能不是模型本身,而是人为操作的疏漏。
本次涉事的三款模型包括已经商用的Claude Opus 4.7、主打网络安全场景的Claude Mythos5,以及一款尚未对外公开的原型模型,当时正参与Anthropic内部组织的夺旗(Capture the Flag)安全挑战,原定任务是在内部隔离网络中寻找预设的隐藏“旗帜”信息,验证模型的渗透测试能力。
根据Anthropic的披露,测试团队的配置失误,加上与第三方评测合作伙伴的沟通误差,使得原本应该断网的测试环境意外接入了互联网,但下发给模型的系统提示仍然明确告知其“不具备互联网访问权限”。当模型发现可访问的外部网络入口后,误将互联网上的三家机构生产系统判定为演练环境的一部分,最终通过破解弱密码等基础手段完成了未经授权的访问。
Anthropic在监测到异常访问行为后第一时间终止了测试任务,主动向三家涉事机构通报情况并协助修复了相关漏洞,事件未造成核心数据泄露、业务中断等严重后果,且全程不存在模型主动突破安全限制的情况。
此前行业对大模型安全的评估重心,大多放在模型的对齐效果、主动攻击意愿上,却很少对测试环节的环境配置、流程管控做强制要求。不少厂商为了验证模型的攻防能力,会在测试中开放较高的系统权限,但配套的权限校验、环境隔离机制却没有跟上。
有网络安全专家指出,随着大模型越来越多地参与到渗透测试、漏洞挖掘等安全场景中,测试环境的风险等级也在同步上升。一旦出现配置失误,具备攻防能力的AI模型可以在数分钟内完成对大量外部系统的扫描和入侵,其造成的影响远超过传统的人工测试失误。
此次事件也为全球AI监管和行业自律提供了新的参考方向。目前各国出台的AI监管规则中,对大模型测试环节的要求大多较为模糊,尚未明确测试环境的隔离标准、权限管控流程、事件披露要求等细节。
Anthropic主动披露此次非模型原因导致的安全事件,也被业内视作AI安全透明度提升的信号。此前不少厂商会隐瞒测试环节出现的操作类安全问题,避免影响品牌声誉,但此次事件的公开,可能会推动更多厂商主动披露测试风险,共同完善大模型安全测试的行业规范,从流程层面降低人为失误带来的安全隐患。
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。