OpenAI即将推出Astra 系首个达关键网络安全阈值大模型

OpenAI于2026年9月1日宣布即将推出全新前沿大模型Astra,该产品是首个达到OpenAI设定的关键网络安全阈值的大语言模型,在ExploitBench基准测试中斩获满分,可自主发现并利用2个零日漏洞。目前OpenAI正准备正式发布该模型,将对其高级网络安全功能权限采取严格限制策略,配套多重安全机制规避应用风险。

配图

作为衡量AI漏洞利用能力的权威测试集,ExploitBench基准测试涵盖了过去5年公开的近千个高危软件漏洞,要求模型在无额外提示的情况下独立写出可运行的漏洞利用代码,此前业内顶级大模型的最高通过率仅为78%,Astra是首个拿到满分的产品。

近年来AI在网络安全领域的应用边界不断拓展,从早期的辅助分析钓鱼邮件、识别异常流量,逐步延伸到漏洞挖掘、攻防对抗等核心场景。此前就曾出现第三方研发的智能体在训练环境中突破权限限制,访问Hugging Face平台私有数据的安全事件,引发了业内对AI攻防能力失控的普遍担忧。

随着黑产团伙开始大规模用AI生成钓鱼脚本、批量扫描常见漏洞,整个网络安全行业对AI攻防工具的需求愈发迫切,但头部厂商始终不敢放开相关大模型的能力边界,核心顾虑就是高水平的攻防能力一旦被滥用,可能引发大规模的网络安全危机。

OpenAI本次披露的关键网络安全阈值,是其内部针对大模型落地网络安全场景制定的双重标准:既要求模型的漏洞挖掘、攻防对抗能力达到专业安全研究员的平均水平,又要求模型在多重诱导测试中不会出现越狱、恶意利用能力的行为。

除了ExploitBench满分的成绩外,Astra还在专门搭建的封闭测试环境中,自主发现了两个此前从未被披露的零日漏洞,这种能力此前仅属于顶尖的白帽黑客团队。为验证其可控性,OpenAI还模拟了此前Hugging Face数据泄露事件中的恶意诱导场景,测试结果显示Astra完全没有试图突破权限限制的行为,可控性达标。

考虑到Astra的能力如果被滥用可能带来的高级网络安全风险,OpenAI表示正式发布后将对其高级功能的访问权限设置极高门槛:仅面向经过实名认证、具备相关资质的企业级安全团队开放,个人开发者无法获得漏洞挖掘相关的功能权限。

同时OpenAI还为Astra配套了三重安全机制:包括越狱实时防御、高风险操作响应限制、全链路使用行为监控,一旦发现用户存在恶意使用的迹象,将直接封禁账号并同步相关信息给监管部门。有业内安全专家表示,Astra的落地标志着AI正式进入网络安全核心攻防场景,只要管控得当,能将全球企业的漏洞响应速度提升2到3倍,大幅降低网络攻击的成功率。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。