问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年8月19日,OpenAI正式发布全新AI安全政策,这是7月Hugging Face安全事件后OpenAI首次大规模调整安全框架。政策重点防范模型测试期风险,强化开发全流程监控与训练对齐标准,目前前沿强化学习计划仍处于搁置状态,新增测试前30分钟风险警报等硬指标,官方称调整也适配即将推出的Astra模型的网安能力要求。

8月19日北美时间周二,OpenAI安全团队在官方博客发布了长达12页的全新安全框架更新说明,整个调整的调研筹备期超过3周,覆盖从模型预训练到上线灰度测试的全生命周期,相关规则即日起对所有内部研发项目生效。
此前外界普遍将这次安全体系升级,和7月21日曝光的Hugging Face开源模型安全事件挂钩——该事件中,社区上传的开源大模型被攻击者利用,短时间内生成了大量有害内容并扩散。但OpenAI官方明确表示,单一安全事件只是政策调整的诱因之一,即将推出的Astra大模型本身具备的极强网络安全能力,以及整个AGI研发赛道的快速迭代,都要求安全标准同步跟上模型能力的提升速度。
本次升级的核心规则围绕“风险和管控强度匹配”的原则设计,OpenAI研究副总裁格莱斯公开强调,模型的能力越强、参数规模越大,面临的安全审查标准就越严苛,整个规则体系会根据模型的风险等级动态调整,不会搞“一刀切”。
针对测试期的高频风险,OpenAI新设了“前30分钟警报”硬指标:所有新模型上线灰度测试的前30分钟,必须接入多层风险监测系统,一旦出现越狱、有害内容生成、自主目标偏移等风险,会自动触发熔断机制,第一时间暂停模型的对外访问。
此外,OpenAI还透露,Hugging Face事件发生后,内部曾全量暂停所有强化学习(RL)训练两周,目前低风险场景的RL训练已经重启,但参数规模超过1万亿的前沿强化学习计划仍处于搁置状态,目前仅以小批次训练做安全验证,未放开全量训练权限。
本次OpenAI的安全体系升级,也让闭源大模型厂商和开源社区的安全标准差异进一步受到关注。此前开源社区的安全管控相对宽松,更多依赖开发者自律,而Hugging Face事件后,包括Meta、谷歌DeepMind在内的多家厂商都已经开始调整内部安全规则。
有行业分析人士指出,OpenAI本次推出的分级审查、测试期熔断等规则,大概率会成为后续头部大模型厂商的通用安全标准,但也有研发人员担忧,过严的管控可能会拖慢前沿AGI技术的研发进度,如何平衡创新和安全,会成为未来一年AI行业的核心命题。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。