AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

OpenAI全面升级AI安全体系 收紧前沿模型全流程审查

2026年8月19日,OpenAI正式发布全新AI安全政策,这是7月Hugging Face安全事件后OpenAI首次大规模调整安全框架。政策重点防范模型测试期风险,强化开发全流程监控与训练对齐标准,目前前沿强化学习计划仍处于搁置状态,新增测试前30分钟风险警报等硬指标,官方称调整也适配即将推出的Astra模型的网安能力要求。

配图

8月19日北美时间周二,OpenAI安全团队在官方博客发布了长达12页的全新安全框架更新说明,整个调整的调研筹备期超过3周,覆盖从模型预训练到上线灰度测试的全生命周期,相关规则即日起对所有内部研发项目生效。

此前外界普遍将这次安全体系升级,和7月21日曝光的Hugging Face开源模型安全事件挂钩——该事件中,社区上传的开源大模型被攻击者利用,短时间内生成了大量有害内容并扩散。但OpenAI官方明确表示,单一安全事件只是政策调整的诱因之一,即将推出的Astra大模型本身具备的极强网络安全能力,以及整个AGI研发赛道的快速迭代,都要求安全标准同步跟上模型能力的提升速度。

本次升级的核心规则围绕“风险和管控强度匹配”的原则设计,OpenAI研究副总裁格莱斯公开强调,模型的能力越强、参数规模越大,面临的安全审查标准就越严苛,整个规则体系会根据模型的风险等级动态调整,不会搞“一刀切”。

针对测试期的高频风险,OpenAI新设了“前30分钟警报”硬指标:所有新模型上线灰度测试的前30分钟,必须接入多层风险监测系统,一旦出现越狱、有害内容生成、自主目标偏移等风险,会自动触发熔断机制,第一时间暂停模型的对外访问。

此外,OpenAI还透露,Hugging Face事件发生后,内部曾全量暂停所有强化学习(RL)训练两周,目前低风险场景的RL训练已经重启,但参数规模超过1万亿的前沿强化学习计划仍处于搁置状态,目前仅以小批次训练做安全验证,未放开全量训练权限。

本次OpenAI的安全体系升级,也让闭源大模型厂商和开源社区的安全标准差异进一步受到关注。此前开源社区的安全管控相对宽松,更多依赖开发者自律,而Hugging Face事件后,包括Meta、谷歌DeepMind在内的多家厂商都已经开始调整内部安全规则。

有行业分析人士指出,OpenAI本次推出的分级审查、测试期熔断等规则,大概率会成为后续头部大模型厂商的通用安全标准,但也有研发人员担忧,过严的管控可能会拖慢前沿AGI技术的研发进度,如何平衡创新和安全,会成为未来一年AI行业的核心命题。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。