问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
近日,人工智能企业OpenAI正式发布自动化红队测试模型GPT-Red,针对当前AI系统深度接入浏览器、本地文件、各类API带来的安全脆弱性问题,采用自博弈强化学习策略开展规模化对抗训练,可将直接提示注入攻击的失败率压低至0.05%,效率与覆盖范围均优于传统人工红队测试,为大模型安全加固与自我迭代开辟了新路径。

随着大模型进入产业落地深水区,安全风险正在从实验室场景向真实业务场景快速传导。据此前行业安全报告统计,近6成接入公开网络的大模型应用都曾遭遇过提示注入、数据越狱等恶意攻击,造成用户隐私泄露、权限被越权调用等问题,安全已经成为大模型规模化落地的核心前提。
过去两年,大模型已经从聊天工具延伸到办公协作、工业控制、金融服务等多个场景,通过浏览器插件、本地文件读取、第三方API调用等能力深度接入真实世界,安全边界也随之无限扩张。
传统人工红队测试虽然定位精准,但高度依赖安全专家的个人经验,不仅测试成本高、周期长,也很难覆盖所有潜在的攻击路径,更无法产出足够规模的对抗样本支撑大模型的快速迭代。有行业统计显示,当前70%以上的大模型漏洞都是在上线后被外部攻击者发现,而非事前测试环节排查到,安全滞后已经成为大模型落地的最大阻碍之一。
OpenAI此次推出的GPT-Red,正是为了解决攻防两端的效率差问题。不同于传统红队的人工测试逻辑,GPT-Red采用自博弈强化学习策略,训练过程中会同时与数十个不同架构的防御方模型进行高频对抗,自主生成千万级别的多样化提示注入样本,快速定位模型的潜在漏洞。
这套机制的核心价值在于形成了安全加固的闭环:GPT-Red产出的对抗样本不需要人工整理,可以直接输入到防御模型的训练流程中,让模型在部署前就完成漏洞修复。公开测试数据显示,搭载了GPT-Red安全训练流程的大模型,直接提示注入攻击的失败率仅为0.05%,相比传统人工测试后的模型,安全性提升了近60倍,测试成本仅为原来的十分之一。
GPT-Red的落地,也意味着AI安全正在从“人工补漏”的传统模式,转向“AI攻防AI”的原生安全模式。此前多家AI企业的安全布局都集中在推理阶段的内容过滤,而OpenAI的尝试已经把安全环节前置到了模型训练阶段,从根源上降低模型的安全脆弱性。
据了解,OpenAI未来还计划开放GPT-Red的部分能力,供第三方大模型厂商使用,推动整个行业的安全基线提升。随着AGI研发进度的加快,这类自动化安全工具也将成为必备的基础设施,为通用人工智能的落地筑牢安全防线。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。