AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

OpenAI推出GPT-Red自动化红队模型 提示注入攻击失败率降至0.05%

近日,人工智能企业OpenAI正式发布自动化红队测试模型GPT-Red,针对当前AI系统深度接入浏览器、本地文件、各类API带来的安全脆弱性问题,采用自博弈强化学习策略开展规模化对抗训练,可将直接提示注入攻击的失败率压低至0.05%,效率与覆盖范围均优于传统人工红队测试,为大模型安全加固与自我迭代开辟了新路径。

配图

随着大模型进入产业落地深水区,安全风险正在从实验室场景向真实业务场景快速传导。据此前行业安全报告统计,近6成接入公开网络的大模型应用都曾遭遇过提示注入、数据越狱等恶意攻击,造成用户隐私泄露、权限被越权调用等问题,安全已经成为大模型规模化落地的核心前提。

过去两年,大模型已经从聊天工具延伸到办公协作、工业控制、金融服务等多个场景,通过浏览器插件、本地文件读取、第三方API调用等能力深度接入真实世界,安全边界也随之无限扩张。

传统人工红队测试虽然定位精准,但高度依赖安全专家的个人经验,不仅测试成本高、周期长,也很难覆盖所有潜在的攻击路径,更无法产出足够规模的对抗样本支撑大模型的快速迭代。有行业统计显示,当前70%以上的大模型漏洞都是在上线后被外部攻击者发现,而非事前测试环节排查到,安全滞后已经成为大模型落地的最大阻碍之一。

OpenAI此次推出的GPT-Red,正是为了解决攻防两端的效率差问题。不同于传统红队的人工测试逻辑,GPT-Red采用自博弈强化学习策略,训练过程中会同时与数十个不同架构的防御方模型进行高频对抗,自主生成千万级别的多样化提示注入样本,快速定位模型的潜在漏洞。

这套机制的核心价值在于形成了安全加固的闭环:GPT-Red产出的对抗样本不需要人工整理,可以直接输入到防御模型的训练流程中,让模型在部署前就完成漏洞修复。公开测试数据显示,搭载了GPT-Red安全训练流程的大模型,直接提示注入攻击的失败率仅为0.05%,相比传统人工测试后的模型,安全性提升了近60倍,测试成本仅为原来的十分之一。

GPT-Red的落地,也意味着AI安全正在从“人工补漏”的传统模式,转向“AI攻防AI”的原生安全模式。此前多家AI企业的安全布局都集中在推理阶段的内容过滤,而OpenAI的尝试已经把安全环节前置到了模型训练阶段,从根源上降低模型的安全脆弱性。

据了解,OpenAI未来还计划开放GPT-Red的部分能力,供第三方大模型厂商使用,推动整个行业的安全基线提升。随着AGI研发进度的加快,这类自动化安全工具也将成为必备的基础设施,为通用人工智能的落地筑牢安全防线。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。