AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

OpenAI推出红队专用大模型GPT-Red 升级AI安全防御能力

2026年7月,OpenAI正式推出专为红队测试打造的大语言模型GPT-Red。该产品可模拟高水平黑客的全路径攻击手法,针对OpenAI旗下全系列AI模型开展自动化漏洞挖掘,效率较传统人工红队提升3倍以上,旨在提前排查潜在安全风险,在与人类攻击者的对抗中占据先手,为其AI产品的安全迭代提供核心技术支撑。

配图

随着大模型在金融、医疗、政务等高敏感场景的渗透率突破30%,AI系统的安全漏洞正在成为新的网络攻击重灾区,仅2026年上半年,全球已披露的大模型越狱、prompt注入、数据泄露事件就超过400起,造成的直接经济损失突破20亿美元。传统依赖人工安全团队的测试模式,已经跟不上漏洞的更新速度。

过去两年,针对大模型的攻击手段迭代速度远超行业预期,从最初的简单prompt诱导,到现在的多模态注入、供应链投毒,攻击的隐蔽性和破坏性不断提升。行业统计数据显示,2025年人工红队完成一款大模型的全量安全测试平均需要21天,而新的攻击手段的更新周期已经缩短到7天以内,攻防两端的时间差正在成为AI厂商最大的安全隐患。

同时,高端安全人才的缺口也在进一步拉大,全球具备大模型安全测试能力的红队人员不足2000人,远不能满足数千家AI厂商的测试需求,行业迫切需要自动化的测试工具填补缺口。

此次OpenAI推出的GPT-Red,正是其针对攻防不对等问题给出的解决方案,OpenAI内部将其称为“站在防御侧的超级黑客”。

据了解,GPT-Red的训练数据集涵盖了过去5年全球所有公开的大模型攻击样本,以及OpenAI内部积累的数十万条红队测试数据,可模拟从脚本小子到国家级黑客的全层级攻击手法,能在24小时内完成对单款大模型的全维度漏洞扫描,同时自动生成漏洞修复建议。

目前GPT-Red已经在OpenAI内部投入使用,针对GPT-5、GPT-4o等核心产品的测试中,已经提前排查出17个此前未被人工红队发现的高危漏洞,避免了潜在的用户数据泄露风险。OpenAI方面表示,未来会逐步把GPT-Red的测试能力开放给第三方AI厂商,为全行业的AI产品提供安全测试服务。

GPT-Red的出现,也标志着AI安全正在从“人工防御”进入“AI对抗AI”的新阶段。不少行业安全专家指出,未来每一款商用大模型的配套设施中,都会包含专用的安全防护大模型,在产品迭代的全流程开展动态防护。

针对外界担忧的“GPT-Red会不会被滥用来攻击其他AI系统”的问题,OpenAI安全团队负责人表示,GPT-Red已经做了严格的权限管控和输出限制,所有调用记录都会全程留痕,且不会生成可直接用于攻击的完整代码,仅能用于安全防护场景。

未来3到5年,AI原生安全体系会逐步成为数字基础设施的核心组成部分,针对AI系统的攻防对抗,也会成为网络安全领域的核心赛道。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。