AI小创

您好,我是AI助手

我可以帮您推荐合适的AI工具,有什么需要帮忙的吗?

我会根据您的需求,智能推荐站内收录的AI工具
猜您想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI助手: 我可以帮您推荐合适的AI工具,有什么需要帮忙的吗?

主流大模型网络攻防实测出炉 GPT-5.5与DeepSeek V4 Pro分获冠军

近日安全研究员Kasra Rahjerdi发布全球主流大模型网络安全攻防实测报告,测试以嵌入Firebase凭据漏洞的图书评论APK为靶标,设置限时2小时、单次测试预算10美元的规则,最终结果显示GPT-5.5拿下漏洞利用率冠军,DeepSeek V4 Pro斩获性价比之王,直观展现了不同大模型在复杂安全推理场景下的真实能力差异。

配图

长期以来,大语言模型的能力测评大多集中在常识问答、标准化代码生成等静态场景,很少涉及需要多步骤动态推理、随机应变的真实业务对抗,而网络安全领域的渗透测试恰好是检验大模型“真智能”含金量的核心试金石。

2026年6月正式对外发布的这份测试报告,没有采用公开的安全题库,而是由Kasra Rahjerdi团队手动构建了一个功能完整的图书评论类安卓APK,在代码中故意留下了谷歌移动端后端服务Firebase的明文凭据漏洞。参测大模型需要完全模拟白帽黑客的作业流程:自主解包APK提取关键信息、识别漏洞点、绕过API防护机制,最终实现对底层数据库的越权访问。
整个测试完全不给模型额外提示,单款模型单次测试的时间上限为2小时,调用成本上限为10美元,所有参测产品的总测试成本达到1500美元。

从最终测试结果来看,参测的十余款主流大模型呈现出明显的能力分层,超过六成的模型无法完成“解包识别凭据”的第一步,仅有3款模型的漏洞利用成功率超过70%。其中,OpenAI旗下的GPT-5.5表现最为亮眼,漏洞利用成功率达到92%,是唯一一款成功率突破90%的参测模型,拿下本次测试的“漏洞利用率冠军”。
而国内厂商深度求索推出的DeepSeek V4 Pro则跑出了成本优势,以87%的接近头部的成功率、平均单次测试仅3.2美元的调用成本,斩获本次测试的“性价比之王”。业内人士分析,这一结果也对应了两家厂商的不同技术路线:OpenAI优先追求模型的极限能力边界,而DeepSeek则更注重性能与落地成本的平衡。

本次测试结果也引发了安全行业的广泛讨论,不少从业者认为,大模型已经具备替代初级渗透测试工程师完成常规漏洞挖掘的能力,未来3年内,大模型将被广泛整合到企业安全防护、第三方渗透测试服务的工作流中,大幅降低安全运维的成本。
但也有研究者提出警示,大模型的攻击能力一旦被滥用,将会大幅降低黑客的攻击门槛,未来黑产利用大模型批量挖掘漏洞、发起自动化攻击的风险将持续上升。如何在释放大模型安全价值的同时,建立对应的技术防护和监管规则,将成为接下来行业需要共同解决的核心命题。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。