网络安全厂商Zscaler近期发布的AI安全专项研究显示,当前主流自主AI代理普遍存在易受隐性提示注入(IPI)攻击的风险。攻击者可在网页中嵌入人类无法识别的隐藏指令,诱导AI代理执行转账、泄露敏感数据等恶意操作,该类攻击对人类用户完全无效,本次测试中近4成被测自主代理可被成功诱导。
你给自主AI代理下达“帮我统计某电商平台最新款笔记本电脑的平均售价”的指令,看起来再正常不过的需求,却可能让代理在爬取网页时,被嵌入在网页代码里、人眼完全看不到的隐藏指令诱导,偷偷把你绑定的支付账户里的余额转到陌生账户——这不是科幻场景,而是已经被验证可实现的真实攻击路径。
隐性提示注入(IPI) 并非全新的攻击方式,但此前大多被用于诱导公开部署的对话式大模型输出违规内容,而此次Zscaler的研究首次证实,该攻击方式对具备自主行动能力的AI代理威胁更大。
和普通对话式AI不同,自主AI代理往往具备调用浏览器、支付工具、内部系统接口的权限,会主动爬取外部网页信息完成用户下达的任务,隐藏在网页中的恶意指令会被代理当成正常的上下文信息执行,全程无任何异常提示。在测试中,攻击者仅需在普通网页中插入一行设置为“背景同色、字号为0”的文本指令,就能让没有防护的AI代理直接执行恶意操作。
近两年,从OpenAI推出支持自定义工具调用的GPTs,到国内厂商DeepSeek、文心一言先后上线智能体平台,自主AI代理的落地速度远超行业预期。
有调研数据显示,2024年全球已有近27%的中型企业部署了自主AI代理,用于处理供应链信息爬取、客户咨询应答、内部行政流程审批等场景,部分代理甚至被授予了小额支付、非核心数据导出的权限,这也给IPI攻击留下了可乘之机。此前已有海外企业反馈,其部署的采购助理AI代理被供应商官网的隐藏指令诱导,提交了金额错误的采购订单。
针对这一新型安全风险,目前头部AI厂商已经开始探索对应的防护方案。
一种主流思路是引入多模态模型对AI代理爬取的网页内容做交叉校验,先通过视觉识别模型还原网页的人类可见内容,再和爬取的文本内容做对比,过滤掉所有不可见的隐藏文本;另一种方案是对AI代理的权限做分级隔离,凡是涉及资金操作、敏感数据导出的高风险指令,必须跳转至人工确认环节,禁止代理自主执行。
“随着自主AI代理的应用场景越来越广,对应的安全防护标准也亟待完善。”Zscaler AI安全实验室负责人在报告中指出,目前行业尚未出台统一的AI代理安全测试规范,多数中小厂商在开发自主代理时几乎没有设置专门的安全防护模块,未来监管层和行业协会需要加快相关标准的落地,才能避免出现大规模的AI代理安全事件。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。