问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
7月13日,蚂蚁集团旗下蚂蚁AI安全实验室正式开源智能体安全护栏SingGuard-NSFA,同时对外披露多模态安全护栏SingGuard的技术细节。两款产品分别针对自主执行智能体、多模态交互大模型两大前沿场景的安全风险,将AI安全防护边界从传统模型输出环节拓展至行为控制、权限管理、系统治理层面,标志着蚂蚁在AI安全领域完成系统化布局。

就在过去一年间,Amazon Q遭遇提示词投毒导致用户数据泄露、Microsoft Copilot出现非授权信息调取漏洞、开源智能体项目OpenClaw被曝出可通过注入指令执行恶意操作……一系列安全事件的频发,正在给快速落地的前沿AI技术泼下冷水:当AI从生成内容转向自主执行任务,原有仅针对文本输出的防护体系已经全面失效。
随着AI技术迭代进入深水区,产业应用正在经历两大关键变化:一是智能体开始具备自主调用工具、规划任务、运行代码的能力,二是大模型普遍完成多模态升级,可同时理解图像、音频、文本等多类信息。能力边界的拓展也带来了安全盲区的扩大,提示词注入、权限滥用、恶意代码执行、数据泄露等新型风险的出现频率正在快速上升。
据行业安全机构统计,2025年全球AI安全事件同比增幅超过120%,其中智能体行为失控、多模态提示词越狱类事件占比超过6成。2025年12月,全球Web安全标准组织OWASP也专门更新了智能体安全风险榜单,将权限越界、隐藏指令注入列为最高等级的防护需求。
本次蚂蚁AI安全实验室发布的两款安全模型,恰好瞄准了当前行业最突出的两类防护缺口。
其中SingGuard-NSFA专门面向自主执行的智能体场景,相当于给智能体加装了一套“行为审批系统”,会实时核验智能体的每一步操作是否合规:比如是否越权调取敏感数据、是否调用了未授权的第三方工具、是否存在执行恶意代码的风险,从执行环节直接拦截风险。
另一款SingGuard则针对多模态交互场景,能够识别潜藏在图像、音频、混合文本中的恶意提示词,避免大模型被“越狱”诱导生成有害内容或者执行危险操作。蚂蚁方面透露,两款模型均已在内部金融级业务场景经过超过10亿次交互验证,开源后将免费向全行业开放使用。
此前行业的AI安全防护大多集中在模型推理的输出环节,核心功能是过滤不符合规范的文本内容,而随着智能体、多模态大模型进入商用落地期,全链路、系统化的安全防护已经成为刚需。
蚂蚁此次的两款开源产品,刚好填补了输入层(多模态风险识别)、执行层(智能体行为管控)的防护空白,也为行业提供了可复用的安全解决方案,有助于降低整个AI产业的安全部署门槛,推动前沿AI技术在金融、政务、企业服务等敏感场景的合规落地。