📌 系列导航🔥 日报 · 📚 周报 · 📡 技术雷达 · 📄 论文精读 · 📮 情报站

论文信息

项目内容
日期2026-08-30
论文SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification
作者SingGuard Team(蚂蚁集团 AI Security Lab,inclusionAI)
链接arXiv:2607.13081
代码GitHub: inclusionAI/SingGuard-NSFA
模型HuggingFace/ModelScope 开源 0.8B/2B/4B/9B 四个尺寸

一句话总结

蚂蚁集团用CIA三性(机密性/完整性/可用性)系统化定义了Agent安全的185种风险变体,并开源了一套"生成式推理审计 + 判别式实时分类"双模式护栏,0.8B小模型就能在50ms内拦截提示注入、信息窃取、工具滥用等Agent运行威胁,全面超越Llama Guard 3、Qwen3Guard等主流护栏。

解决什么问题

LLM从"聊天"进化到"Agent执行"(浏览网页、调用API、执行代码),威胁面发生了根本转变:风险从"模型说什么"(内容安全)转移到"Agent做什么"(运行安全)。EchoLeak证明一封精心构造的邮件能让Microsoft 365 Copilot静默外泄敏感文档;GitHub Copilot曾被证实可通过提示注入实现远程代码执行。

现有Agent安全方案存在三大短板:

  1. 风险分类法不系统——有的固定8类风险不泛化,有的完全依赖用户自定义策略,无法评估"哪些风险覆盖了、哪些漏了"
  2. 扩展新风险代价高——需要大量人工重配置或重训练;免训练方案不可靠,规则系统可被越狱绕过
  3. 全部只测英语——非英语攻击成为可利用的盲区

内容安全护栏(Llama Guard等)从未为这类"运行威胁"设计。

核心方法

1. NSFA风险分类法(Not-Secure-For-Agents)

以CIA三性为骨架的三层层级结构,核心设计是把攻击技术与攻击目标分离

  • Query侧(5域/24风险/160变体):提示注入与越狱(唯一"技术型"域,横跨CIA三性)+ 4个"目标型"域——恶意代码与网络攻击(I)、敏感信息窃取(C)、危险操作与工具滥用(I)、资源滥用(A)
  • Response侧(2域/4风险/25变体):危险动作生成 + 敏感信息泄露

与OWASP三份指南交叉验证:覆盖LLM Top 10的80%、Agentic Top 10的60%、Agentic威胁清单的47%,未覆盖项均属多智能体系统级/治理/模型能力问题(超出单轮检测范围)。

三条设计原则同样关键:Query优先、Response兜底(在最早阶段拦截不可逆动作);单轮可检测(无状态、低延迟、易扩展部署);多语言覆盖(防语言绕过)。

2. 四阶段合成数据管线

用74个开源LLM做生成器,构建93.5万条多语言训练数据:

  • 种子自由生成:生成器按185个风险定义生成"正例-难负例"配对样本(难负例与正例共享表层特征,逼迫模型学真实风险判别特征而非表面线索)
  • 种子增强扩充:分层采样正例做few-shot种子,扩展攻击措辞多样性
  • 多语言扩展:全量翻译中文 + 一半译入11种高资源语言 + 一半译入120种低资源语言,共133语言
  • 标注-过滤(AF)质量门:标注器(Qwen3.5-122B)CoT标注 → 生成/标注标签一致性过滤 → 退化清洗 → MinHashLSH去重;最终由更强模型(Qwen3.5-397B)独立重标注做级联验证

3. 生成-判别双模式训练与推理

  • 生成模式(离线审计):SFT骨干模型输出<analysis>(英文CoT风险分析)+ <risks>(风险域判定),每步推理锚定NSFA定义,人类可验证、可追溯。输入用<untrusted_input>显式包裹,防止模型执行注入指令而非分析它
  • 判别模式(实时拦截):在冻结的SFT骨干上取最后token嵌入,接单隐层MLP分类头(h = Dropout(ReLU(LayerNorm(W₁e+b₁))),z = W₂h+b₂),每个Level-1域一个头,单次前向即出全部风险分数,约50ms;头的训练采用硬负例/跨域负例/安全负例三源组合、正负比上限1:3
  • 分层部署:实时分类做高吞吐一线过滤,生成推理给被标记样本做人工复审
  • 原生可扩展:加新风险域只需在冻结骨干嵌入上训一个新头,不动骨干和其他头——头从5个扩到5万个,端到端延迟仅增9ms

实验结果

三大基准:Query(63K样本/133语言)、Response(30K)、CrossSource-Query(3.4K,改自AgentDojo/InjecAgent/AgentHarm/AgentDyn/ATBench五个公开数据集)。

  • Query检测:最强对手AgentDoG1.5-FG为84.76% F1;SingGuard-NSFA四个尺寸全部≥94.88%,9B达96.95%(生成模式),领先9-12个点
  • Response检测:对手最好91.25%(Granite Guardian 4.1),AgentDoG1.5-FG从84.76暴跌至56.27;SingGuard全部≥97.80%,**98.31%**封顶
  • 跨源泛化:9B达91.29% F1,且precision/recall均衡(85.76/97.58)——对手要么偏高precision低recall(Prompt Guard 2: 94.13/24.92),要么反之(AgentDoG1.5-FG: 73.68/99.52)
  • 延迟:判别模式45-57ms/样本(9B也仅57ms,比参数量小30倍的对手还快),在100ms实时预算内;生成模式3.6-7.2s用于离线审计
  • 即插即用:把分类头装到冻结的Llama Guard 3上,Query F1从67.66%飙升17.6个点至85.23%,一举超过所有竞争护栏;训一个内容安全新头,就在内容审核基准上达到与最强专用模型相差<1点的F1——证明骨干学到的是可泛化的风险感知表征

深层洞察:为什么重要

  1. 安全范式转移的正式化。“从内容合规到运行安全"这个判断大家都听得出来,但本文用CIA三性给出了第一个系统的、与OWASP对齐的分类学,让"覆盖了哪些风险、漏了哪些"变得可审计。技术与目标的正交分解还让分类法能沿两个维度独立扩展。

  2. 生成与判别不是二选一,而是分层协作。判别头吃"最后token嵌入"这个设计极其务实:嵌入提取一次、多头并行、互不依赖——5万个头只加9ms延迟。这等于把护栏的扩展成本从"重训模型"降到"训一个MLP”。

  3. 合成数据工程的教科书示范。74个异构生成器保证攻击面多样性、“正例-难负例"配对压制表面捷径、AF门+级联双模型验证保证标签质量、MinHashLSH+模板隔离保证训练/评测分离。整套流程可复用到任何安全分类任务。

  4. 即插即用的头是通用增益。装在Llama Guard 3上+17.6点,说明这不是SingGuard专属技巧,而是"冻结骨干+轻量头"范式的普遍有效性——对任何已部署护栏都是低成本升级路径。

局限性

作者自己承认三点:

  1. 单轮、纯文本:检测不了多轮轨迹中的渐进式目标劫持、级联工具调用失败;多模态威胁和智能体间通信投毒也不在范围内
  2. 低资源语言可能退化:虽然覆盖133语言,但种子生成和标注依赖以中英语料为主的模型
  3. 自评偏差:分类法、训练数据、三个基准中的两个出自同一团队,自建基准上的成绩可能偏乐观(CrossSource上的领先收窄到3.6-6.6点也部分印证了这一点)

此外值得注意:Eval基准的合成数据与训练数据出自同一管线(虽有模板隔离+去重双保险),面对真实世界人工构造的新型攻击,泛化上限仍待检验;~50ms延迟是A100单卡batch=1的结果,边缘设备部署需另行验证。

工程实践启示

  • 给Agent上护栏,直接可用:0.8B版本50ms内拦截提示注入/信息窃取/工具滥用,适合做Agent执行前的第一道闸;四个尺寸覆盖从边缘到服务器的部署场景
  • “冻结骨干+分类头"值得抄:任何判别任务(不限安全)都可以用这招扩展能力——骨干嵌入提一次,新能力=训一个小MLP,旧能力零干扰
  • 难负例配对是抑制误报的关键:做安全分类器时,生成与正例表面相似但本质无害的负例,比堆量普通负例有效得多
  • 多语言不是可选项:攻击者会用任何语言绕过英语中心的过滤器;护栏训练数据必须覆盖目标市场的语言
  • 审计与拦截分层:高吞吐场景用判别模式打分+阈值分级,触发告警的再走生成模式出可解释报告给人工——这套双层架构可以直接搬到生产

本文由AI精读生成,论文版权归原作者所有。