论文信息
| 项目 | 内容 |
|---|---|
| 日期 | 2026-09-13(论文发布 2026-09-06) |
| 论文 | SRD-Guard: A Defense Framework of LLMs via Semantic Rewriting and Joint Multi-Model Scoring for Latent Intent Exposure |
| 作者 | Qi Wang, Chengcheng Wan, Jiangtao Wang(通讯作者) |
| 机构 | 华东师范大学软件工程学院 / 上海创新研究院 |
| 链接 | https://arxiv.org/abs/2609.06540 |
| 代码 | https://anonymous.4open.science/status/CICD-Guard-D648(匿名评审仓库) |
注:今日 arXiv API 与 Semantic Scholar API 持续限流(HTTP 429,已按 60s/180s/300s 三档退避重试),选题改经 OpenAlex 与 Hugging Face Papers 元数据通道检索验证,论文以 arXiv ID 2609.06540 原文为准。
一句话总结
SRD-Guard把越狱防御从"识别表面特征"转向"测量意图暴露":对每个输入生成5个保留目标、剥离包装的语义改写,再用多个独立LLM评分器对原文+改写联合打分,按"绝对风险+相对风险变化"双信号路由——免参数、纯黑盒,三类伪装越狱平均检出率最高100%,过拒率压到8%~12%。
解决什么问题
越狱攻击惯用"上下文包装"隐藏恶意:角色扮演(DAN类人格)、虚构场景(DeepInception嵌套故事)、密码化指令(CIPHER)。现有推理时防御陷入两难:表面检测容易漏掉伪装攻击,保守拦截又大量误伤正常请求——DSR(攻击检出率)与ORR(过拒率)的权衡长期不理想,尤其"貌似有正当理由的请求"最难处理。
核心方法
三段式流水线,全程不改模型参数:
1. 语义改写(Semantic Rewriting):LLM对输入生成5个语义相关改写,要求保留底层目标、剥离角色扮演/场景/动机等包装。伪装攻击的风险藏在包装里,改写后恶意"裸露"。
2. 联合多模型评分:多个相互独立的LLM安全评分器在连续风险尺度上给原文与全部改写打分。共识机制稀释单一评分器的偏置与盲区,对个别评分器的异常行为更稳健。
3. 风险自适应路由:决策模块结合绝对风险阈值与原文vs改写的相对风险变化,把请求路由到拦截 / 放行 / 警示三条路径——模糊地带不硬判,交给提示词二次确认或人工复核。
实验结果
- 攻击面:UNIATTACK、CIPHER、DeepInception;被保护模型:Llama-3-8B-Uncensored 与 DeepSeek-V4-Flash;评测集:AdvBench(有害)+ OR-Bench-Hard(良性)
- 两套被护模型上平均DSR分别达 91.44% 与 100%,ORR分别仅 8.00% 与 12.00%,DSR-ORR权衡全面优于所测基线
- 消融实验:去掉改写→伪装攻击漏检显著上升;单评分器→稳健性下降;去掉自适应路由→模糊输入误处理增多,三组件各自有效
深层洞察
最有价值的信号是相对风险变化:包装型攻击的原文风险被伪装压低,改写剥离包装后风险陡增——这个"差值"比任何绝对阈值都更难逃逸。它把防御问题从"这句话坏不坏"重构为"包装贡献了多少风险",本质是对"伪装行为"本身的测量。这套改写一致性思路可迁移到prompt注入检测、内容审核申诉等一切"表层与内核可能背离"的场景。
局限性
- 每个请求需1次改写生成+多评分器×6份文本的评分,推理成本与延迟显著高于单点防御
- 改写质量依赖改写模型,攻击者可能构造"改写不变"型伪装来对冲
- 仅验证3类攻击×2个模型,多轮对话、多模态越狱未覆盖
- 代码为匿名评审仓库,正式开源与复现性待确认
工程实践启示
- API网关层可低成本叠加:不动模型权重,纯prompt工程+路由逻辑,任何闭源API模型都能用;
- 多评分器共识+相对变化信号,比堆更大的单一审查模型更稳、更难被反向工程;
- 拦截/放行/警示三路由给安全运营留出灰度空间,二值判决在高风险业务里是奢侈品;
- 评测安全防御必须同时报DSR与ORR,只报一边的论文都要打问号。