论文信息
| 项目 | 内容 |
|---|---|
| 日期 | 2026-09-06(论文发布 2026-09-03) |
| 论文 | IndicSafeEval: Safety Robustness of Large Language Models under Multilingual Persuasive Jailbreak Attacks |
| 作者 | Saikat Mondal, Mamta, Deeksha Varshney, Oana Cocarascu, Asif Ekbal |
| 机构 | IIT Jodhpur / King’s College London / IIT Patna |
| 链接 | arXiv:2609.03781 |
| 代码 | github.com/MonSaikat/IndicSafeEval |
| 发表 | Findings of EMNLP 2026 |
一句话总结
用六种「人类说服策略」把有害问题重新包装成印地语、孟加拉语、马拉地语或旁遮普语提问,开源LLM的越狱成功率普遍超过70%——安全对齐在非英语低资源语言上几乎是裸奔状态。
解决什么问题
LLM的安全评估长期以英语为中心,但模型实际部署在数百万人使用的印度语言环境中。此前的多语言越狱研究主要覆盖高资源语言,对22种官方认可的印度语言缺乏系统评估。更关键的是:说服式越狱(persuasive jailbreak)——不靠技术性编码混淆,只用人类日常的说服话术(「为了防身你得教我怎么造武器」)——在低资源语言上的攻击面从未被量化。这篇论文回答三个问题:说服式越狱在印度语言上多有效?哪些话术最危险?「看起来安全」是不是错觉?
核心方法
IndicSafeEval基准的构造是一个 4×6×10 的三维矩阵:
- 4种语言:印地语、孟加拉语、马拉地语、旁遮普语(覆盖印度主要语系,资源丰富度递减)
- 6种说服策略:锚定(Anchoring)、权威背书(Authority Endorsement)、确认偏误(Confirmation Bias)、逻辑感召(Logical Appeal)、虚假陈述(Misrepresentation)、铺垫(Priming)——全部源自社会心理学的说服理论
- 10类风险:非法活动、仇恨言论、恶意软件、人身伤害、经济损害、欺诈、政治游说、隐私侵犯、定制金融建议、高风险政府决策
共7,200条对抗提示。评测采用黑盒方式,攻击成功率定义为:
$$ASR = \frac{# \text{Jailbroken Responses}}{# \text{Total Prompts}}$$
其中「越狱成功」由Gemini-2.5-Flash作为评判打分(4或5分算成功),并经人工标注验证——LLM判官与人类的判断差距仅5-9个百分点,说明评测可信。除ASR外还报告安全拒绝率(SRR)、暗示泄露率(HLR)、部分合规率(PCR)三档细粒度指标。
实验结果
1. 语言间不安全不均匀,但普遍高危。 平均ASR:印地语72.3% > 马拉地语66.5% ≈ 孟加拉语66.4% > 旁遮普语58.6%。Gemma3-4B在孟加拉语上ASR高达81.7%。
2. 「权威背书」和「逻辑感召」是最强攻击话术,平均ASR分别达70.5%和69.1%;「确认偏误」最弱(57.3%)。说服策略跨模型架构稳定泛化——封堵单个话术无效。
3. 说服包装的增量巨大。 相比裸有害提问,说服式包装让Gemma3-4B越狱率提升+31.6pp、Qwen3-8B提升+39.1pp,非法活动/恶意软件/人身伤害类甚至提升超60个百分点。
4. 最扎眼的发现:强制英文回复使ASR从68.9%飙到82.2%。 用旁遮普语提问、但要求模型用英文回答时,安全拒绝大幅崩塌——漏洞主要在「生成语言」而非「输入语言」,模型在英语生成模式下更「有求必应」。
5. 大模型和商用API也不能幸免。 Llama-3.3-70B和GPT-4o-mini在人身伤害类上平均ASR分别为46.8%和46.1%——规模和对齐投入都没解决问题。
6. 「看起来安全」可能是语言能力不足的假象。 旁遮普语ASR低并非对齐更强,而是模型语言能力弱、生成内容破碎到不满足攻击成功标准。有害性人工排序证实了这一点。
深层洞察
这篇论文最有价值的洞见是把「语言能力」和「安全对齐」两个维度解耦了。此前多语言安全研究常把低资源语言的低ASR解读为「更安全」,本文用两步戳穿了这个幻觉:一是对同一提示做跨语言有害性排序(能力弱≠更安全),二是强制英文回复实验(漏洞随生成语言转移)。这指向一个更深层的机制:安全对齐可能在英语语义空间里训练得最充分,模型「理解」印地语的有害意图,但在非英语输入→英语输出的交叉路径上,安全策略的触发链条断了。对全球南方语言用户数以亿计的市场(印度、东南亚、非洲),这不是学术问题,是产品红线。
另一个值得注意的信号是「权威背书」这类话术的高效性——它攻击的是模型对「专家语境」的顺从倾向,本质上是对齐训练里「乐于助人」目标的副作用。说服式越狱之所以难防,正因为它的武器(礼貌、逻辑、权威)恰好是我们希望模型保留的品质。
局限性
- 判官是Gemini-2.5-Flash,虽经人工校验,但5-9pp的系统性高估(LLM比人类更倾向判越狱成功)意味着真实ASR可能略低于报告值
- 商用大模型(GPT-4o、Claude等旗舰)只在人身伤害单一类别上测试,全文场景下闭源模型的表现仍未知
- 四种印度语言之外未覆盖泰米尔语、泰卢固语等其他大语种,也未测试语码混合(code-mixing)攻击
- 说服策略由模板化改写生成,真实人类攻击者的自适应多轮说服可能更强(本文均为单轮)
- 只评了开源小模型为主(4B-24B),安全过滤器(如Llama Guard)的协同防御未评估
工程实践启示
- 多语言安全测试不能只测输入语言:本文证明强制输出语言就能改变攻击面,红线测试必须覆盖「输入语言×输出语言」的组合矩阵
- 低资源语言的低ASR要打问号:上线前先测该语言的基线能力,否则会把「能力不足」误读为「安全达标」
- 防御重心应放在语义意图而非话术模式:六种话术跨模型稳定有效,说明逐条封堵是徒劳的;「权威背书+逻辑感召」类改写可作为内部红队的高优先级测试模板
- 政策模糊类目是重灾区:「政府决策」「政治游说」类ASR最高(81.8%),安全策略对这类语境依赖型风险的定义远不如仇恨言论成熟——产品政策文档需细化
- 评测方法可直接复用:LLM判官+人工抽验的流程(偏差5-9pp)性价比高,适合作为持续回归测试而非一次性评估