论文信息
| 项目 | 内容 |
|---|---|
| 日期 | 2026-09-27 |
| 论文 | GRACE: Grounded Adversarial Reasoning over Canadian Law |
| 作者 | Jiakang Xu, Wantong Huo, Udom Silparcha, Jonathan H. Chan |
| 机构 | 多伦多大学、KMUTT、UTOA Computing |
| 链接 | https://arxiv.org/abs/2609.23726 |
| 代码 | https://anonymous.4open.science/r/GRACE-CLeAR |
一句话总结
论文构建了首个面向加拿大法律的对抗性推理数据集GRACE(1915条),并用它微调出4B小模型CLeAR-4B:开卷(提供法条原文)时表现大幅提升,但闭卷时无依据引用率从19.5%飙升至83.2%,说明法律场景下微调模型必须搭配检索使用。
解决什么问题
现有法律NLP基准(如LegalBench)大多只测规则记忆、分类、选择题,很少考察三种真实律师核心能力:为一个指定立场辩护(对抗性辩论)、在信息不足时承认无法下结论(不确定性推理)、综合多条法条得出结论(应用推理)。同时加拿大法在法律NLP中长期缺位。更关键的是:如何保证模型给出的法条引用是真实的,而不是编的?
核心方法
三模型流水线,职责分离防自评偏好:
- 出题:Gemini-3.5-Flash-Lite 将272部联邦法规切分为自包含条款,生成三种模式的问题(对抗914/应用667/不确定性334)
- 答题:Nemotron-3-Ultra-550B 独立作答,必须逐字引用所用条款,且不告知题目类型——模型能否发现"信息不足"本身就是校准信号
- 审题:GLM-5.2 作为第三方裁判,从grounding/健全性/任务契合/完整性四个维度打分,打分前必须自己先独立解题
分层引用校验(模型无关):exact → normalized → cleaned → assembled → partial → unsupported 六级匹配。特别设计了"assembled"级别处理法律文书中合法的跳选摘录(引言+适用项合并、省略中间文字),避免把合法引用误判为编造。
训练:LoRA(rank 16, α=32)微调Qwen3-4B,按法案而非按题目切分80/10/10,防止近似重复泄漏到测试集。
实验结果
开卷(提供法条)下,CLeAR-4B 对比原版 Qwen3-4B:
- ROUGE-L:0.4220 vs 0.1501(近3倍)
- BERTScore F1:0.8992 vs 0.8580
- 每答案引用数:1.8 vs 0.3,且覆盖率基本持平
闭卷(不给法条)下的关键发现:
- CLeAR-4B 无依据引用率 19.5% → 83.2%,仅16.8%的引用可追溯
- 基座模型闭卷时输出破碎、明显不完整;而CLeAR-4B 仍输出流畅的法律腔+看似规范的条款引用——但大部分是编的,比破碎输出更难被人察觉
深层洞察
这篇论文最值钱的不是数据集,而是它用一个干净的实验设计(训练只开卷、测试开/闭对比)分离了"grounding能力"和"风格模仿":微调让4B模型学会了引用的格式,但没学会引用的诚实——一旦失去原文,它就用预训练里模糊的法律记忆填空,产出高置信度的幻觉。这正是所有法律/医疗/金融领域LLM应用的通病:流畅性是危险的面具。
局限性
- 数据全部由LLM合成+LLM裁判过滤,无人类专家标注验证
- 只覆盖加拿大联邦法(约全量25%),规模1915条相对小
- 长法案按Part/Division切分导致跨分区引用依赖无法处理,只能让出题方跳过
- 评测用ROUGE/BERTScore对齐教师输出,是代理指标而非法律正确性
工程实践启示
- 领域微调模型必须搭配RAG部署:开卷性能增益巨大、闭卷幻觉暴涨,结论明确——法律类应用检索不是可选项
- 分层引用校验可直接复用:assembled级别的跳选匹配设计,对任何需要验证引用真实性的系统(防幻觉护栏)都有参考价值
- 出题/答题/裁判用三家模型防自评偏好,这个数据构造范式值得抄
- 按文档而非按样本切分数据集,避免近重复泄漏虚高指标
- 监控幻觉不要只看输出流畅度:闭卷下基座模型"看起来差"反而更安全