📌 系列导航:🔥 日报 · 📚 周报 · 📡 技术雷达 · 📄 论文精读 · 📮 情报站

论文信息

项目内容
日期2026-09-27
论文GRACE: Grounded Adversarial Reasoning over Canadian Law
作者Jiakang Xu, Wantong Huo, Udom Silparcha, Jonathan H. Chan
机构多伦多大学、KMUTT、UTOA Computing
链接https://arxiv.org/abs/2609.23726
代码https://anonymous.4open.science/r/GRACE-CLeAR

一句话总结

论文构建了首个面向加拿大法律的对抗性推理数据集GRACE(1915条),并用它微调出4B小模型CLeAR-4B:开卷(提供法条原文)时表现大幅提升,但闭卷时无依据引用率从19.5%飙升至83.2%,说明法律场景下微调模型必须搭配检索使用。

解决什么问题

现有法律NLP基准(如LegalBench)大多只测规则记忆、分类、选择题,很少考察三种真实律师核心能力:为一个指定立场辩护(对抗性辩论)、在信息不足时承认无法下结论(不确定性推理)、综合多条法条得出结论(应用推理)。同时加拿大法在法律NLP中长期缺位。更关键的是:如何保证模型给出的法条引用是真实的,而不是编的?

核心方法

三模型流水线,职责分离防自评偏好:

  • 出题:Gemini-3.5-Flash-Lite 将272部联邦法规切分为自包含条款,生成三种模式的问题(对抗914/应用667/不确定性334)
  • 答题:Nemotron-3-Ultra-550B 独立作答,必须逐字引用所用条款,且不告知题目类型——模型能否发现"信息不足"本身就是校准信号
  • 审题:GLM-5.2 作为第三方裁判,从grounding/健全性/任务契合/完整性四个维度打分,打分前必须自己先独立解题

分层引用校验(模型无关):exact → normalized → cleaned → assembled → partial → unsupported 六级匹配。特别设计了"assembled"级别处理法律文书中合法的跳选摘录(引言+适用项合并、省略中间文字),避免把合法引用误判为编造。

训练:LoRA(rank 16, α=32)微调Qwen3-4B,按法案而非按题目切分80/10/10,防止近似重复泄漏到测试集。

实验结果

开卷(提供法条)下,CLeAR-4B 对比原版 Qwen3-4B:

  • ROUGE-L:0.4220 vs 0.1501(近3倍)
  • BERTScore F1:0.8992 vs 0.8580
  • 每答案引用数:1.8 vs 0.3,且覆盖率基本持平

闭卷(不给法条)下的关键发现:

  • CLeAR-4B 无依据引用率 19.5% → 83.2%,仅16.8%的引用可追溯
  • 基座模型闭卷时输出破碎、明显不完整;而CLeAR-4B 仍输出流畅的法律腔+看似规范的条款引用——但大部分是编的,比破碎输出更难被人察觉

深层洞察

这篇论文最值钱的不是数据集,而是它用一个干净的实验设计(训练只开卷、测试开/闭对比)分离了"grounding能力"和"风格模仿":微调让4B模型学会了引用的格式,但没学会引用的诚实——一旦失去原文,它就用预训练里模糊的法律记忆填空,产出高置信度的幻觉。这正是所有法律/医疗/金融领域LLM应用的通病:流畅性是危险的面具。

局限性

  • 数据全部由LLM合成+LLM裁判过滤,无人类专家标注验证
  • 只覆盖加拿大联邦法(约全量25%),规模1915条相对小
  • 长法案按Part/Division切分导致跨分区引用依赖无法处理,只能让出题方跳过
  • 评测用ROUGE/BERTScore对齐教师输出,是代理指标而非法律正确性

工程实践启示

  1. 领域微调模型必须搭配RAG部署:开卷性能增益巨大、闭卷幻觉暴涨,结论明确——法律类应用检索不是可选项
  2. 分层引用校验可直接复用:assembled级别的跳选匹配设计,对任何需要验证引用真实性的系统(防幻觉护栏)都有参考价值
  3. 出题/答题/裁判用三家模型防自评偏好,这个数据构造范式值得抄
  4. 按文档而非按样本切分数据集,避免近重复泄漏虚高指标
  5. 监控幻觉不要只看输出流畅度:闭卷下基座模型"看起来差"反而更安全