📌 系列导航🔥 日报 · 📚 周报 · 📡 技术雷达 · 📄 论文精读 · 📮 情报站

论文信息

项目内容
日期2026-08-19(论文提交于 2026-08-17)
论文Towards Computational Provenance: Carrying Causal-State Evidence in Generated Text
作者Benjamin Belay(独立作者)
机构未标注(独立研究者)
链接arXiv:2608.16868
代码未提供
领域cs.CL / cs.AI,模型可解释性与可验证性

一句话总结

在严格控制的算术任务上,作者证明了“计算溯源”的可行性:模型内部经过验证的因果状态(走了哪条内部路径)可以像水印一样写进生成文本的措辞统计模式中,即便两次执行给出完全相同的答案、相同的语义、相同的采样随机数,检测器依然能 128/128 地从文本中辨认出模型实际使用的内部状态。

解决什么问题

LLM 的输出文本本身并不能证明它内部到底怎么算的。CoT(思维链)是生成出来的文字,不是对内部计算的直接观察——已有研究(Turpin et al. 2023, Lanham et al. 2023)表明 CoT 可能遗漏、合理化甚至伪装真实的计算过程。两次执行可以给出相同答案和同样“合理”的解释,却走过完全不同的内部计算路径。

这带来一个监督难题:在可扩展监督(scalable oversight)场景中,评估者无法区分“答对了但走错了路”和“答对了且走了预期路径”。现有的可解释性工具(稀疏自编码器、线性探针)能看进模型内部,但它们是研究者的外部分析,不是输出文本自带的证据;现有的水印技术(Kirchenbauer、SynthID-Text 等)能证明“这是模型生成的”,但携带的是密钥信息,与模型内部计算无关。

本文提出的“计算溯源”(computational provenance)填补这个空白:让生成文本携带关于“哪条内部计算路径实际发生了”的可检测证据。

核心方法

整个流水线分四步,关键在于“先验证、后签名”的因果绑定:

1. 强制离散状态通路的算术任务。 输入四个 0–15 的数,计算 z1=(a+b) mod 16,z2=(z1+c) mod 16,z3=(5·z2+d) mod 16,最终答案 y=z3 mod 8。模型结构上强制所有计算必须穿过两个离散中间状态 z2 和 z3——产生 z3 的模块只能看到 z2 和 d,答案模块只能看到 z3,无路可绕。精妙之处在最后的 mod 8:z3 相差 8 的两个值映射到同一个答案。于是把 z2 替换成 (z2+8) mod 16 后,z3 也随之 +8,但答案不变——制造出“内部路径不同、外部输出完全相同”的配对执行。

2. 因果干预验证。 干预 z2 检查 z3 是否按预测变化(连同同状态、错状态、伪干预等对照组),确认 z2 确实因果地参与了后续计算,而不是一个无关标签。

3. 密码学回执(receipt)。 可信插桩在计算发生点直接记录 z2、z3,存入带 HMAC(密钥消息认证码)的小记录。篡改、重放、乱序、缺失的记录都会被验证器拒绝。只有验证通过后,z2 的真实值才被允许去决定文本信号——信号绑定的是“实际发生并被验证的状态”,而不是事后挑选的值。

4. 状态决定文本统计模式。 生成固定语义的短报告,每句有 6 个可变词位(如 {Here, Now, Presently, Directly, Briefly, Simply, Accordingly, Formally} 八选一),每个 z2 值指定其中 4 个为“偏爱”词、稍提高其采样概率。z2=4 和 z2=12 会偏好不同子集,24 个词位(4 句 × 6 位)的微小偏好累积成可检测的统计指纹。检测器用固定统计规则(非训练分类器)对 16 个候选 z2 打分,超过校准阈值且高于所有竞争者才接受。

两套架构实现同一机制:模块化前馈网络(12,648 参数)和双 Transformer 编码器结构(546,088 参数),后者完全复用前者的信号与检测器,不做任何重新校准。

实验结果

  • 因果通路复现:5/5 个独立训练的前馈模型、3/3 个 Transformer 全部通过因果干预测试(共 28,672 个因果测试用例)。
  • 端到端溯源:两个架构各自预留的模型在公开集和事先密封的受保护集上均 128/128 通过——每次配对执行都走了不同的 z2→z3 路径、给出相同答案,检测器正确恢复验证状态对应的信号。
  • 零混淆:无错状态混淆、无信号对照组零误报、回执完整性检查零失败。
  • 自然状态负面结果:仅训练答案(不监督中间状态)的 3 个 Transformer 全部 100% 学会任务,但冻结线性探针在 20 个预设位置的最好成绩仅 23.80%(16 类 z2 全值)和 45.54%(z2 mod 8)——未达到预设标准,未继续干预实验。答案是学会了,但可认证的中间状态没有自然涌现(至少线性探针找不到)。

深层洞察

这篇论文的重要性在于它把三条通常独立的证据链焊在了一起:因果干预证明状态真实参与计算,密码学回执证明状态确实发生过,统计信号把这个已验证状态带进可观察的输出。回执单独存在是侧车记录;水印单独存在只证明模型身份;只有三者结合,文本才成为“内部计算的自带证词”。

这对 AI 安全有微妙但深远的意义。当前 CoT 忠实性研究的基本困境是:解释是生成的,无法自证清白。如果计算溯源能扩展到真实 LLM,监督者可以不依赖模型“自己说自己怎么想的”,而是检测“已验证的内部状态是否在输出中留下了应留的痕迹”。这是从“读模型的日记”到“验证模型的指纹”的范式转变。

负面结果同样有价值:answer-only 模型完美解题却在线性探针下无处安放 z2,暗示自然训练的模型可能把这类信息分布式、非线性地编码。这也侧面呼应了可解释性领域的核心难题——概念瓶颈需要在训练时显式构造,事后挖掘未必找得到。

局限性

作者自己说得很坦诚(6.2 节):这是有限算术任务上的受控概念验证,不是真实 LLM 上的结果。两个架构都是特制的(专为穿过 z2/z3 训练),不是预训练语言模型;文本生成被限制在固定语义、有限可换词的模板句中,开放生成、长文本、改写编辑后的存活率未知;整个体系信任插桩、验证器和 HMAC 密钥不被攻破——所以它不是“无信任的纯输出证明”。此外信号机制会轻微偏置采样分布,理论上存在被剥离或伪造的空间(虽然论文测试的攻击类型都防住了)。独立作者、无代码、无机构标注,也让人对严谨性多一分审慎。

工程实践启示

  1. 审计日志 + 输出绑定的混合架构:把密码学回执(侧车记录)与输出内嵌信号结合,前者提供强完整性,后者让输出离开原始环境后仍携带证据——这对 API 转发、多跳调用(类似 AEX 的场景)有参考价值。
  2. “先验证后签名”的时序设计:信号只绑定已验证真实发生的状态,而不是事后声明。任何做模型审计、推理留痕的系统都值得借鉴这个模式,避免“日志可以事后编”的问题。
  3. 词位偏置是实用的隐写通道:6 词位 × 8 候选 × 微小概率偏置 × 多句累积,这个构造对做 LLM 水印、溯源、A/B 模型区分的工程团队是直接的模板。
  4. 别指望事后挖状态:如果业务需要可审计的中间状态(如金融风控的解释链),在训练时就显式监督这些状态(概念瓶颈式),比寄希望于事后探针挖掘靠谱得多。
  5. 密封测试集的方法论:训练前密封 128 对受保护样本、模型先过公开测试再一次性解封评测,这套预注册式评估流程值得所有声称“鲁棒”的系统借鉴。