论文信息

字段内容
📅 日期2026-08-13(论文发布:2026-08-12)
📄 论文Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge
👤 作者Arda Uzunoglu, Benjamin van Durme, Daniel Khashabi
🏫 机构Johns Hopkins University
🔗 链接arxiv.org/abs/2608.12218
💻 代码github.com/ardauzunoglu/information-abundance-paradox

一句话总结

上下文越长不一定越好——训练时给模型太丰富的上下文信息,模型会"偷懒"不去记忆,变成一个离不开上下文的"瘾君子"。


解决什么问题

行业有一个默认假设:上下文窗口越长,模型越强。从4K到32K到128K到1M,各家都在卷上下文长度。但论文观察到一个反直觉现象:

Phi-3和OLMo 3的长上下文版本(128K/65K)在零样本和少样本测试中,全面落后于自己的短上下文版本(4K/8K)。不是数据质量问题——长上下文版本用了更多更长的数据训练。

核心矛盾

模型训练时有两种"学习模式":

  • 参数化记忆(Parametric):把知识编码到权重里,不依赖上下文
  • 上下文依赖(Contextual):学会从上下文中找答案,不存到权重里

问题来了:如果训练时上下文里已经有了答案,模型为什么要费力存到权重里?


核心方法

信息丰饶悖论(Information Abundance Paradox)

论文提出的核心假设:训练上下文中的相关信息越丰富,模型越倾向于放弃参数化记忆,转而依赖上下文。

实验设计

预训练实验

  • 4个模型尺度:20M / 55M / 259M / 750M参数
  • 7个上下文窗口:512 → 32768 tokens(2倍递增)
  • 10B tokens训练量,相同数据、相同优化器
  • 关键:Token和更新步数完全对齐,只变上下文长度

监督微调实验

  • 固定上下文长度,改变上下文中任务相关信息的量
  • 测试三种场景:有上下文 / 无上下文 / 误导性上下文

实验结果

预训练:倒U型曲线

指标最佳上下文长度趋势
语言建模(Loss)~8192 tokens先降后升(U型)
SuperGLUE~2048 tokens先升后降(倒U型)
闭卷多选问答(MCQA)~2048 tokens先升后降(倒U型)

关键发现:超过最佳点后,上下文越长,性能越差。而且这个现象在所有模型尺度(20M到750M)上都存在——增大模型不能解决这个问题。

微调:上下文成瘾

训练时上下文越丰富:

  • ✅ 有上下文时表现更好
  • ❌ 没有上下文时表现更差
  • ❌ 误导性上下文时更容易被带偏

论文称之为 “Context Addiction”(上下文成瘾)

机制分析:FFN vs Attention的拉锯

论文从机制层面解释了这个现象:

  • 前馈网络(FFN):负责存储参数化知识
  • 注意力(Attention):负责利用上下文信息

训练时,如果上下文中有丰富信息,梯度压力会从FFN转移到Attention。模型发现"从上下文读"比"从权重记"更容易(更低的复杂度解),就越来越依赖Attention,越来越忽视FFN。

因果干预实验证实:长上下文训练的模型,在推理时更依赖上下文token——如果把上下文遮蔽,性能下降更严重。


深层洞察

1. 对长上下文竞赛的直接挑战

这篇论文直接挑战了当前行业的"长上下文军备竞赛"。各家都在卷1M、10M上下文,但这篇论文说:即使数据质量没问题,单纯增加训练上下文长度也可能有害——因为模型会变得依赖上下文。

2. 对RAG实践的深远影响

RAG的核心假设是"检索到的上下文帮模型回答得更好"。但论文发现,如果模型训练时就习惯了"上下文里有答案",它就丧失了独立判断能力——当RAG检索到错误信息时,模型更容易被误导。

这和另一个现象吻合:很多人发现GPT-4越更新越容易相信用户提供的(即使是错误的)上下文。可能不只是RLHF的问题,也可能跟长上下文训练有关。

3. 与MemOS/记忆系统的关系

参数化知识 vs 上下文依赖,本质上是内部记忆 vs 外部记忆的选择。这篇论文证明了:过度依赖外部记忆(上下文)会削弱内部记忆(参数化知识)。这对Agent记忆系统设计是一个重要警示——不能无限制地给模型堆外部上下文。

4. 模型不是在"学习",而是在"找最省事的路径"

信息丰饶悖论的本质是学习路径优化:模型会自动选择复杂度最低的解法。如果上下文提供了"捷径",模型就不会费力去存知识。这和人类学习有相似之处——笔记记得太全的人,反而记不住内容。


局限性

  1. 模型尺度有限——最大只到750M,没有在70B+级别的模型上验证。大模型可能因为参数冗余而不受影响
  2. 只用单一数据源——Project Gutenberg(文学文本),代码、科学论文等不同类型数据可能表现不同
  3. 预训练设置理想化——Token和更新步数完全对齐,但实际训练中长上下文通常意味着更多Token
  4. 没有讨论推理阶段的长上下文——论文关注训练阶段,推理时给多长上下文是另一个问题

工程实践启示

  1. 不要盲目追求长上下文训练——如果你需要模型在无上下文时也能回答(如Agent的参数化记忆),训练上下文不是越长越好
  2. RAG需要关注鲁棒性——不仅测试有正确上下文时的效果,还要测试无上下文和误导性上下文时的表现
  3. 混合训练策略——在长上下文训练中混入一定比例的短上下文/无上下文样本,可能有助于维持参数化知识(论文提到但未深入)
  4. 评测要覆盖无上下文场景——如果你的产品有时会检索失败,确保模型在没有上下文时还能给出合理回答

精读者:星月AI · 2026-08-13