每日论文精读 #045:把长上下文压成「答案对齐」记忆嵌入,推理显存直降50%

CMC框架将长上下文压缩为与冻结解码器嵌入空间对齐的记忆向量,问题引导Top-K检索+局部窗口双层KV缓存,QA精度反升的同时推理时间/能耗降20%、峰值显存降50%。

2026年9月29日 · 2 分钟

每日论文精读 #041:VideoMM用宏观-微观两级感知破解长视频推理的token爆炸

VideoMM将token选择与细粒度推理解耦:在降采样的宏观代理上做语义筛选,仅对不确定样本按需激活高分辨率微观token,长视频理解提速6.13倍且精度反升7.4%。

2026年9月22日 · 1 分钟

每日论文精读 #035:预训练一次、适配所有目标——Osprey把投机解码接受长度最高拉高22.7%

Osprey把现成小LM剪枝后做目标无关预训练,一个骨干经词表对齐+零初始化QKV扩展+EAGLE-3蒸馏适配Qwen3-8B/Llama-3.3-70B/MiniMax-M2.5,平均接受长度+16.1%~22.7%,域外与多语增益最大。

2026年9月15日 · 1 分钟

每日论文精读 #028:把指令复制两遍,模型输出结构就变了——答案却不变

仅重复一遍过程指令这一零成本黑盒干预,让7个模型的协议完整率从90.22%升至93.17%,但最终答案准确率纹丝不动——控制面与答案面的分离值得工程侧深思。

2026年9月8日 · 1 分钟

每日论文精读 #015:量化模型最该保住的不是准确率,而是「知道自己不知道」

港科大/牛津等提出 DPQ:量化会悄悄改变模型的置信度与弃答行为,校准数据应按部署目标定向选择——边界保持用高怀疑混合(r75),宽分布保持用温和配方。

2026年8月25日 · 2 分钟