每日论文精读 #045:把长上下文压成「答案对齐」记忆嵌入,推理显存直降50%
CMC框架将长上下文压缩为与冻结解码器嵌入空间对齐的记忆向量,问题引导Top-K检索+局部窗口双层KV缓存,QA精度反升的同时推理时间/能耗降20%、峰值显存降50%。
CMC框架将长上下文压缩为与冻结解码器嵌入空间对齐的记忆向量,问题引导Top-K检索+局部窗口双层KV缓存,QA精度反升的同时推理时间/能耗降20%、峰值显存降50%。
VideoMM将token选择与细粒度推理解耦:在降采样的宏观代理上做语义筛选,仅对不确定样本按需激活高分辨率微观token,长视频理解提速6.13倍且精度反升7.4%。
Osprey把现成小LM剪枝后做目标无关预训练,一个骨干经词表对齐+零初始化QKV扩展+EAGLE-3蒸馏适配Qwen3-8B/Llama-3.3-70B/MiniMax-M2.5,平均接受长度+16.1%~22.7%,域外与多语增益最大。
仅重复一遍过程指令这一零成本黑盒干预,让7个模型的协议完整率从90.22%升至93.17%,但最终答案准确率纹丝不动——控制面与答案面的分离值得工程侧深思。
港科大/牛津等提出 DPQ:量化会悄悄改变模型的置信度与弃答行为,校准数据应按部署目标定向选择——边界保持用高怀疑混合(r75),宽分布保持用温和配方。