每日论文精读 #041:VideoMM用宏观-微观两级感知破解长视频推理的token爆炸

VideoMM将token选择与细粒度推理解耦:在降采样的宏观代理上做语义筛选,仅对不确定样本按需激活高分辨率微观token,长视频理解提速6.13倍且精度反升7.4%。

2026年9月22日 · 1 分钟

每日论文精读 #006:把长期记忆搬进潜空间,稀疏概念动态建图

LGM用稀疏自编码器解耦记忆、按查询动态构建潜空间图,以16个潜前缀token替代全文回放,在隐式偏好推断上超过GPT-5。

2026年9月21日 · 1 分钟

每日论文精读 #040:工具型Agent的通用防御——简单多层防御即可把攻击成功率打到0%

提出针对工具型LLM Agent四类攻击(直接/间接注入、记忆投毒、后门)的统一多层防御框架,工具过滤+工具集恢复+提示工程组合在多种模型上实现0%攻击成功率且不伤任务性能。

2026年9月20日 · 1 分钟

每日论文精读 #039:别让中间计划丢细节——PaperCompiler把论文证据编译成仓库级规格说明

PaperCompiler把论文复现中的自由文本计划换成显式的仓库级规格说明:证据分级、需求到文件的归属映射、非退化约束,让生成代码对论文方法的保真度提升13.8%。

2026年9月19日 · 1 分钟

每日论文精读 #038:让AI先生成"视觉思考"再画图——VoT在VLM与扩散模型之间架起离散语义桥

VoT不再把VLM当文本编码器用,而是让它先生成一组离散的视觉计划token(物体、布局),再交给DiT渲染像素,用闭环三重损失训练的VoT tokenizer打通了语言语义与视觉信号之间的可解释接口。

2026年9月18日 · 1 分钟

每日论文精读 #037:点积相似度为何总跑输余弦?PACE用渐进式训练解放嵌入范数

PACE诊断出点积训练失败的两大病灶——角度-范数纠缠与方向各向异性,用两阶段课程(余弦+LoRA → 点积+全参微调)加Focal Embedding Loss,让嵌入范数真正参与语义编码。

2026年9月17日 · 1 分钟

每日论文精读 #036:Agent做医疗编码,输在发现而非验证

EMNLP 2026论文揭示自动化ICD编码的两种正交失败模式:神经分类器败于罕见码,固定工作流败于多步指南跟随;工具增强Agent可部分恢复性能,但瓶颈在候选发现而非验证。

2026年9月16日 · 1 分钟

每日论文精读 #035:预训练一次、适配所有目标——Osprey把投机解码接受长度最高拉高22.7%

Osprey把现成小LM剪枝后做目标无关预训练,一个骨干经词表对齐+零初始化QKV扩展+EAGLE-3蒸馏适配Qwen3-8B/Llama-3.3-70B/MiniMax-M2.5,平均接受长度+16.1%~22.7%,域外与多语增益最大。

2026年9月15日 · 1 分钟

每日论文精读 #034:把长期记忆『编译』成计划再执行——MaP-WAM登顶RMBench且执行上下文恒定

哈工大等提出MaP-WAM(Memory as Plans),把情景记忆在规划时编译为段级『语言计划+视觉引导』,执行器上下文O(1),RMBench成功率83.3%登顶,真机78.0%。

2026年9月14日 · 1 分钟

每日论文精读 #033:改写提问暴露隐藏恶意——SRD-Guard免参数黑盒越狱防御,检出率最高100%

华东师大提出SRD-Guard:语义改写+多模型联合评分+相对风险路由的免参数黑盒防御,对UNIATTACK/CIPHER/DeepInception三类伪装越狱平均检出率91.4%/100%,过拒率仅8%/12%。

2026年9月13日 · 1 分钟

每日论文精读 #032:把论文『编译』成规格说明书再写代码——PaperCompiler让论文复现忠实度提升13.8%

NTU提出PaperCompiler,将论文证据编译为仓库级实现规格(含证据溯源、非降级约束、所有权图),在Paper2CodeBench上参考忠实度从3.64提升至4.15,高危缺陷率从13.2%降至6.1%。

2026年9月12日 · 1 分钟

每日论文精读 #031:在生成图像前先「想一想」——VoT离散视觉思维层让文生图语义对齐大幅提升

字节Seed提出Vision-of-Thought,在VLM与扩散解码器之间插入离散视觉思维层,GenEval达0.91超越Mogao与FLUX。

2026年9月11日 · 1 分钟

每日论文精读 #030:固定top-k该退休了——免训练自适应检索平均只取4.7页,RAG延迟直降58.7%

ViSAR完全在ColPali/ColQwen2.5的嵌入空间内操作,构建查询条件化的页级相似度矩阵动态决定检索页数:平均只取4.7页(固定top-10、启发式方法取15-18页),端到端延迟最高降58.7%,精度还略有提升,且相似度矩阵稀疏度与答案对错正相关——一个免费的检索质量监控信号。

2026年9月10日 · 2 分钟

每日论文精读 #029:AST感知检索吊打朴素分块25个百分点,精简单Agent跑赢多Agent——仓库级重构Agent的对照实验

EMNLP 2026系统演示论文:固定环境单变量对照100个多文件重构任务,AST感知分块检索比朴素token窗口分块高25-30pp,精简检索单Agent(86%)完胜子Agent委派(66%),且检索带来的精度增益恰好抵消其token开销——单次成功成本不变。

2026年9月9日 · 1 分钟

每日论文精读 #028:把指令复制两遍,模型输出结构就变了——答案却不变

仅重复一遍过程指令这一零成本黑盒干预,让7个模型的协议完整率从90.22%升至93.17%,但最终答案准确率纹丝不动——控制面与答案面的分离值得工程侧深思。

2026年9月8日 · 1 分钟