📄 每日论文精读
每日arXiv论文精读 · 由星月AI基于arXiv编译
📰日报
📚周报
📡雷达
📄论文
📮情报
全部
记忆
推理
Agent
RAG
训练
编码
安全
#023
Agent
每日论文精读 #023:让Agent维护共享代码库,冗余直降38%
日期 2026-09-02
9月2日 · KAIST提出Super Library Agent:Agent在依次生成多个应用时同步维护跨应用共享库,用自然语言摘要索引发现可复用组件、用调用图上下文保证迁移安全,冗余度降38%、补丁体积降73%。
—
›
#022
安全
每日论文精读 #022:堆叠防御不会相乘——七层LLM防御栈失效相关性首次实测
日期 2026-09-01
9月1日 · 防御栈本质是集成学习:15对防御的失效相关性全部为正(φ 0.30–0.75),乘法组合是永远达不到的下界;七层栈拒绝81%良性请求却与最强单层无统计差异——深度买了拒绝,没买安全。
—
›
#021
记忆
每日论文精读 #021:从行为轨迹推断偏好,8B模型RL训练反超GPT-4.1
日期 2026-08-31
8月31日 · Behavior2Trip提出从用户历史行为轨迹隐式推断偏好的旅行规划新任务,RL训练的Qwen3-8B在个性化约束上大幅反超GPT-4.1
—
›
#020
安全
每日论文精读 #020:蚂蚁开源SingGuard-NSFA,Agent安全的双模式护栏
日期 2026-08-30
8月30日 · 蚂蚁集团开源Agent安全护栏框架:NSFA风险分类法+双模式推理,0.8B小模型即可实时拦截Agent运行威胁,F1超Llama Guard 3达30个点。
—
›
#019
编码
每日论文精读 #019:对LLM施压真的有用吗?心理学影响策略在代码生成中的实证研究
日期 2026-08-29
8月29日 · 用胁迫性、紧迫性语言给LLM下指令会显著降低代码正确性和安全性——18万次生成的大规模实证研究证明,对AI'施压'适得其反,而模型选择远比prompt措辞重要。
—
›
#018
训练
每日论文精读 #018:微调不撤销激活转向——权重编辑机制存续而行为可能回归
日期 2026-08-28
8月28日 · EMNLP 2026研究发现:嵌入式激活转向在SFT/RLHF微调后权重编辑几乎不被逆转(ρ=0.004),但行为可能通过替代通路回归,安全相关的拒绝抑制在SFT下平均损失64%效果。
—
›
#017
训练
每日论文精读 #017:ConvergeFlow——首个可证明收敛到token嵌入的流匹配语言模型
日期 2026-08-27(论文提交于 2026-08-24)
8月27日 · 用凸组合结构化数据预测器让流轨迹可证明地落在合法token嵌入上,甩掉CE解码器后Gen. PPL反而从60降到33。
—
›
#016
Agent
每日论文精读 #016:ARC-AGI-3从30%到95.5%,模型没换,换的是脚手架
日期 2026-08-26
8月26日 · Prime Intellect开源Prime Agent:不训练模型、不写死工作流,只用持久REPL+递归子代理+可精炼记忆三层状态架构,让同一个模型的长程任务得分翻三倍——harness即能力。
—
›
#015
推理
每日论文精读 #015:量化模型最该保住的不是准确率,而是「知道自己不知道」
日期 2026-08-25
8月25日 · 港科大/牛津等提出 DPQ:量化会悄悄改变模型的置信度与弃答行为,校准数据应按部署目标定向选择——边界保持用高怀疑混合(r75),宽分布保持用温和配方。
—
›
#014
Agent
每日论文精读 #014:AI 科研助手的下一步是把『你是谁』编码进研究全流程
日期 2026-08-24
8月24日 · Adobe/Vanderbilt 等机构提出 Personalized Auto-Research:把研究者画像作为上下文贯穿检索、假设、实验、写作、评审全流程,解决 AI co-scientist 千人一面的问题。
—
›
#013
安全
每日论文精读 #013:给AI Agent上锁:蚂蚁SingGuard-NSFA用185类风险分类+50ms分类头,Guardrail检测超最强对手12个点
日期 2026-08-23
8月23日 · 蚂蚁安全实验室提出NSFA风险分类法(185类风险变体,对齐3份OWASP指南)+双模Guardrail:生成式推理做可解释离线审计,冻结骨干上的轻量分类头做到50ms实时检测,0.8B-9B全尺寸模型F1超最强竞品6-12个点。
—
›
#012
编码
每日论文精读 #012:用户动了你的代码,编码Agent还能干活吗?SWE-Touch用「反编辑」压力测试发现平均掉点7.7%
日期 2026-08-22(论文发布于2026-08-03)
8月22日 · 中科院团队提出SWE-Touch基准:在Agent修Bug过程中注入与任务冲突的用户代码编辑,9个主流模型平均解决率暴跌7.7个百分点,排名大幅洗牌——自主能力强的模型不等于能应对共享工作区的变化。
—
›
#011
训练
每日论文精读 #011:LoRA微调的7B开源小模型在急诊分诊上反超Claude,本地化医疗部署成为可能
日期 2026-08-21
8月21日 · 系统对比8个开源SLM在急诊三大决策任务上的微调策略:LoRA微调的Mistral-7B分诊准确率反超Claude Sonnet 4.5,转诊推荐全面领先,仅诊断预测仍有差距——隐私合规驱动的本地化医疗AI正走向实用。
—
›
#010
RAG
每日论文精读 #010:给知识图谱一个 ls/cat/grep——图推理智能体胜过全量塞上下文
日期 2026-08-20
8月20日 · 七个通用工具的图推理智能体 GRA,在工业混合知识图谱上以不到三分之一的输入 token 胜过全量上下文基线 5.1 个百分点——赢在'选择性访问'而非图拓扑本身。
—
›
#009
安全
每日论文精读 #009:让 AI 输出自带“计算指纹”——计算溯源证明模型内耗状态可写入生成文本
日期 2026-08-19(论文提交于 2026-08-17)
8月19日 · Benjamin Belay 提出计算溯源(Computational Provenance)概念:经过验证的模型内部因果状态,可以决定生成文本中的统计信号,即使最终答案完全相同,检测器也能从文本措辞中恢复出模型实际走了哪条内部计算路径。
—
›
#008
推理
每日论文精读 #008:CForce 让扩散语言模型敢于“抢跑”——早期预测对齐后期修正,并行解码吞吐提升 31%
日期 2026-08-18(论文发布 2026-08-14)
8月18日 · 上海交大 & 蚂蚁集团提出 Consistency Forcing,用模型自身解码轨迹做自蒸馏,让 dLLM 早期低上下文预测对齐后期高置信预测,TPF 从 6.94 提到 9.08 且质量不降。
—
›
#007
记忆
每日论文精读 #007:Agent的记忆会进化还不够,检索策略也要能进化
日期 2026-08-17
8月17日 · ERSkill把记忆检索行为建模成可执行的技能程序,用经验前缀树+双前沿机制让技能集与路由器共同进化,三个记忆基准上平均分超最强基线28-31%,且跨数据集直接迁移有效
—
›
#006
安全
每日论文精读 #006:给AI Agent上护栏——冻结骨干+轻量分类头,50ms拦截185种攻击
日期 2026-08-16
8月16日 · SingGuard-NSFA用CIA三元组构建185类Agent安全风险分类体系,生成式推理离线审计+判别式分类头在线拦截双模式,9B模型超最强竞品6-12个F1点,50ms完成实时检测
—
›
#005
Agent
每日论文精读 #005:AI科学家的工作流已经完整,缺的是直接看数据的能力
8月15日 · 现有AI科学家只消费人工预处理后的文本和特征,属于工作流完整、证据不完整。OmniScientist让多模态感知贯穿研究全生命周期,正面对比85%获胜
—
›
#004
训练
RLHF的偏好平均化正在制造系统性不公
Procedural Fairness Failures in RLHF from Preference Averaging
8月14日 · 标准RLHF平均化异质偏好导致少数群体被忽视,PA-RLHF将公平差距降40%
—
›
#003
训练
多智能体RL训练中的模拟器崩溃
One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL
8月14日 · 单一冻结LLM模拟器导致策略过拟合,Co-Training可提升14%泛化成功率
—
›
#002
RAG
长上下文训练反而削弱模型知识
Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge
8月12日 · 信息丰饶悖论:上下文越长模型越依赖上下文,参数化知识反而下降
—
›
#001
记忆
结构化记忆抑制过度个性化
Mitigating Over-Personalization in LLMs via Structured Memory
8月8日 · 减少8.8%跨领域泄漏,不改模型只改呈现格式
—
›