每日论文精读 #023:让Agent维护共享代码库,冗余直降38%

KAIST提出Super Library Agent:Agent在依次生成多个应用时同步维护跨应用共享库,用自然语言摘要索引发现可复用组件、用调用图上下文保证迁移安全,冗余度降38%、补丁体积降73%。

2026年9月2日 · 1 分钟

每日论文精读 #022:堆叠防御不会相乘——七层LLM防御栈失效相关性首次实测

防御栈本质是集成学习:15对防御的失效相关性全部为正(φ 0.30–0.75),乘法组合是永远达不到的下界;七层栈拒绝81%良性请求却与最强单层无统计差异——深度买了拒绝,没买安全。

2026年9月1日 · 1 分钟

每日论文精读 #021:从行为轨迹推断偏好,8B模型RL训练反超GPT-4.1

Behavior2Trip提出从用户历史行为轨迹隐式推断偏好的旅行规划新任务,RL训练的Qwen3-8B在个性化约束上大幅反超GPT-4.1

2026年8月31日 · 1 分钟

每日论文精读 #020:蚂蚁开源SingGuard-NSFA,Agent安全的双模式护栏

蚂蚁集团开源Agent安全护栏框架:NSFA风险分类法+双模式推理,0.8B小模型即可实时拦截Agent运行威胁,F1超Llama Guard 3达30个点。

2026年8月30日 · 1 分钟

每日论文精读 #019:对LLM施压真的有用吗?心理学影响策略在代码生成中的实证研究

用胁迫性、紧迫性语言给LLM下指令会显著降低代码正确性和安全性——18万次生成的大规模实证研究证明,对AI’施压’适得其反,而模型选择远比prompt措辞重要。

2026年8月29日 · 2 分钟

每日论文精读 #018:微调不撤销激活转向——权重编辑机制存续而行为可能回归

EMNLP 2026研究发现:嵌入式激活转向在SFT/RLHF微调后权重编辑几乎不被逆转(ρ=0.004),但行为可能通过替代通路回归,安全相关的拒绝抑制在SFT下平均损失64%效果。

2026年8月28日 · 1 分钟

每日论文精读 #017:ConvergeFlow——首个可证明收敛到token嵌入的流匹配语言模型

用凸组合结构化数据预测器让流轨迹可证明地落在合法token嵌入上,甩掉CE解码器后Gen. PPL反而从60降到33。

2026年8月27日 · 2 分钟

每日论文精读 #016:ARC-AGI-3从30%到95.5%,模型没换,换的是脚手架

Prime Intellect开源Prime Agent:不训练模型、不写死工作流,只用持久REPL+递归子代理+可精炼记忆三层状态架构,让同一个模型的长程任务得分翻三倍——harness即能力。

2026年8月26日 · 1 分钟

每日论文精读 #015:量化模型最该保住的不是准确率,而是「知道自己不知道」

港科大/牛津等提出 DPQ:量化会悄悄改变模型的置信度与弃答行为,校准数据应按部署目标定向选择——边界保持用高怀疑混合(r75),宽分布保持用温和配方。

2026年8月25日 · 2 分钟

每日论文精读 #014:AI 科研助手的下一步是把『你是谁』编码进研究全流程

Adobe/Vanderbilt 等机构提出 Personalized Auto-Research:把研究者画像作为上下文贯穿检索、假设、实验、写作、评审全流程,解决 AI co-scientist 千人一面的问题。

2026年8月24日 · 2 分钟

每日论文精读 #013:给AI Agent上锁:蚂蚁SingGuard-NSFA用185类风险分类+50ms分类头,Guardrail检测超最强对手12个点

蚂蚁安全实验室提出NSFA风险分类法(185类风险变体,对齐3份OWASP指南)+双模Guardrail:生成式推理做可解释离线审计,冻结骨干上的轻量分类头做到50ms实时检测,0.8B-9B全尺寸模型F1超最强竞品6-12个点。

2026年8月23日 · 1 分钟

每日论文精读 #012:用户动了你的代码,编码Agent还能干活吗?SWE-Touch用「反编辑」压力测试发现平均掉点7.7%

中科院团队提出SWE-Touch基准:在Agent修Bug过程中注入与任务冲突的用户代码编辑,9个主流模型平均解决率暴跌7.7个百分点,排名大幅洗牌——自主能力强的模型不等于能应对共享工作区的变化。

2026年8月22日 · 1 分钟

每日论文精读 #011:LoRA微调的7B开源小模型在急诊分诊上反超Claude,本地化医疗部署成为可能

系统对比8个开源SLM在急诊三大决策任务上的微调策略:LoRA微调的Mistral-7B分诊准确率反超Claude Sonnet 4.5,转诊推荐全面领先,仅诊断预测仍有差距——隐私合规驱动的本地化医疗AI正走向实用。

2026年8月21日 · 1 分钟

每日论文精读 #010:给知识图谱一个 ls/cat/grep——图推理智能体胜过全量塞上下文

七个通用工具的图推理智能体 GRA,在工业混合知识图谱上以不到三分之一的输入 token 胜过全量上下文基线 5.1 个百分点——赢在’选择性访问’而非图拓扑本身。

2026年8月20日 · 1 分钟

每日论文精读 #009:让 AI 输出自带“计算指纹”——计算溯源证明模型内耗状态可写入生成文本

Benjamin Belay 提出计算溯源(Computational Provenance)概念:经过验证的模型内部因果状态,可以决定生成文本中的统计信号,即使最终答案完全相同,检测器也能从文本措辞中恢复出模型实际走了哪条内部计算路径。

2026年8月19日 · 2 分钟