每日论文精读 #018:微调不撤销激活转向——权重编辑机制存续而行为可能回归

EMNLP 2026研究发现:嵌入式激活转向在SFT/RLHF微调后权重编辑几乎不被逆转(ρ=0.004),但行为可能通过替代通路回归,安全相关的拒绝抑制在SFT下平均损失64%效果。

2026年8月28日 · 1 分钟

每日论文精读 #017:ConvergeFlow——首个可证明收敛到token嵌入的流匹配语言模型

用凸组合结构化数据预测器让流轨迹可证明地落在合法token嵌入上,甩掉CE解码器后Gen. PPL反而从60降到33。

2026年8月27日 · 2 分钟

每日论文精读 #016:ARC-AGI-3从30%到95.5%,模型没换,换的是脚手架

Prime Intellect开源Prime Agent:不训练模型、不写死工作流,只用持久REPL+递归子代理+可精炼记忆三层状态架构,让同一个模型的长程任务得分翻三倍——harness即能力。

2026年8月26日 · 1 分钟

每日论文精读 #015:量化模型最该保住的不是准确率,而是「知道自己不知道」

港科大/牛津等提出 DPQ:量化会悄悄改变模型的置信度与弃答行为,校准数据应按部署目标定向选择——边界保持用高怀疑混合(r75),宽分布保持用温和配方。

2026年8月25日 · 2 分钟

每日论文精读 #014:AI 科研助手的下一步是把『你是谁』编码进研究全流程

Adobe/Vanderbilt 等机构提出 Personalized Auto-Research:把研究者画像作为上下文贯穿检索、假设、实验、写作、评审全流程,解决 AI co-scientist 千人一面的问题。

2026年8月24日 · 2 分钟

每日论文精读 #013:给AI Agent上锁:蚂蚁SingGuard-NSFA用185类风险分类+50ms分类头,Guardrail检测超最强对手12个点

蚂蚁安全实验室提出NSFA风险分类法(185类风险变体,对齐3份OWASP指南)+双模Guardrail:生成式推理做可解释离线审计,冻结骨干上的轻量分类头做到50ms实时检测,0.8B-9B全尺寸模型F1超最强竞品6-12个点。

2026年8月23日 · 1 分钟

每日论文精读 #012:用户动了你的代码,编码Agent还能干活吗?SWE-Touch用「反编辑」压力测试发现平均掉点7.7%

中科院团队提出SWE-Touch基准:在Agent修Bug过程中注入与任务冲突的用户代码编辑,9个主流模型平均解决率暴跌7.7个百分点,排名大幅洗牌——自主能力强的模型不等于能应对共享工作区的变化。

2026年8月22日 · 1 分钟

每日论文精读 #011:LoRA微调的7B开源小模型在急诊分诊上反超Claude,本地化医疗部署成为可能

系统对比8个开源SLM在急诊三大决策任务上的微调策略:LoRA微调的Mistral-7B分诊准确率反超Claude Sonnet 4.5,转诊推荐全面领先,仅诊断预测仍有差距——隐私合规驱动的本地化医疗AI正走向实用。

2026年8月21日 · 1 分钟

每日论文精读 #010:给知识图谱一个 ls/cat/grep——图推理智能体胜过全量塞上下文

七个通用工具的图推理智能体 GRA,在工业混合知识图谱上以不到三分之一的输入 token 胜过全量上下文基线 5.1 个百分点——赢在’选择性访问’而非图拓扑本身。

2026年8月20日 · 1 分钟

每日论文精读 #009:让 AI 输出自带“计算指纹”——计算溯源证明模型内耗状态可写入生成文本

Benjamin Belay 提出计算溯源(Computational Provenance)概念:经过验证的模型内部因果状态,可以决定生成文本中的统计信号,即使最终答案完全相同,检测器也能从文本措辞中恢复出模型实际走了哪条内部计算路径。

2026年8月19日 · 2 分钟

每日论文精读 #008:CForce 让扩散语言模型敢于“抢跑”——早期预测对齐后期修正,并行解码吞吐提升 31%

上海交大 & 蚂蚁集团提出 Consistency Forcing,用模型自身解码轨迹做自蒸馏,让 dLLM 早期低上下文预测对齐后期高置信预测,TPF 从 6.94 提到 9.08 且质量不降。

2026年8月18日 · 2 分钟

每日论文精读 #007:Agent的记忆会进化还不够,检索策略也要能进化

ERSkill把记忆检索行为建模成可执行的技能程序,用经验前缀树+双前沿机制让技能集与路由器共同进化,三个记忆基准上平均分超最强基线28-31%,且跨数据集直接迁移有效

2026年8月17日 · 1 分钟

每日论文精读 #006:给AI Agent上护栏——冻结骨干+轻量分类头,50ms拦截185种攻击

SingGuard-NSFA用CIA三元组构建185类Agent安全风险分类体系,生成式推理离线审计+判别式分类头在线拦截双模式,9B模型超最强竞品6-12个F1点,50ms完成实时检测

2026年8月16日 · 1 分钟

每日论文精读 #005:AI科学家的工作流已经完整,缺的是直接看数据的能力

现有AI科学家只消费人工预处理后的文本和特征,属于’工作流完整、证据不完整’。OmniScientist让多模态感知贯穿研究全生命周期,正面对比85%获胜,还自动发现地震基准里21.7%的’噪声’标注实为真实信号

2026年8月15日 · 1 分钟

每日论文精读 #004:RLHF的偏好平均化正在制造系统性不公

标准RLHF将不同用户群体的偏好平均化为单一奖励模型,多数群体主导学习而少数群体被系统性忽视,PA-RLHF通过分离偏好模式将公平差距从15.9pp降至9.6pp

2026年8月14日 · 1 分钟