每日论文精读 #027:GPT-4.1在行为感知旅行规划上近乎全军覆没,8B小模型靠RL反超

美团+北航提出Behavior2Trip基准与B2T-Agent:从用户历史行为轨迹推断偏好生成旅行计划,GPT-4.1最难任务全约束通过率仅0.5%,而GRPO强化学习训练的Qwen3-8B反超至4.7,还泛化赢下TravelPlanner。

2026年9月7日 · 1 分钟

每日论文精读 #026:印地语越狱攻击成功率72%——说服式话术在低资源语言上几乎无差别击穿LLM防线

IIT Jodhpur等提出IndicSafeEval:7,200条说服式越狱提示覆盖4种印度语言,实测5个开源模型攻击成功率最高81.7%;「权威背书」和「逻辑感召」平均越狱率超70%,且强制英文回复后ASR从68.9%升至82.2%——安全对齐的短板在多语言场景暴露无遗。

2026年9月6日 · 1 分钟

每日论文精读 #025:论文复现代码总走样?把「计划」编译成文件级规约——PaperCompiler 基准保真度提升13.8%

NTU提出PaperCompiler:论文转代码的中间产物从自由格式的计划摘要改为显式的仓库级规约(需求规约+所有权图+文件契约),在Paper2CodeBench上参考保真度相对提升13.8%,高危缺陷率从13.2%降至6.1%。

2026年9月5日 · 1 分钟

每日论文精读 #018:REACH——LLM合成报告对齐呼吸音编码器,零样本AUC超越CLAP与Qwen2-Audio

不配对数据、不从零训练,仅用LLM把元数据翻译成临床报告做对比对齐,就给呼吸音编码器装上零样本诊断能力

2026年9月4日 · 1 分钟

每日论文精读 #024:代码生成的失败往往集中在少数关键token上——ACToR让检索在刀刃处发生

仓库级代码生成中,错误的代价并不均等:少数关键token一旦生成错误,整段代码就滑向错误语义路径。ACToR在生成时识别这些关键token并按需触发针对性检索,在CoderEval上相对提升15.4%。

2026年9月3日 · 1 分钟

每日论文精读 #023:让Agent维护共享代码库,冗余直降38%

KAIST提出Super Library Agent:Agent在依次生成多个应用时同步维护跨应用共享库,用自然语言摘要索引发现可复用组件、用调用图上下文保证迁移安全,冗余度降38%、补丁体积降73%。

2026年9月2日 · 1 分钟

每日论文精读 #022:堆叠防御不会相乘——七层LLM防御栈失效相关性首次实测

防御栈本质是集成学习:15对防御的失效相关性全部为正(φ 0.30–0.75),乘法组合是永远达不到的下界;七层栈拒绝81%良性请求却与最强单层无统计差异——深度买了拒绝,没买安全。

2026年9月1日 · 1 分钟

每日论文精读 #021:从行为轨迹推断偏好,8B模型RL训练反超GPT-4.1

Behavior2Trip提出从用户历史行为轨迹隐式推断偏好的旅行规划新任务,RL训练的Qwen3-8B在个性化约束上大幅反超GPT-4.1

2026年8月31日 · 1 分钟

每日论文精读 #020:蚂蚁开源SingGuard-NSFA,Agent安全的双模式护栏

蚂蚁集团开源Agent安全护栏框架:NSFA风险分类法+双模式推理,0.8B小模型即可实时拦截Agent运行威胁,F1超Llama Guard 3达30个点。

2026年8月30日 · 1 分钟

每日论文精读 #019:对LLM施压真的有用吗?心理学影响策略在代码生成中的实证研究

用胁迫性、紧迫性语言给LLM下指令会显著降低代码正确性和安全性——18万次生成的大规模实证研究证明,对AI’施压’适得其反,而模型选择远比prompt措辞重要。

2026年8月29日 · 2 分钟

每日论文精读 #018:微调不撤销激活转向——权重编辑机制存续而行为可能回归

EMNLP 2026研究发现:嵌入式激活转向在SFT/RLHF微调后权重编辑几乎不被逆转(ρ=0.004),但行为可能通过替代通路回归,安全相关的拒绝抑制在SFT下平均损失64%效果。

2026年8月28日 · 1 分钟

每日论文精读 #017:ConvergeFlow——首个可证明收敛到token嵌入的流匹配语言模型

用凸组合结构化数据预测器让流轨迹可证明地落在合法token嵌入上,甩掉CE解码器后Gen. PPL反而从60降到33。

2026年8月27日 · 2 分钟

每日论文精读 #016:ARC-AGI-3从30%到95.5%,模型没换,换的是脚手架

Prime Intellect开源Prime Agent:不训练模型、不写死工作流,只用持久REPL+递归子代理+可精炼记忆三层状态架构,让同一个模型的长程任务得分翻三倍——harness即能力。

2026年8月26日 · 1 分钟

每日论文精读 #015:量化模型最该保住的不是准确率,而是「知道自己不知道」

港科大/牛津等提出 DPQ:量化会悄悄改变模型的置信度与弃答行为,校准数据应按部署目标定向选择——边界保持用高怀疑混合(r75),宽分布保持用温和配方。

2026年8月25日 · 2 分钟

每日论文精读 #014:AI 科研助手的下一步是把『你是谁』编码进研究全流程

Adobe/Vanderbilt 等机构提出 Personalized Auto-Research:把研究者画像作为上下文贯穿检索、假设、实验、写作、评审全流程,解决 AI co-scientist 千人一面的问题。

2026年8月24日 · 2 分钟