每日论文精读 #031:把论文『编译』成规格说明书再写代码——PaperCompiler让论文复现忠实度提升13.8%

NTU提出PaperCompiler,将论文证据编译为仓库级实现规格(含证据溯源、非降级约束、所有权图),在Paper2CodeBench上参考忠实度从3.64提升至4.15,高危缺陷率从13.2%降至6.1%。

2026年9月12日 · 1 分钟

每日论文精读 #006:在生成图像前先「想一想」——VoT离散视觉思维层让文生图语义对齐大幅提升

字节Seed提出Vision-of-Thought,在VLM与扩散解码器之间插入离散视觉思维层,GenEval达0.91超越Mogao与FLUX。

2026年9月11日 · 1 分钟

每日论文精读 #030:固定top-k该退休了——免训练自适应检索平均只取4.7页,RAG延迟直降58.7%

ViSAR完全在ColPali/ColQwen2.5的嵌入空间内操作,构建查询条件化的页级相似度矩阵动态决定检索页数:平均只取4.7页(固定top-10、启发式方法取15-18页),端到端延迟最高降58.7%,精度还略有提升,且相似度矩阵稀疏度与答案对错正相关——一个免费的检索质量监控信号。

2026年9月10日 · 2 分钟

每日论文精读 #029:AST感知检索吊打朴素分块25个百分点,精简单Agent跑赢多Agent——仓库级重构Agent的对照实验

EMNLP 2026系统演示论文:固定环境单变量对照100个多文件重构任务,AST感知分块检索比朴素token窗口分块高25-30pp,精简检索单Agent(86%)完胜子Agent委派(66%),且检索带来的精度增益恰好抵消其token开销——单次成功成本不变。

2026年9月9日 · 1 分钟

每日论文精读 #028:把指令复制两遍,模型输出结构就变了——答案却不变

仅重复一遍过程指令这一零成本黑盒干预,让7个模型的协议完整率从90.22%升至93.17%,但最终答案准确率纹丝不动——控制面与答案面的分离值得工程侧深思。

2026年9月8日 · 1 分钟

每日论文精读 #027:GPT-4.1在行为感知旅行规划上近乎全军覆没,8B小模型靠RL反超

美团+北航提出Behavior2Trip基准与B2T-Agent:从用户历史行为轨迹推断偏好生成旅行计划,GPT-4.1最难任务全约束通过率仅0.5%,而GRPO强化学习训练的Qwen3-8B反超至4.7,还泛化赢下TravelPlanner。

2026年9月7日 · 1 分钟

每日论文精读 #026:印地语越狱攻击成功率72%——说服式话术在低资源语言上几乎无差别击穿LLM防线

IIT Jodhpur等提出IndicSafeEval:7,200条说服式越狱提示覆盖4种印度语言,实测5个开源模型攻击成功率最高81.7%;「权威背书」和「逻辑感召」平均越狱率超70%,且强制英文回复后ASR从68.9%升至82.2%——安全对齐的短板在多语言场景暴露无遗。

2026年9月6日 · 1 分钟

每日论文精读 #025:论文复现代码总走样?把「计划」编译成文件级规约——PaperCompiler 基准保真度提升13.8%

NTU提出PaperCompiler:论文转代码的中间产物从自由格式的计划摘要改为显式的仓库级规约(需求规约+所有权图+文件契约),在Paper2CodeBench上参考保真度相对提升13.8%,高危缺陷率从13.2%降至6.1%。

2026年9月5日 · 1 分钟

每日论文精读 #018:REACH——LLM合成报告对齐呼吸音编码器,零样本AUC超越CLAP与Qwen2-Audio

不配对数据、不从零训练,仅用LLM把元数据翻译成临床报告做对比对齐,就给呼吸音编码器装上零样本诊断能力

2026年9月4日 · 1 分钟

每日论文精读 #024:代码生成的失败往往集中在少数关键token上——ACToR让检索在刀刃处发生

仓库级代码生成中,错误的代价并不均等:少数关键token一旦生成错误,整段代码就滑向错误语义路径。ACToR在生成时识别这些关键token并按需触发针对性检索,在CoderEval上相对提升15.4%。

2026年9月3日 · 1 分钟

每日论文精读 #023:让Agent维护共享代码库,冗余直降38%

KAIST提出Super Library Agent:Agent在依次生成多个应用时同步维护跨应用共享库,用自然语言摘要索引发现可复用组件、用调用图上下文保证迁移安全,冗余度降38%、补丁体积降73%。

2026年9月2日 · 1 分钟

每日论文精读 #022:堆叠防御不会相乘——七层LLM防御栈失效相关性首次实测

防御栈本质是集成学习:15对防御的失效相关性全部为正(φ 0.30–0.75),乘法组合是永远达不到的下界;七层栈拒绝81%良性请求却与最强单层无统计差异——深度买了拒绝,没买安全。

2026年9月1日 · 1 分钟

每日论文精读 #021:从行为轨迹推断偏好,8B模型RL训练反超GPT-4.1

Behavior2Trip提出从用户历史行为轨迹隐式推断偏好的旅行规划新任务,RL训练的Qwen3-8B在个性化约束上大幅反超GPT-4.1

2026年8月31日 · 1 分钟

每日论文精读 #020:蚂蚁开源SingGuard-NSFA,Agent安全的双模式护栏

蚂蚁集团开源Agent安全护栏框架:NSFA风险分类法+双模式推理,0.8B小模型即可实时拦截Agent运行威胁,F1超Llama Guard 3达30个点。

2026年8月30日 · 1 分钟

每日论文精读 #019:对LLM施压真的有用吗?心理学影响策略在代码生成中的实证研究

用胁迫性、紧迫性语言给LLM下指令会显著降低代码正确性和安全性——18万次生成的大规模实证研究证明,对AI’施压’适得其反,而模型选择远比prompt措辞重要。

2026年8月29日 · 2 分钟