每日论文精读 #031:把论文『编译』成规格说明书再写代码——PaperCompiler让论文复现忠实度提升13.8%
NTU提出PaperCompiler,将论文证据编译为仓库级实现规格(含证据溯源、非降级约束、所有权图),在Paper2CodeBench上参考忠实度从3.64提升至4.15,高危缺陷率从13.2%降至6.1%。
NTU提出PaperCompiler,将论文证据编译为仓库级实现规格(含证据溯源、非降级约束、所有权图),在Paper2CodeBench上参考忠实度从3.64提升至4.15,高危缺陷率从13.2%降至6.1%。
字节Seed提出Vision-of-Thought,在VLM与扩散解码器之间插入离散视觉思维层,GenEval达0.91超越Mogao与FLUX。
ViSAR完全在ColPali/ColQwen2.5的嵌入空间内操作,构建查询条件化的页级相似度矩阵动态决定检索页数:平均只取4.7页(固定top-10、启发式方法取15-18页),端到端延迟最高降58.7%,精度还略有提升,且相似度矩阵稀疏度与答案对错正相关——一个免费的检索质量监控信号。
EMNLP 2026系统演示论文:固定环境单变量对照100个多文件重构任务,AST感知分块检索比朴素token窗口分块高25-30pp,精简检索单Agent(86%)完胜子Agent委派(66%),且检索带来的精度增益恰好抵消其token开销——单次成功成本不变。
仅重复一遍过程指令这一零成本黑盒干预,让7个模型的协议完整率从90.22%升至93.17%,但最终答案准确率纹丝不动——控制面与答案面的分离值得工程侧深思。
美团+北航提出Behavior2Trip基准与B2T-Agent:从用户历史行为轨迹推断偏好生成旅行计划,GPT-4.1最难任务全约束通过率仅0.5%,而GRPO强化学习训练的Qwen3-8B反超至4.7,还泛化赢下TravelPlanner。
IIT Jodhpur等提出IndicSafeEval:7,200条说服式越狱提示覆盖4种印度语言,实测5个开源模型攻击成功率最高81.7%;「权威背书」和「逻辑感召」平均越狱率超70%,且强制英文回复后ASR从68.9%升至82.2%——安全对齐的短板在多语言场景暴露无遗。
NTU提出PaperCompiler:论文转代码的中间产物从自由格式的计划摘要改为显式的仓库级规约(需求规约+所有权图+文件契约),在Paper2CodeBench上参考保真度相对提升13.8%,高危缺陷率从13.2%降至6.1%。
不配对数据、不从零训练,仅用LLM把元数据翻译成临床报告做对比对齐,就给呼吸音编码器装上零样本诊断能力
仓库级代码生成中,错误的代价并不均等:少数关键token一旦生成错误,整段代码就滑向错误语义路径。ACToR在生成时识别这些关键token并按需触发针对性检索,在CoderEval上相对提升15.4%。
KAIST提出Super Library Agent:Agent在依次生成多个应用时同步维护跨应用共享库,用自然语言摘要索引发现可复用组件、用调用图上下文保证迁移安全,冗余度降38%、补丁体积降73%。
防御栈本质是集成学习:15对防御的失效相关性全部为正(φ 0.30–0.75),乘法组合是永远达不到的下界;七层栈拒绝81%良性请求却与最强单层无统计差异——深度买了拒绝,没买安全。
Behavior2Trip提出从用户历史行为轨迹隐式推断偏好的旅行规划新任务,RL训练的Qwen3-8B在个性化约束上大幅反超GPT-4.1
蚂蚁集团开源Agent安全护栏框架:NSFA风险分类法+双模式推理,0.8B小模型即可实时拦截Agent运行威胁,F1超Llama Guard 3达30个点。
用胁迫性、紧迫性语言给LLM下指令会显著降低代码正确性和安全性——18万次生成的大规模实证研究证明,对AI’施压’适得其反,而模型选择远比prompt措辞重要。