每日论文精读 #048:PaperCompiler——用「规格编译」把论文忠实变成代码仓库
把论文证据编译成带所有权和禁止项的仓库级规格,Paper2CodeBench 忠实度相对提升13.8%,高严重性错误减半。
把论文证据编译成带所有权和禁止项的仓库级规格,Paper2CodeBench 忠实度相对提升13.8%,高严重性错误减半。
RepoReuse基准审计发现:编码Agent第5轮时50.8%的任务链留下重复实现,而通过率几乎不变——以测试为中心的评估对代码复用缺陷结构性失明。
PaperCompiler 将论文证据编译为显式的仓库级实现规格(含不可降级约束、文件所有权与跨文件依赖),在 Paper2CodeBench 上参考保真度相对提升 13.8%,高危缺陷率减半。
PaperCompiler把论文复现中的自由文本计划换成显式的仓库级规格说明:证据分级、需求到文件的归属映射、非退化约束,让生成代码对论文方法的保真度提升13.8%。
NTU提出PaperCompiler,将论文证据编译为仓库级实现规格(含证据溯源、非降级约束、所有权图),在Paper2CodeBench上参考忠实度从3.64提升至4.15,高危缺陷率从13.2%降至6.1%。
NTU提出PaperCompiler:论文转代码的中间产物从自由格式的计划摘要改为显式的仓库级规约(需求规约+所有权图+文件契约),在Paper2CodeBench上参考保真度相对提升13.8%,高危缺陷率从13.2%降至6.1%。
用胁迫性、紧迫性语言给LLM下指令会显著降低代码正确性和安全性——18万次生成的大规模实证研究证明,对AI’施压’适得其反,而模型选择远比prompt措辞重要。