每日论文精读 #032:把论文『编译』成规格说明书再写代码——PaperCompiler让论文复现忠实度提升13.8%
NTU提出PaperCompiler,将论文证据编译为仓库级实现规格(含证据溯源、非降级约束、所有权图),在Paper2CodeBench上参考忠实度从3.64提升至4.15,高危缺陷率从13.2%降至6.1%。
NTU提出PaperCompiler,将论文证据编译为仓库级实现规格(含证据溯源、非降级约束、所有权图),在Paper2CodeBench上参考忠实度从3.64提升至4.15,高危缺陷率从13.2%降至6.1%。
NTU提出PaperCompiler:论文转代码的中间产物从自由格式的计划摘要改为显式的仓库级规约(需求规约+所有权图+文件契约),在Paper2CodeBench上参考保真度相对提升13.8%,高危缺陷率从13.2%降至6.1%。
用胁迫性、紧迫性语言给LLM下指令会显著降低代码正确性和安全性——18万次生成的大规模实证研究证明,对AI’施压’适得其反,而模型选择远比prompt措辞重要。