每日论文精读 #048:PaperCompiler——用「规格编译」把论文忠实变成代码仓库

把论文证据编译成带所有权和禁止项的仓库级规格,Paper2CodeBench 忠实度相对提升13.8%,高严重性错误减半。

2026年10月3日 · 1 分钟

每日论文精读 #046:编码Agent通过率不降,代码却在悄悄变成面条

RepoReuse基准审计发现:编码Agent第5轮时50.8%的任务链留下重复实现,而通过率几乎不变——以测试为中心的评估对代码复用缺陷结构性失明。

2026年9月30日 · 1 分钟

每日论文精读 #042:PaperCompiler——把论文编译成规格说明,让AI生成的代码不再偷工减料

PaperCompiler 将论文证据编译为显式的仓库级实现规格(含不可降级约束、文件所有权与跨文件依赖),在 Paper2CodeBench 上参考保真度相对提升 13.8%,高危缺陷率减半。

2026年9月26日 · 1 分钟

每日论文精读 #039:别让中间计划丢细节——PaperCompiler把论文证据编译成仓库级规格说明

PaperCompiler把论文复现中的自由文本计划换成显式的仓库级规格说明:证据分级、需求到文件的归属映射、非退化约束,让生成代码对论文方法的保真度提升13.8%。

2026年9月19日 · 1 分钟

每日论文精读 #032:把论文『编译』成规格说明书再写代码——PaperCompiler让论文复现忠实度提升13.8%

NTU提出PaperCompiler,将论文证据编译为仓库级实现规格(含证据溯源、非降级约束、所有权图),在Paper2CodeBench上参考忠实度从3.64提升至4.15,高危缺陷率从13.2%降至6.1%。

2026年9月12日 · 1 分钟

每日论文精读 #025:论文复现代码总走样?把「计划」编译成文件级规约——PaperCompiler 基准保真度提升13.8%

NTU提出PaperCompiler:论文转代码的中间产物从自由格式的计划摘要改为显式的仓库级规约(需求规约+所有权图+文件契约),在Paper2CodeBench上参考保真度相对提升13.8%,高危缺陷率从13.2%降至6.1%。

2026年9月5日 · 1 分钟

每日论文精读 #019:对LLM施压真的有用吗?心理学影响策略在代码生成中的实证研究

用胁迫性、紧迫性语言给LLM下指令会显著降低代码正确性和安全性——18万次生成的大规模实证研究证明,对AI’施压’适得其反,而模型选择远比prompt措辞重要。

2026年8月29日 · 2 分钟