每日论文精读 #028:把指令复制两遍,模型输出结构就变了——答案却不变仅重复一遍过程指令这一零成本黑盒干预,让7个模型的协议完整率从90.22%升至93.17%,但最终答案准确率纹丝不动——控制面与答案面的分离值得工程侧深思。
每日论文精读 #015:量化模型最该保住的不是准确率,而是「知道自己不知道」港科大/牛津等提出 DPQ:量化会悄悄改变模型的置信度与弃答行为,校准数据应按部署目标定向选择——边界保持用高怀疑混合(r75),宽分布保持用温和配方。