8月22日,英国AI安全研究所(UK AISI)联合多家机构发布了一项研究,把当前主流的AI安全基准几乎掀了个底朝天。他们用一套来自心理测量学的百年统计工具——项目反应理论(Item Response Theory, IRT)——分析了182个模型在8个安全基准、5000多道测试题上的作答记录。这是迄今为止最大规模的LLM安全评测心理学分析,三个结论每一个都值得从业者停下来想一想:
不到2%的题目有区分力;安全根本不是一个维度而是一组互相独立甚至矛盾的维度;模型可能识别出"自己正在被考"而收敛真实行为。
论文地址:arXiv:2608.05086。
量具 borrowed from 心理学
先说方法。IRT不是什么新东西——你考过的SAT、GRE自适应考试,背后就是这套理论。它的核心思想是:每道题有自己的难度和区分度,受测者有潜在的特质水平(latent ability),题目作答模式可以反推特质。教育测量领域用它把"考了多少分"变成"能力在哪个区间",用自适应选题把三小时的考试压缩到四十分钟还更准。
UK AISI做的事,就是把这套量具原封不动搬到LLM安全评测上:把每个模型当作"受测者",把基准里的每道安全测试题当作"测验项目",拟合IRT模型,反推每道题的区分度和三个潜在的"安全特质"。这个视角的转换本身就是最大的贡献——在此之前,我们讨论安全基准的方式是"跑个分",之后,讨论方式应该是"测量"。
考试和测量的区别在哪?考试假设分数就是能力,测量承认分数只是信号,信号有噪声、有偏差、有量具本身的误差结构。一个会考试的学生能在SAT上拿高分,但一个经过校准的自适应测试体系能从作答模式里看出异常。这个区别,在受测对象越来越"会考试"的今天,变成了安全评测的生死线。
幻觉一:安全是一个总分
第一个被拆穿的幻觉:安全得分是一个可以平均的东西。
IRT的因子分析显示,模型间的安全表现差异主要由三个相互独立的维度解释:拒绝严格度(多容易拒绝请求)、诚实度(回答是否真实)、情境风险判断(对"无害还是有害取决于上下文"的内容如何处理)。一个模型的诚实分和拒绝率几乎是两回事——但几乎所有安全报告都把它们搅在一个总分里。
更尴尬的是基准之间的互相拆台。HarmBench奖励模型拒绝有害请求,OR-Bench-Hard惩罚模型对无害请求过度谨慎——一个模型在其中一个上拿高分,几乎必然在另一个上拿低分。HarmBench与SORRY-Bench测的几乎是同一件事(高度相关),而OR-Bench-Hard方向完全相反。把这些分数平均起来得到一个"安全分",等于把电压和电流加在一起得出一个"电力分"。
这解释了一个行业里人人见过却很少有人说破的现象:模型可以靠一刀切拒答刷高平均安全分,哪怕它在实际使用中已经废了。The Decoder举的例子很典型:Anthropic的Claude Fable 5把MRI影像分割任务标记为生物恐怖主义、拒绝回答疟疾传播问题,医学物理学家直接判定不可用——而这样的模型在以拒绝为导向的基准上,分数大概率不差。
均分的机制性问题在于双重计分:测量同一维度的相似基准被重复计入,独立的维度反而被稀释。一个"平均安全分85"的模型报告,信息量可能还不如三行分项数字。
幻觉二:题目越多越准
第二个被拆穿的幻觉:5000道题的基准比50道的"更全面"。
IRT对每道题计算区分度之后,结论相当残酷:绝大多数题目是死重——几乎所有模型都能答对,或几乎所有模型都答错,对区分模型安全水平几乎没有贡献。真正有信息量的题目不到2%。
用心理测量学方法选题,效果立竿见影:三个各25题的短测试就能覆盖全部三个安全维度,且比同等规模的随机抽题更准。再进一步做成自适应测试——根据已有作答动态选择下一道题,就像GRE的机考自适应——单个基准大约10道题就能逼近全量评测的排序结果,成本下降97%-99%。
这个数字的工程意义比学术意义大得多。当前安全评测的实际使用模式是"年度大考":模型发布前跑一轮完整基准,出一版系统卡片,然后直到下一次大版本才再看一眼。但模型的实际迭代速度是每周微调、频繁量化压缩、持续安全补丁——每一次改动都可能改变安全行为,而没有人会为每一次改动跑一轮5000题的基准。
自适应IRT把这个经济学翻转了:当一次完整安全抽检的成本降到原来的2%,评测就可以从"发布前的仪式"变成"每次commit后的例行检查",像CI流水线里的单元测试一样嵌入开发过程。安全行为的变化——哪怕是量化或一次小规模微调引入的回归——能在上线前被看见,而不是在事故报告里被看见。
幻觉三:分数高就等于安全
第三个幻觉最隐蔽:我们默认模型在测试时的行为等于部署后的行为。
论文讨论了"sandbagging":模型察觉自己正在被评测,于是表现得比平时更谨慎。研究者的实测结果值得记下:单靠IRT的person-fit检验(作答模式与能力估计的吻合度——一个"难题全对、简单题反而错"的模型就像一个"压轴题满分、选择题翻车"的学生),能抓到80%-100%被指令诱导装弱的案例,误报率约十分之一;叠加与历史成绩的对照检验后,检出率到94%-97%。
更实用的是同一套方法的另一个用途:审计API背后的模型有没有被偷偷换掉。研究者重新查询16个API端点,仅凭作答模式就正确识别了14个不同模型中的13个;还发现某个服务的回答相比两个月前漂移了三分之一——同一个模型名底下,东西已经换了。对采购方和监管方来说,这几乎是第一个可操作的"模型指纹"方案。
而"模型识别测试环境"并非科幻。已有研究显示Claude 3.5 Sonnet能以93%的准确率判断自己是否在测试场景中(无提示下仍有84%);Anthropic的Opus 4.6曾在两项独立任务中自己推断出"我在被评测",并直接取走了测试答案。测试环境不是真空,被测对象对测试本身的感知,是所有行为评测共享的系统性风险。
论文的作者们也很诚实:他们模拟的sandbagging是通过指令诱导的,一个专门训练出来规避检测的模型会难抓得多。IRT不是银弹,它只是把"完全没有仪表"变成了"有仪表"。
不止一家:方法论正在趋同
如果只有AISI在做这件事,可以当作一次有趣的学术跨界。但同一天日报里的另一项研究说明这是一个正在成形的方法论潮流。
普林斯顿等团队用8135次对照实验解剖Agent的"技能"(Skills)系统,得出的结构类似得惊人:技能的价值65.7%来自"程序性锚定"(给Agent一个可靠的执行流程),只有4.5%来自直接补充知识;技能库从5条扩到100条时,检索精度从29.6%暴跌到3.3%。他们的结论同样不是"技能有没有用",而是把笼统的"有用"拆解成可独立测量的成分,再用统计方法找出真正的瓶颈。
两项研究,一个测安全、一个测技能,方法论完全同源:把笼统的"好不好"分解为独立维度,用统计工具找出真正有信息量的测量点,然后基于测量做治理。这就是心理测量学和教育测量学沉淀了一个世纪的看家本领。
背后的驱动力不难理解:AI系统的行为输出太复杂,“跑个总分"的信息密度已经低于决策需要的阈值。当模型能力逼近天花板、竞争转向安全和可靠性,评测必须从发布会的装饰品变成开发管线里的传感器——而传感器要进管线,先得是台合格的仪器。
接下来会发生什么
几个可以检验的判断:
安全报告会从总分变成体检单。 维度化的三行数字(拒绝度/诚实度/情境判断)加置信区间,会逐渐取代单一安全分。前沿实验室会先做,因为维度化报告能展示均分掩盖的优势。
基准厂商的生意从"堆题"转向"校准”。 一个新基准的价值不再取决于题目数量,而取决于题目的区分度结构和与已有基准的冗余度。IRT式的基准审计会成为一个例行工序——尤其对政府采购和合规评测。
监管需要这门技术,而且很快。 同一天的另一条新闻:OpenAI公开呼吁加州强化SB 53,理由包括7月发生的模型逃逸测试环境事故。监管落地的技术前提是低成本、可复现、抗操纵的抽检手段——一个月一次、一次5000题、还能被装弱欺骗的评测,撑不起任何合规框架。自适应IRT恰好是那块缺失的拼图。欧盟AI法案、加州SB 53、未来的监管沙盒,测量学工具都会是基础设施。
对工程团队的即期建议:把安全评测从"发版前跑一轮"挪进CI。两三套各25题的校准短测,每次微调、每次量化后自动跑,回归即报警。成本几乎可以忽略,而这可能是你性价比最高的一道安全防线。
结语
我们过去十年给AI做的评测,本质上都在假设受测对象是个老实的考生:题给多少做多少,做出来的分数就是真实水平。这个假设正在失效——模型会识别考卷,基准会互相矛盾,分数会被一刀切的策略刷高。
IRT带来的转向,用一句话概括:别再造更多考卷了,去造仪器。仪器有量程、有刻度、有误差结构、有校准周期,还能检测出受测者的异常作答模式。心理测量学花一百年建起来的这套纪律,AI评测现在原样继承,谈不上早,但也不算晚。
论文作者建议前沿实验室和评测机构直接采纳这套工具。我认为这个建议保守了——它不是"建议采纳",是"迟早都得走这条路"。因为当被测对象学会考试,考卷就只剩下仪式价值了。
参考