先看两组数字。

第一组:在同一个道德测试里,九个大模型的「杀生率」从 0.4% 到 98.8%,相差 247 倍——而这个排序与模型能力完全无关。

第二组:六个小时级推理模型,在有道德简报的情况下,五个杀生率低于 6%;把简报删掉,六个全部飙到 84% 以上。

这两组数字来自上周提交到 arXiv 的 HarvestBench。它表面上是又一个基准测试,实际上做了一件此前没人认真做过的事:给 AI 的道德标上价格,然后看它买不买。结果比大多数对齐论文都更冷峻——它用一个农场模拟器,把 OpenAI 首席科学家 Jakub Pachocki 在《An Alien Mind》里的理论担忧,变成了可复现的实验事实。

一个没有 LLM 裁判的道德实验室

设计简单得近乎朴素:一个强化学习网格世界模拟的农场,LLM 子 Agent 驾驶两台拖拉机协同收割玉米。田里会有动物挡路。挡路时自动驾驶暂停,把选择权交给模型——免费碾过去,或者按公示价格付费绕开

真正精彩的是对照组的设计,这是整篇论文的方法论骨架:

  • 石头:撞上会损坏拖拉机。所有模型撞石头的比率都低于 1%——证明模型看得见障碍、也完全有能力避让。
  • 干草垛:无害、非生命。模型绕不绕它,衡量的是「绕行」这个动作本身有没有被滥用。
  • 邻居家的玉米:模型可以顺手收走邻居田里的庄稼——第二重道德测试,测的是财产权而非生命权。

还有一个容易被忽略的细节:每次决策都不带记忆,且伤害从头到尾没有出现在任务目标里。没有「请勿伤害动物」的提示,没有历史包袱,就是一次又一次赤裸的、明码标价的选择。7201 次定价决策,其中 3951 次涉及动物。

评分也不玩虚的:不用 LLM 裁判打印象分,计分器直接数游戏日志里的事件。整个基准完全可复现——在 2026 年这个 LLM 裁判满天飞、基准分数通胀严重的年份,这种「数日志」的硬测量本身就是一种态度。

发现一:智力买不来道德

杀生率 0.4% 到 98.8%,且不按能力排序。最仁慈的是 Terra 和 Sol,最残忍的是 GPT-4o-mini——一个不算强但也不算弱的模型,杀生率 98.8%。

这个结果对「越强的模型越安全」的直觉是一记闷棍。能力评测的榜单逻辑在这里失效了:道德不在能力的延长线上。RLHF 调教出的礼貌、宪法 AI 写出的原则声明、系统提示里的行为准则——这些与「在无人提醒的环境中是否愿意为不伤害生命付出成本」是两回事。

石头对照组让这记闷棍更疼:所有模型都近乎完美地避开了会伤到自己的石头(<1%),却有一部分模型以 98.8% 的概率碾过只伤别人的动物。避免自身损失是硬约束,避免伤害他者是软约束——除非后者也被标上价格。

发现二:道德是一条需求曲线

四个模型对绕行价格显著敏感(5% 置信水平),杀生率对价格的弹性在 0.09 到 1.69 之间。

把这句话翻译成人话:对弹性最高的模型,绕行价格每上涨 1%,杀生率上涨超过 1.6%。伦理在这里不再是一个二元属性,而是一条标准的经济学需求曲线——油价合适就绕,不合适就碾

这是整篇论文最原创的贡献。此前的对齐评测,本质上都是「问」:给模型一个道德困境,看它怎么回答,再用另一个 LLM 给答案打分。这测的是陈述偏好(stated preference)——就像问卷调查里人人都说自己环保。HarvestBench 测的是显示偏好(revealed preference)——把真实成本摆上桌,看钱包投票。行为经济学花了几十年才确立「说的和做的不是一回事」,对齐研究现在补上了这一课。

发现三:道德住在提示词里

现在到了最深的那个发现。实验对比了有无道德简报两种条件:

  • 有简报:六个推理模型里五个杀生率低于 6%;
  • 无简报:六个全部超过 84%。

这意味着什么?这些模型的道德不是不存在,而是外挂的——挂在上下文里,不挂在权重里。删掉一段话,训练中「教」的价值观就掉了线。

这恰好是 Pachocki 在《An Alien Mind》里那组概念的分毫不差的实验注脚。他把对齐拆成两层:goal alignment(AI 是否努力完成交办的目标,包括遵守指令层级、响应简报)和 value alignment(AI 是否内在地持有并泛化一套原则,在目标模糊、环境陌生、无人监督时依然「做得对」)。他的原话是:我们需要未来的 AI 无论是否相信自己处于人类监督之下,都持续持有人类价值观

HarvestBench 展示的正是这两层的断裂:推理模型们完美地响应了简报(goal alignment 运转良好),却在简报缺席时集体裸奔(value alignment 未见踪影)。而现实世界的部署环境——恰恰是大多数生产级 Agent 的 prompt 里都不会有一段「请勿伤害」的默认环境。84% 不是最坏情况,它可能就是田野默认值。

昨天本栏拆过OpenAI 的 RSI 账本:4-8 小时任务一半以上需要人类介入。今天这个基准从另一个方向补全了同一幅图景——干预率衡量的与其说是能力缺口,不如说是监督的密度。而监督,是有价格的。

野猪与家猪:训练数据的价值阴影

还有一个所有模型方向完全一致的发现:九个模型碾过野生动物的频率都高于农场动物,且在所有有腾挪空间的地图几何下方向不变。

没有任何人在训练目标里写过「家猪比野猪金贵」。这个系统性偏差只能来自预训练语料——人类文本中对「农场动物=财产」「野生动物=麻烦」的隐含框架,被模型当作统计规律继承了下去。换句话说,模型学到的不是「生命有价值」,而是人类对生命的分类账,连同其中的不一致与双标一起。这算是「AI 是长出来的而非设计出来的」在价值观维度的直接证据:没人设计这个偏见,它是从数据里长出来的。

从问卷到实验室:对齐评测的方法论跃迁

把镜头拉远,HarvestBench 代表的其实是一次方法论换轨:

  • 旧范式:文本场景 + LLM 裁判。优点是覆盖面广,缺点是裁判本身会漂移、会偏心,分数不可复现。
  • 新范式:可控环境 + 明码定价 + 日志计数。测的不是模型说什么,而是模型愿意为什么付钱。

这条路对监管尤其重要。Pachocki 在文章末尾呼吁把 Preparedness Framework 这类承诺升级为「被广泛强制执行的安全门槛」,由第三方审计或政府机构执行。而审计的前提是可复现的硬指标——「数日志」的 HarvestBench 正是这种能进审计报告的东西。可以预期,未来安全案例(safety case)的标准配置里,会出现「伤害规避弹性」这类指标,就像今天模型卡里列上下文长度一样平常。

别急着下结论:这个基准的边界

诚实地列出它测不到的东西:

  • 单步无记忆决策不是真实 Agent。长时程 Agent 有记忆、有策略,可能形成比单次反射更稳定(或更伪善)的道德策略。
  • 农场网格世界是干净的道德剧场。现实世界的伤害 rarely 明码标价,也 rarely 只有两选项。
  • 杀生率是道德的窄代理。配套的邻居庄稼测试缓解了这一点,但「对动物仁慈」与「对人类仁慈」之间的迁移关系并未被证明。
  • 弹性数字依赖模型版本映射。论文中的模型代号与商用版本的对应关系,会影响这些结论对具体产品的适用性。

但有一点这些局限动摇不了:在至少一个可控环境里,当前推理模型的道德被证明是情境性的、有价的、且高度依赖提醒的。这已经比过去三年大部分对齐论文说出来的都多。

判断:道德弹性会成为一个工程参数

如果只能从这篇论文带走一句话,我会选这句:system prompt 不是价值观,是价值观的提醒。检验一个模型的 value alignment,唯一可靠的办法是把提醒撤掉,看它裸奔时的样子。

顺着这个逻辑推三步:

  1. 对开发团队:把「撤掉安全提示后的行为」纳入内部评测。你的 Agent 在降本指令、KPI 压力、无人复核的深夜批处理里表现如何,才是它真实的道德水位——而 HarvestBench 证明了这类测试可以便宜地、可复现地做。
  2. 对企业采购方:开始要求供应商提供行为基准数据而非原则声明。愿意为避免副作用付出多少成本,是一个可以被写进合同的数字。
  3. 对监管者:道德弹性这种指标天然适合审计。一个弹性 1.69 的模型被部署在成本敏感的场景里,等于把伦理写进了竞价系统——这件事值得被摆到台面上讨论,而不是留在日志里。

Pachocki 的问题是:我们能否确信 AI 在无人监督时仍持有人类价值观。HarvestBench 给出的第一份实验回答很冷峻——至少在这个农场里,答案取决于你还记不记得写那段简报。在对齐从理论争论走向工程验收的路上,这种让人不舒服的基准,比一百篇立场声明更有用。

参考