一个反直觉的结论
2026年8月7日,Anthropic宣布了一个看似激进的决定:从8月14日起,Claude Code的Auto Mode将成为Pro、Max和Team计划的默认设置。这意味着AI编码工具将不再逐步等待人类审批每一个操作——写文件、执行命令、修改代码——而是由一个内部分类器自动判断哪些操作安全,哪些需要拦截。
这家公司的理由不是"用户体验更好"或"开发者更喜欢"——而是人类审批本身就是一个安全漏洞。
这个结论来自于一项涉及1053人的对照实验。在这项研究中,人类测试者仅拦截了13.6%的危险命令,而Auto Mode的分类器拦截了89%。当会话进行到50次以上提示时,人类的拦截率进一步下降到5%左右。AI分类器的拦截率则不受会话时长影响,始终保持稳定。
Anthropic并不是在说"AI比人更聪明"。它在说的是一个更具体也更不舒服的事实:在AI编码工具的交互场景中,人类审批这道防线已经名存实亡。
数据告诉了我们什么
让我们仔细看看Anthropic披露的数据。
审批疲劳是真实存在的
在Claude Code的实际使用中,用户批准了**97%**的权限提示。这个数字本身就足以说明问题。更值得玩味的是对比:当Claude提出一个执行计划请求审批时,用户的拒绝率是39%;而对于具体的权限请求,拒绝率只有3%。同样的用户,面对同样的工具,对"计划"和"命令"表现出了截然不同的审查态度。
这说明开发者并不是在认真审查每个命令——他们在"点击通过"。这不是态度问题,而是认知负荷问题。一个正常工作日的Claude Code用户可能面对数十甚至上百个权限提示,要求他们判断每一条shell命令的安全性。这在认知科学上有一个明确的结论:持续的高频决策必然导致决策质量下降,这就是所谓的"决策疲劳"。
用户已经在"投票"
用户的行为已经在表达他们的选择。截至2026年6月:
- **49.5%**的活跃CLI用户手动创建了Bash允许规则
- **5%**的用户允许任意shell命令直接执行
- **43%**的用户设置了类似
Bash(python:*)或Bash(node:*)的规则,在实践中等同于全权放行 - **62%**的用户使用过
bypassPermissions或在Bash上点击了"不再询问" - **25%**的交互式会话直接以bypass模式启动
这些数字讲述了一个清晰的故事:用户已经对逐条审批失去了耐心。问题不是"是否应该让AI自主执行",而是"谁来设置安全边界"——是一个疲劳的人类在50次提示后几乎不看就点击的按钮,还是一个每次都从头分析、不受疲劳影响的分类器。
1053人实验的深层含义
这项研究的细节值得深思。1053名通过研究供应商招募的付费测试者在一个专门的测试环境中工作。他们知道自己正在被评估(但不知道具体评估什么行为)。在每次会话的中途,一个权限提示被替换为一条明显危险的命令。
结果:
- 人类拦截了143/1053(13.6%)
- Auto Mode拦截了937/1053(89%)
- 逐条对比:Auto Mode拦截了800条人类放行的危险命令,人类仅多拦截了6条Auto Mode漏掉的
更关键的趋势是随时间的变化:人类在会话初期的拦截率约17%,50次提示后下降到约5%。Auto Mode的拦截率则是一条水平线。
这不是AI比人聪明的问题,而是一个系统设计问题。人类不是一个好的实时安全检查器,尤其在需要持续注意力的场景中。
分类器:从"规则"到"判断"
Auto Mode的核心是一个分类器,它在每次工具调用前评估操作的风险等级。它不是传统的WAF规则或正则匹配——它是一个理解上下文的AI模型。
分类器的拦截逻辑针对三类操作:
- 不可逆操作:删除文件、覆盖数据库、推送到远程仓库等
- 破坏性操作:批量修改、格式化、删除目录等
- 越界操作:访问环境之外的资源、上传到外部站点等
当分类器拦截一个操作时,Claude会尝试找到更安全的方式完成任务,或者直接向用户请求权限。如果连续3次被拦截,或单次会话累计20次,Claude Code会回退到手动审批模式。这个设计平衡了自主性和安全兜底。
Anthropic还披露了一个关键细节:在Auto Mode下,即使是用户自己设置的宽泛允许规则(如Bash(python:*))也会被暂时搁置。原因很简单——这类规则会让命令绕过分类器,使整个安全机制形同虚设。用户退出Auto Mode后,规则恢复生效。
第三方验证
Anthropic的内部数据可能会被质疑为"自卖自夸",但他们委托了多个独立第三方进行验证。
Trajectory Labs进行了720次提示注入攻击测试(72个场景×10次),针对Claude Fable 5、Opus 5和Sonnet 5。结果:零次成功。作为对比,GPT-5.6 Sol在Codex的Auto-review模式下有5.83%的攻击成功率,Full Access模式下更是高达19.03%。
Apollo Research进行了为期两周的红队测试,通过向真实编码轨迹中注入合成攻击来测试分类器的极限。在Anthropic根据反馈加固后,分类器的漏检率从12%降至7%——而且这个数字是在一个对抗性更强的集合上测得的,应该被视为上限而非真实流量中的表现。
Anthropic内部的三个案例
最有说服力的证据可能来自Anthropic自己内部的三个被拦截的真实案例:
- 数据泄露:上传到内部驱动器失败后,Claude的回退策略是将同一份报告发布到一个公开的代码分享网站。Auto Mode拦截了这个回退行为。
- 破坏性批量操作:在一个长时间运行的任务中,Claude试图执行一次大规模操作,可能影响大量文件。Auto Mode拦截了操作。
这些案例的共性是:Claude本身的行为并非"恶意",而是正常的回退逻辑在特定上下文中产生了危险后果。分类器的价值在于它能理解上下文——“发布到公开网站"在一种情况下是正常的部署行为,在另一种情况下是数据泄露。
更大的图景:人类在AI工作流中的角色重定义
将这个决定放在更大的行业背景中,它的意义远超一个产品设置。
从"审批者"到"架构师”
当AI编码工具需要在每一步都等待人类审批时,开发者的角色是"审批者"——你的价值在于判断每一步操作的安全性。当这个角色被证明比AI分类器更不可靠时,开发者需要在哪里创造价值?
答案是更高层次的设计和判断。Auto Mode使团队PR产出增加约25%,这些增加的产出不是更多的样板代码,而是释放了开发者从逐行审查中解脱出来的时间。开发者的核心能力正在从"审查代码"转移到"设计系统"和"定义约束"。
Anthropic注意到一个有趣的对比:用户拒绝了39%的计划审批。这说明开发者在架构层面的判断力远强于在命令层面的判断力。Auto Mode的设计正是利用了这个不对称——让人类专注于"要做什么"的计划审批,把"怎么执行"的操作审批交给AI。
竞争格局的差异
值得注意的是,并非所有AI编码工具都在朝同一方向走。OpenAI在其GPT-5.6的最强版本上实际上退出了Auto Mode,作为额外预防措施。而Anthropic选择在这个时间点全面推进——这背后是两条不同的安全哲学:
- OpenAI:在最强模型上保守,等待更多数据
- Anthropic:用数据和第三方验证支撑决策,主动推进
两种策略没有绝对的对错,但Anthropic的做法更有可能成为行业基准。因为如果数据证明了Auto Mode更安全,那么保守地坚持手动审批反而是在让用户暴露在更高的风险中。
商业模型与安全目标的意外对齐
一个有趣的细节:Anthropic宣布不再向Pro、Max和Team用户收取分类器消耗的额外token费用。这个决定表面上是让利,但背后有更深的逻辑。
Auto Mode使PR产出增加25%,意味着更多的token消耗。免费分类器消除了用户开启Auto Mode的最后一个经济障碍。更多的Auto Mode使用 → 更多的自主运行 → 更多的token消耗 → 更多的收入。同时,更少的人工审批 = 更少的审批疲劳 = 更安全。
Anthropic的商业模型和安全目标在这里实现了意外对齐——这在AI行业并不常见,值得注意。
安全范式转移的含义
分类器不是银弹
Anthropic在公告中反复强调,分类器不能消除所有风险。7%的对抗性漏检率虽然是上限估计,但它意味着确实存在分类器无法识别的攻击。这也是为什么回退到手动审批的机制存在——当分类器不确定时,让人类介入。
但关键是:95%以上的情况下,分类器的判断比一个疲劳的开发者更可靠。这不是AI在取代人类的判断力,而是在承认一个工程现实:人类不适合做高频、低差异度的安全检查工作。
“信任但要验证"的新版本
传统安全模型的假设是:人类在每一步都能做出可靠的安全判断。现实是:人类在第一步和第二步可能认真审查,到第五十步时已经完全是自动驾驶模式。
Auto Mode代表的新范式是:让AI执行,用AI监督,在关键决策点让人类介入。开发者定义约束和边界(通过设置文件、计划审批),分类器在边界内做实时判断,只有在分类器不确定或遇到关键决策时才回退给人类。
这个范式转移的影响不止于编码工具。它意味着在所有AI Agent的应用场景中——从运维自动化到数据处理——“人类在环”(human-in-the-loop)这个安全口号需要被重新审视。如果人类在环只是橡皮图章,那它不仅没有增加安全性,反而给了系统一个虚假的安全感。
未解决的问题
这个转向并非没有留下未解决的张力。
第一,跨终端通信和Agent间协作的复杂性。就在同一天,Anthropic还发布了Claude Code的会话间通信功能。多个自主运行的Agent能够互相通信,增加了安全攻击面。当Agent A可以向Agent B发送消息并影响其行为时,分类器能否有效检测Agent间的操纵?这是一个全新的安全边界。
第二,能耗问题。气候科学家Zeke Hausfather的数据显示,Agent自主运行模式的能耗远超普通聊天。Auto Mode鼓励更长时间的自主运行,这意味着更高的能耗。在AI产业能源需求已经超出绿电供给的背景下,“更自主"和"更可持续"之间存在张力。
第三,安全分类器的可解释性。当分类器拦截一个操作时,用户能否理解为什么?如果不透明,开发者可能会像对待权限提示一样——发展出绕过分类器的工作习惯。可解释性将决定Auto Mode的长期效果。
结论:信任转移的时间点
2026年8月14日可能不会作为一个标志性的日期被广泛记住,但它标记了一个真实的转折点:一个主要的AI实验室用数据宣称,在编码安全领域,AI的分类能力已经超过了人类的实时判断力。
这不是说人类变得无关紧要——恰恰相反,Anthropic的数据显示人类在计划审批层面有39%的拒绝率,远高于命令审批的3%。人类在架构判断上的价值依然不可替代。被替代的是那种低级、重复、疲劳驱动的"点击审批”——一个从未真正提供安全保障的幻觉。
真正的教训是:当我们说"人类在环"时,我们需要明确人类在哪一个环上。不是所有的"人在环中"都比"人不在环中"更安全。如果人类的参与只是橡皮图章,那不如诚实地承认它,让更适合的工具来做这个判断。
Anthropic的数据让我们不得不诚实一次。