Claude Code Auto Mode 将于2026年8月14日成为 Pro、Max 和 Team 用户的默认权限模式,取代手动审批提示,转而采用一个分类器,Anthropic 称该分类器可捕捉89%的危险命令,而人工审核员仅能捕捉13.6%——这一说法遭到独立研究人员质疑。
TECH

Claude Code Auto Mode 将于2026年8月14日成为 Pro、Max 和 Team 用户的默认权限模式,取代手动审批提示,转而采用一个分类器,Anthropic 称该分类器可捕捉89%的危险命令,而人工审核员仅能捕捉13.6%——这一说法遭到独立研究人员质疑。

31+
Signals

战略概览

  • 01.
    从2026年8月14日起,Pro、Max 和 Team 计划用户的新 Claude Code 会话将默认启用自动模式,取代重复的手动审批提示,转而采用一个分类器,对每次工具调用进行筛查,以识别不可逆、破坏性或越界操作。
  • 02.
    对于已设置不同默认权限模式的用户,系统将在更改前征询其意见,且用户可随时通过 Shift+Tab 切换模式。
  • 03.
    企业客户以及通过 Claude API、AWS Bedrock、Google Cloud Agent Platform 或 Microsoft Foundry 访问 Claude Code 的用户目前仍为选择加入模式,Anthropic 计划约一个月内在这些平台上也将自动模式设为默认。
  • 04.
    Anthropic 将承担分类器为每次工具调用增加的额外 token 成本,因此 Pro、Max 和 Team 用户无需为分类器的开销付费。

深度分析

切换背后的研究所依据

Anthropic 推行默认切换的依据是一项针对1,053名付费专业测试者的受控研究:人工审核员仅捕捉到13.6%的危险命令,而自动模式的分类器捕捉到了89%[1]。在直接对比中,自动模式阻止了人类已批准的800条命令,而人类仅阻止了自动模式允许的6条命令[1]。根本问题并非懒惰,而是疲劳:Anthropic 自身的生产数据显示,用户无论实际风险如何,批准了93%的权限提示[2]。这一点在长时间运行的自主会话中尤为关键,因为当疲劳达到顶峰时,人工审查的依赖性最强——而此时监督最薄弱,正是智能体执行最多无监督任务的时刻。Anthropic 将此更多视为一种纠正,而非用户体验升级:持续的审批提示制造了一种监督假象,而非真正的监督。

分类器的实际工作原理

自动模式运行双层防御机制:输入层探针筛查工具输出中的提示注入,而另一个基于 Sonnet 4.6 构建的输出层转录分类器则在执行前评估每个操作[2]。该评估本身是分阶段进行的——首先运行一个快速的单 token 过滤器,倾向于偏向阻断,仅当快速过滤器标记异常时,才会升级到完整的链式思维推理[2]。关键的是,分类器在架构上与执行任务的 Claude 会话是分离的:它仅看到被请求的工具调用,而非模型自身的推理路径,这一设计旨在防止 Claude 的输出说服分类器批准不安全操作。Anthropic 还报告了内部若干险些发生的事件,归功于该设计,包括阻止了将机密数据上传至公开页面的尝试,以及中止了约2,000个可能干扰正在进行的 GPU 训练任务的进程[4]

争议中的81%

此次推出的最尖锐分歧并非在于自动模式是否有效,而在于其有效程度。Anthropic 将其生产环境中的漏报率定为17%[3],但来自香港科技大学和苏黎世联邦理工学院的研究人员进行的一项独立对抗性基准测试发现,端到端漏报率高达81.0%(95%置信区间:73.8%–87.4%),而在工件清理任务中更是高达92.9%[3]。部分差异源于结构:研究人员发现,36.8%的状态变更操作(主要是直接文件编辑)完全绕过了分类器,而非被其误判[3]。他们还指出,分类器依赖于基于范围的启发式规则,对广泛、大规模违规的捕捉远比对精确、单目标未经授权操作的捕捉更可靠——而真实攻击者或行为逐渐偏移的智能体更可能尝试后者。Anthropic 的反证来自第三方审计机构 Trajectory Labs,该机构进行了720次对抗性尝试,未发现一次成功入侵[4],但这针对的是外部攻击场景,与学术论文测试日常状态变更智能体操作的威胁模型不同,因此两项研究并非直接矛盾——但它们留下了关于自动模式在现实世界中提供多大保护的广泛未解范围。

自动模式仍未覆盖的内容

即使暂且搁置准确性争议,自动模式也只是缩小了一部分风险面,而其他风险依然存在。Simon Willison 指出,默认允许列表仍允许如未锁定版本依赖项安装等操作,这意味着通过被攻陷的包发起的供应链攻击不会被评估命令而非来源的分类器所阻止[5]。Anthropic 自身也承认其局限性,警告分类器无法消除风险,并建议即使在自动模式下,对高风险生产基础设施的变更仍需人工审查[4]。还存在组织层面的脱节:由于分类器现在实际上充当了审批者而非人类,许多公司的治理和安全文档仍列明人类审查员为责任人,而实际上此人已不再参与流程[6]。这些并未否定其核心安全改进,但重新定义了自动模式为一个更窄的修复方案,旨在捕捉明显破坏性的单一操作,而非解决自主智能体风险的通用方案。

历史背景

在自动模式出现之前,Anthropic 唯一完全非交互式选项是 bypassPermissions 模式,专为 CI/CD 和 Docker 环境设计,会禁用整个权限系统;自动模式被定位为对该标志的更安全替代,而非替代完全手动审查。
自动模式最初作为常设手动权限提示与完全无监督的 bypass 标志之间的中间方案推出,为选择加入模式,早期引发了 Simon Willison 的怀疑评论。
InfoQ 将 Claude Code 自动模式描述为一种带有手动审批关卡的自主编码系统,介绍了此前的审批疲劳问题及分类器的双层架构,早于此次默认切换。
9to5Mac 在切换前发布了一则提醒,确认了8月14日的默认切换日期,并总结了1,053名测试者的研究结果及定价变更。
Anthropic 发布了公告博客文章,确认自动模式将成为 Pro、Max 和 Team 计划的默认设置,同时发布了一篇配套工程文章,详细说明分类器的构建与测试过程。

关键关系图

关键玩家
主题

Claude Code Auto Mode 将于2026年8月14日成为 Pro、Max 和 Team 用户的默认权限模式,取代手动审批提示,转而采用一个分类器,Anthropic 称该分类器可捕捉89%的危险命令,而人工审核员仅能捕捉13.6%——这一说法遭到独立研究人员质疑。

AN

Anthropic

Claude Code 及自动模式分类器的构建者与运营者;设定默认推出政策,为 Pro/Max/Team 承担分类器的 token 成本,并委托用于证明变更合理性的安全研究。

PR

Pro, Max, 和 Team 计划订阅者

除非已固定其他权限模式,否则将于2026年8月14日默认切换至自动模式;减少中断,据 Anthropic 称可产出更多成果,但需依赖一个非确定性分类器。

企业

企业、Claude API 及云平台客户(AWS Bedrock, Google Cloud Agent Platform, Microsoft Foundry)

目前仍为选择加入模式,为大型或受监管客户提供额外时间,预计约一个月后默认切换。

SI

Simon Willison

知名独立质疑者,主张基于AI的分类器具有非确定性且劣于操作系统级沙箱,公开对 Anthropic 的安全叙事施加压力。

TR

Trajectory Labs

Anthropic 引用的第三方安全审计机构;对自动模式下的 Claude 进行了720次对抗性攻击尝试,未发现一次成功入侵,该数据点被 Anthropic 用于强化其安全主张。

HK

HKUST / ETH Zurich 研究人员(Zimo Ji, Zongjie Li, Wenyuan Jiang, Yudong Gao, Shuai Wang)

独立学术压力测试者,其基准测试发现的失败率远高于 Anthropic 自身数据,构成对 Anthropic 安全主张的主要反方。

事实来源

6 条引用
  1. [1] Auto mode is now the default in Claude Code for Pro, Max, and Team plans
  2. [2] How we built Claude Code's auto mode
  3. [3] Stress-testing Claude Code auto mode's classifier (HKUST / ETH Zurich)
  4. [4] Anthropic sets Claude Code to auto mode by default to protect developers from bad approvals
  5. [5] Auto mode for Claude Code
  6. [6] Anthropic's Claude Code Auto Mode

来源文章

Top 5

THE SIGNAL.

Analysts

对基于AI的权限保护持怀疑态度,因其具有非确定性,更倾向于信任操作系统级沙箱;同时指出默认允许列表允许未锁定版本的依赖项安装,使供应链攻击面保持开放。

Simon Willison
独立软件与安全研究员/博主

他们的对抗性基准测试发现,自动模式分类器的端到端漏报率为81.0%,远高于Anthropic报告的生产数据,并发现存在覆盖缺口:大量状态变更操作通过直接文件编辑完全绕过分类器,且分类器依赖的基于范围的启发式规则对精确、单目标未经授权操作的捕捉能力弱于广泛操作。

Zimo Ji, Zongjie Li, Wenyuan Jiang, Yudong Gao, Shuai Wang
研究人员,香港科技大学与苏黎世联邦理工学院

认为自动模式的分类器是用与风险本身相同的材料制成的安全网,且权限提示在自动模式出现前已是形式主义,因为开发者通常跳过它们;指出分类器的真正弱点在于误判已批准操作的范围是否真正覆盖了Claude的实际行为。

Paddo
独立开发者与AI工具评论员(paddo.dev)

指出自动模式将审批权从人类转移至AI,但组织治理文档尚未跟上这一转变。

Mykola Kondratiuk
Playtika 公司总监

对自动模式带来的生产力和自主性提升持积极态度,认为其使开发者能够从主动监督中抽身。

Sid Chaudhary
Intempt 公司产品负责人
The Crowd

Starting August 14, auto mode will be the default permission mode in Claude Code for Pro, Max, and Team users. Auto mode reviews shell commands and actions with a separate classifier. In testing, it caught 89% of dangerous commands. Manual approval caught 14%.

@@ClaudeDevs12888

People often ask what my biggest tip is for getting the most out of Claude Code. These days my #1 tip is: use auto mode Auto mode means no more permission prompts. It is the key building block for multi-clauding: start a session, then while it runs, work on another session in

@@bcherny5014

Auto mode is a step change improvement in the Claude Code UX, balancing autonomy and safety. Almost everyone on our team uses this as a daily driver. Now available to Claude for Team users! `claude --enable-auto-mode` to turn on, then Shift + Tab to enter the mode

@@_catwu418

Does auto mode drain tokens faster?

@u/throwaway737281096
Broadcast
How auto mode works with Claude Code

How auto mode works with Claude Code

Auto Claude: NEW Claude Auto-Mode is INSANE!

Auto Claude: NEW Claude Auto-Mode is INSANE!

Claude Code Keeps Asking for Permission? Turn On Auto Mode

Claude Code Keeps Asking for Permission? Turn On Auto Mode