Claude Code auto mode default
TECH

Claude Code auto mode default

25+
Signals

战略概览

  • 01.
    自2026年8月14日起,自动模式将成为Pro、Max和Team套餐中新建Claude Code会话的默认权限模式,取代逐项手动批准,转而由分类器审查每次工具调用。
  • 02.
    该分类器会阻止被判定为不可逆、破坏性或目标位于用户环境之外的工具调用;当其阻止某项操作时,Claude将寻找更安全的方法,或直接向用户询问。
  • 03.
    Anthropic已停止向Pro、Max和Team套餐用户收取分类器在每次工具调用中消耗的额外token费用,该政策随此次更新同步生效。
  • 04.
    在Claude Enterprise、Claude API、AWS、Bedrock、Google Cloud的Agent Platform以及Microsoft Foundry上,自动模式仍为可选功能,预计约一个月后将在这些平台上线默认切换。

两个分类器,而非一个自我审查

自动模式的核心设计选择是分离:决定运行哪个命令的模型永远不会是批准该命令的那个。一个专用分类器仅能看到正在请求的工具调用,而看不到Claude的推理过程或其自身对该操作的正当性说明,这避免了Anthropic工程团队所比喻的“自己编写、审查并合并自己的拉取请求”的情况。在此意图检查之上,还叠加了一个服务器端的第二层探测机制,在Claude执行前筛查工具结果中是否注入了指令。一位Claude Code工程师总结称,这种设计通过叠加模型训练、输入探测和意图匹配分类器,使针对未见攻击的间接提示注入成功率降至接近零——这一说法与Trajectory Labs对720次间接提示注入尝试的独立测试结果一致,测试覆盖运行自动模式的Claude Fable 5、Opus 5和Sonnet 5,记录到零次成功攻击,相比之下OpenAI Codex的等效Auto-review模式成功率为5.83%[1]。并非所有操作都会到达分类器:只读或易于恢复的操作完全跳过检查,默认情况下只有工作目录和当前仓库配置的Git远程被视为“内部”——任何超出此边界的访问都将被阻止,直到管理员明确将其加入白名单。Simon Willison虽然总体上认同反复手动批准从来不是真正的安全机制,但仍希望在Anthropic自有测试框架之外验证这一对比,再将“零成功”视为定论[2]

两个看似矛盾的数字

Anthropic公布的关键数据来自一项针对1,053名付费测试者的受控研究:自动模式捕获了89%的危险命令,而人类评审员的捕获率仅为13.6%;在生产流量中,公司报告的误报率为0.4%,漏报率为17%,同时手动批准会话中包含意外有害操作的比例从6.3%下降至自动模式会话的2.4%[3]。与此相对的是独立压力测试评估所呈现的更为严峻的画面:端到端漏报率高达81.0%(95%置信区间73.8%-87.4%),仅限分类器实际评估的操作中漏报率为70.3%,且36.8%的所有状态变更操作——包括工件清理任务(漏报率高达92.9%)——完全不在分类器的审查范围内,因为代理会通过直接编辑文件绕过缺失的命令行工具[4]。Apollo Research的红队加固工作已在默认切换前将分类器在保留对抗性数据集上的漏报率从12%降至7%[5]。这些数字并非矛盾,而是回答了两个不同问题:Anthropic的数据描述了分类器在真实用户产生的混乱但基本无害的流量中的表现,而压力测试则衡量其在专门用于暴露盲点的工作负载下的抗压能力。17%与81%之间的差距与其说是丑闻,不如说是一个警告标签——一个在典型使用场景下看似强大的分类器,仍可能被有意绕过的攻击者轻易击败;适用于所有人的默认设置应依据对抗性数字而非友好数字来评判。

免费Token,强制默认

两项变化的时间点恰好重合于同一公告中:Anthropic停止向Pro、Max和Team用户收取分类器在每次工具调用中消耗的额外token费用,同时将自动模式设为这些套餐所有新会话的默认选项[3]。在退出门槛切换的同时取消成本惩罚,既是安全举措也是商业决策——此前按量计费的分类器悄悄对每项操作征税,确实构成了采用阻力,社区在变更前曾报告因分类器开销导致显著的月度账单。Anthropic还有额外的增长激励:据称已使用自动模式的团队和企业客户发布的拉取请求数量高出约25%,这一生产力数字使得“更安全的默认值”转化为一项商业案例,Anthropic可在约一个月后以此推动相同默认设置在Enterprise、API及主要云平台上线[3]。这并未削弱安全论点,但意味着免费token的改变应被视为一项采用杠杆,而非纯粹的善意姿态。

橡皮图章捕捉到了什么,而Anthropic未言明

Anthropic自身的研究支持分类器的必要性:用户已倾向于批准绝大多数权限提示,无论风险如何,比例约为93%-97%;且人类识别真正危险命令的准确性随提示次数增加而进一步下降,在经历50次提示后降至约5%[6]。正是这一点引发了开发者社区的具体质疑而非泛泛反对。关于此项变更的最大社区讨论串中得票最高的回复指出,Anthropic的89%对13.6%比较基于两种不同的评估条件,且两个数据均未包含误报率,认为89%检测率搭配2%误报率是优秀产品,而89%搭配15%误报率则正是引发投诉的原因——这一区别在Anthropic的官方公告中并未阐明。开发者也报告了相反的失败模式:足够激进以捕捉危险命令的分类器同样会频繁阻止合法命令,常规基础设施命令被列为反复出现的误报,迫使回退至手动模式。另一项较低调的批评关注分类器真正阻止某项操作时的情况——它仅告知Claude该操作被拒绝,对话轮次继续,没有任何机制能在真实风险时刻暂停执行并将控制权交还给人类。Michael Bargury的分析基于Anthropic自身的事件日志,正是支持自动模式主张的重要依据之一,但他也划清了与Anthropic公开声明相同的界限:适用于减少日常工作的摩擦,但一旦涉及生产基础设施,便不能替代人工审查[6]

历史背景

自动模式最初作为仅限Team套餐的可选研究预览版推出,定位为介于完全手动批准与--dangerously-skip-permissions之间的一种中间路径。
Simon Willison在AI Engineer World's Fair上主持了一场与Claude Code团队成员Cat Wu和Thariq Shihipar的炉边谈话,探讨编码代理安全、评估与工具设计,正值自动模式默认上线前夕。
Anthropic宣布自动模式将于下周(8月14日)成为默认设置。
Willison发布了对自动模式默认设置公告的分析,指出一次并发的供应链包攻击案例,表明自动模式的默认白名单无法捕捉此类攻击。
自动模式成为Pro、Max和Team套餐中新建Claude Code会话的默认权限模式。

关键关系图

关键玩家
主题

Claude Code auto mode default

AN

Anthropic / Claude Code team

Owns the product decision to make auto mode the default, sets the rollout schedule across plans and providers, and removed the classifier's token charge to accelerate adoption.

AP

Apollo Research

Anthropic's red-team partner that hardened the classifier ahead of the default rollout, cutting its miss rate on a held-out adversarial test set from 12% to 7%.

TR

Trajectory Labs

Independent evaluator that stress-tested auto mode with 720 indirect prompt-injection attempts and reported zero successful attacks, a data point Anthropic leans on to defend the default switch.

SI

Simon Willison

Prominent independent developer whose public analysis pushed back on Anthropic's self-reported safety numbers and called for independent confirmation, shaping the skeptical side of the public debate.

MI

Michael Bargury (mbgsec)

Security researcher who used Anthropic's own incident logs to frame auto mode's real threat model and cautioned it is not a substitute for human review on high-stakes infrastructure.

事实来源

7 条引用
  1. [1] Anthropic Sets Claude Code To Auto Mode By Default To Protect Developers From Bad Approvals
  2. [2] Auto mode
  3. [3] Auto mode default in Claude Code
  4. [4] arXiv:2604.04978
  5. [5] Claude Code Auto Mode
  6. [6] Claude Code Auto Mode: A Safer Way To Skip Permissions
  7. [7] Auto mode configuration

来源文章

Top 3

THE SIGNAL.

Analysts

同意逐项手动批准因确认疲劳而失效,但对Anthropic自报的安全数据持怀疑态度,并指出默认白名单无法捕捉通过常规包安装路由的并发供应链攻击。

Simon Willison
独立开发者与研究员,simonwillison.net

认为自动模式的风险状况优于依赖人工评审,并指出Anthropic内部广泛采用作为证据,表明分类器在实践中已优于手动批准。

Cat Wu
Claude Code团队,Anthropic

将自动模式视为对真实审批疲劳的务实回应——用户无论风险如何都已接受绝大多数权限提示——但明确警告其并非高风险基础设施上谨慎人工审查的即插即用替代品。

Michael Bargury
安全研究员,mbgsec.com
The Crowd

Starting August 14, auto mode will be the default permission mode in Claude Code for Pro, Max, and Team users. Auto mode reviews shell commands and actions with a separate classifier. In testing, it caught 89% of dangerous commands. Manual approval caught 14%.

@@ClaudeDevs14609

turns out you can get indirect prompt injection to ~0 on unseen attacks if you stack enough layers (model training + input probes + a classifier checking intent). didn't expect that a year ago. auto mode is default in claude code as of next week https://t.co/7KLnIzf6y7 https://t.co/ow4jX2CMZW

@@bcherny2546

It is annoying approving actions, but there was a reason for that... Should be interesting to see how this goes. Sounds like they are catching a lot, but still 11% of cases slip through -> Anthropic says auto mode will be the default in Claude Code for Pro, Max, Team plans, https://t.co/urXkCeZk8r

@@glenngabe3

Anthropic Flips Claude Code to Auto Mode by Default Aug 14, after finding AI blocks 80%+ dangerous queries while humans only 14%

@u/Justgototheeffinmoon581
Broadcast
How auto mode works with Claude Code

How auto mode works with Claude Code

Auto Claude: NEW Claude Auto-Mode is INSANE!

Auto Claude: NEW Claude Auto-Mode is INSANE!

Claude Code v2.1.158 - Auto Mode on Bedrock & Vertex

Claude Code v2.1.158 - Auto Mode on Bedrock & Vertex