两个分类器,而非一个自我审查
自动模式的核心设计选择是分离:决定运行哪个命令的模型永远不会是批准该命令的那个。一个专用分类器仅能看到正在请求的工具调用,而看不到Claude的推理过程或其自身对该操作的正当性说明,这避免了Anthropic工程团队所比喻的“自己编写、审查并合并自己的拉取请求”的情况。在此意图检查之上,还叠加了一个服务器端的第二层探测机制,在Claude执行前筛查工具结果中是否注入了指令。一位Claude Code工程师总结称,这种设计通过叠加模型训练、输入探测和意图匹配分类器,使针对未见攻击的间接提示注入成功率降至接近零——这一说法与Trajectory Labs对720次间接提示注入尝试的独立测试结果一致,测试覆盖运行自动模式的Claude Fable 5、Opus 5和Sonnet 5,记录到零次成功攻击,相比之下OpenAI Codex的等效Auto-review模式成功率为5.83%[1]。并非所有操作都会到达分类器:只读或易于恢复的操作完全跳过检查,默认情况下只有工作目录和当前仓库配置的Git远程被视为“内部”——任何超出此边界的访问都将被阻止,直到管理员明确将其加入白名单。Simon Willison虽然总体上认同反复手动批准从来不是真正的安全机制,但仍希望在Anthropic自有测试框架之外验证这一对比,再将“零成功”视为定论[2]。



