89 对 13.6 的差距如何促成决策
Anthropic 并非凭直觉将自动模式设为默认。在一项针对1,053名付费测试者的受控研究中,人工审核者在手动审批下仅捕捉到13.6%的危险命令,且随着会话累积的提示达到50条,这一比率进一步下降至约5%——典型的审批疲劳曲线。而现在用于筛查每个高风险工具调用的独立分类器模型则捕捉到了相同命令中的89% [1]。
这一差距与 Anthropic 自身遥测数据揭示的一种习惯并列:无论内容如何,用户批准了97%的权限提示,这使得旧有的保护机制更像是一种形式而非真正的检查 [1]。数月前,一位独立开发者分析更直白地指出这一点,认为在自动模式出现之前,‘人在回路’实际上已经消失,因为手动提示通常未经审查就被点击通过 [2]。
Anthropic 也从结果角度阐述这一转变:包含未请求有害行为的会话比例从手动审批下的6.3%降至自动模式下的2.4%,而启用自动模式的 Team 和 Enterprise 客户提交的拉取请求数量比未启用者多出约25% [1]。行业媒体报道在8月14日切换前已证实了时间线和分类器的关键数据 [3]。


