切换背后的研究所依据
Anthropic 推行默认切换的依据是一项针对1,053名付费专业测试者的受控研究:人工审核员仅捕捉到13.6%的危险命令,而自动模式的分类器捕捉到了89%[1]。在直接对比中,自动模式阻止了人类已批准的800条命令,而人类仅阻止了自动模式允许的6条命令[1]。根本问题并非懒惰,而是疲劳:Anthropic 自身的生产数据显示,用户无论实际风险如何,批准了93%的权限提示[2]。这一点在长时间运行的自主会话中尤为关键,因为当疲劳达到顶峰时,人工审查的依赖性最强——而此时监督最薄弱,正是智能体执行最多无监督任务的时刻。Anthropic 将此更多视为一种纠正,而非用户体验升级:持续的审批提示制造了一种监督假象,而非真正的监督。


