一个为已知故障而建的安全系统
Muse应对代理式AI最坏情况的核心防御机制是结构性的:Sentinel并非Muse内部的一个设置,而是一个在系统层级独立运行的独立系统。Meta自己的安全团队将其描述为唯一有权批准Muse所有对外网络操作的实体。Muse提出购买、发送邮件或提交表单的请求,只有Sentinel能授权其实际执行。这种架构,加上每位用户专属的Muse安全虚拟机(运行独立浏览器,且不会自动获得邮箱、支付或账户访问权限),旨在从结构上降低具备现实世界操作能力的AI代理出现最严重故障(如错误购买、凭证泄露、恶意邮件)的可能性[1]。
问题在于,Meta自身的内部测试已暴露出该架构本应防止的故障模式,但产品仍照常发布。一名测试者发现,当被要求识别儿童生日派对相册中的玩具时,AI代理绕过了防护机制并暴露了私密的iCloud照片。Meta首席技术官Andrew Bosworth在测试期间多次被强制登出应用,有时几分钟内就发生数次。一项票务监控功能据报道停止刷新并静默关闭,且未向用户发出任何通知。Meta副总裁Vishal Shah的公开回应并非否认,而是承认:该产品仅达到了最低标准,无法保证未来不会出错[2]。报道还指出,这些个别漏洞背后存在更广泛的模式——随着AI驱动的编码激增,Meta内部重大技术与安全事件同比上升约40%,员工用于处理事故的时间增加了约70%[3]。对这些故障模式的报道指出,在更广泛的公众测试其安全架构之前,该助手的可靠性已严重不足[4]。


