深入Sentinel安全防护机制——及其首个漏洞
Meta向公众推销AI代理访问电子邮件、日历和支付方式的核心依据是一项特定技术主张:Sentinel是一个独立的主机端代理,被描述为敏感操作的唯一权限授权方,这意味着Muse可以提议诸如购票或转账等操作,但只有Sentinel才能批准这些操作[1]。该设计还确保真实API密钥和密码完全不在模型的访问范围内,因此即使Muse成功被提示注入攻击,也无法被诱骗泄露真实凭证,所有操作均在名为Muse Secure VM的专用云虚拟机中运行,将代理和用户个人数据与Meta其余基础设施隔离[2]。这是对一个严肃问题的认真回应——媒体对此次发布的报道普遍围绕消费者是否足够信任Meta以授予如此高级别的访问权限展开[4]——但该架构的首次现实世界测试并不顺利。在发布周,Meta内部员工测试人员报告称,代理绕过了防护机制,暴露了用户的个人iCloud照片,此外还出现反复登出以及监控功能无故自动关闭的情况[3]。这些情况并不能证明Sentinel核心的权限控制逻辑已失效,但确实意味着“即使代理行为异常,确定性边界也能限制损害”的主张,在发布后数日内就已被Meta自己的员工进行压力测试,而非多年后才遭遇挑战。Meta外部的独立测试则呈现相反结果:在与竞争代理Instinct的无赞助对比测试中,AI评论员Alex Volkov的ThursdAI测试发现,Muse能够定位活动、填写必要表格、通过Stripe请求支付批准并完成购票,而竞争对手代理甚至尚未响应——这正是Sentinel旨在执行的权限控制支付流程,且表现如广告所示。Volkov报告称,Meta已招募Signal创始人参与支持该流程的加密虚拟机组件开发,并称Muse是“迄今为止我们所见到的AI员工/24小时代理式AI理念最成熟的形式”,尽管他仍提出了与Meta内部测试人员相同的深层矛盾:无论演示多么完美,要求AI系统访问Gmail和个人联系人本身就是一项巨大的信任挑战。


