为何13个单词足以劫持一个代理
康奈尔科技的研究人员张 Tingwei(Tingwei Zhang)、哈尔·特里德曼(Hal Triedman)和维塔利·什马蒂科夫(Vitaly Shmatikov)在注意到深度研究代理在相关查询中反复检索相同少数几页用户生成内容后,开发了WARP(Web Agent Retrieval Poisoning)[1],这使得Reddit和维基百科等平台成为集中式攻击面而非分散式攻击面。个别用户生成内容页面在相关查询的运行中重复出现高达48%,这意味着单个被攻陷的Reddit帖子可能污染整个未来代理回答家族 [5]。这种攻击本身无需访问任何AI提供商的模型权重或专有检索索引——只需具备留言能力即可 [5]。在针对三个开源深度研究系统STORM、Co-STORM和OmniThink的测试中 [1],大约13个单词的片段就足以持续引导输出导向垃圾或诈骗内容 [2]。康奈尔研究员哈尔·特里德曼解释说,措辞与位置同等重要:一段11到15个单词、紧密模仿可能搜索查询的文本对大语言模型具有不成比例的说服力 [2]。合著者张 Tingwei 补充称,根本问题在于架构层面而不仅是对抗性问题——深度研究代理不会像人类那样权衡信息来源的可信度,而是将随机Reddit评论与政府网站一视同仁 [2]。


