AI深度研究代理易受Reddit内容投毒攻击
TECH

AI深度研究代理易受Reddit内容投毒攻击

26+
Signals

战略概览

  • 01.
    康奈尔科技(Cornell Tech)的研究人员发表了一篇论文,描述了WARP(Web Agent Retrieval Poisoning,网络代理检索投毒)技术,表明AI深度研究代理可能被植入在Reddit评论等用户生成内容中的简短文本片段所操控。
  • 02.
    只需在Reddit评论末尾添加大约13个单词,就能可靠地引导代理输出垃圾或诈骗内容,提及率根据有效载荷部署方式的不同达到30%至62%。
  • 03.
    该攻击已在三个开源深度研究系统(STORM、Co-STORM、OmniThink)上进行了测试,研究人员发现现有的防御措施(如基于困惑度的文本过滤)无法可靠地区分中毒段落与真实的用户内容。
  • 04.
    这些发现正值OpenAI和谷歌每年向Reddit支付数百万美元数据授权费,且山姆·阿尔特曼(Sam Altman)持有该平台8.7%股份之际,引发了关于激励机制是否对齐的质疑。

深度分析

为何13个单词足以劫持一个代理

康奈尔科技的研究人员张 Tingwei(Tingwei Zhang)、哈尔·特里德曼(Hal Triedman)和维塔利·什马蒂科夫(Vitaly Shmatikov)在注意到深度研究代理在相关查询中反复检索相同少数几页用户生成内容后,开发了WARP(Web Agent Retrieval Poisoning)[1],这使得Reddit和维基百科等平台成为集中式攻击面而非分散式攻击面。个别用户生成内容页面在相关查询的运行中重复出现高达48%,这意味着单个被攻陷的Reddit帖子可能污染整个未来代理回答家族 [5]。这种攻击本身无需访问任何AI提供商的模型权重或专有检索索引——只需具备留言能力即可 [5]。在针对三个开源深度研究系统STORM、Co-STORM和OmniThink的测试中 [1],大约13个单词的片段就足以持续引导输出导向垃圾或诈骗内容 [2]。康奈尔研究员哈尔·特里德曼解释说,措辞与位置同等重要:一段11到15个单词、紧密模仿可能搜索查询的文本对大语言模型具有不成比例的说服力 [2]。合著者张 Tingwei 补充称,根本问题在于架构层面而不仅是对抗性问题——深度研究代理不会像人类那样权衡信息来源的可信度,而是将随机Reddit评论与政府网站一视同仁 [2]

从一家虚构的奥斯汀餐厅到一种幻影加密货币

论文中的概念验证危害读起来就像骗子的愿望清单。一条被投毒的r/austinfood评论导致代理推荐了一家虚构餐厅“Sol Azteca”而非真实餐厅 [2];一篇植入在r/OnlineDating板块的帖子推广了一个名为“SilverPath”的不存在约会应用 [2];其他测试则产生了一个虚假的Xfinity取消服务以及一种名为“BananaCoin”的虚构加密货币,并将其与比特币和以太坊相提并论 [5]。这些并非罕见异常——当被投毒页面被检索时,13个单词的有效载荷产生了约38%至51%的条件提及率,在有效载荷分布于多个页面时上升至62% [3][5]。即使注入文本占整个Reddit帖子内容不到4%,只要页面被查看,代理仍会在30%至53%的运行中重复植入声明 [3][5]。这种高效性可追溯至漏洞的结构性位置:用户生成平台已提供深度研究代理检索URL的17%至23%,而仅Reddit就占该池的约54%至71% [4][5]

无法分辨毒药与常人文字的过滤器

研究人员不仅发现了漏洞,还尝试修补——但基本失败了。包括旨在标记机器生成注入内容的基于困惑度的文本过滤器在内的源级过滤和基于输出的检测方法,均未能可靠地区分中毒段落与普通Reddit写作 [3]。这是因为精心制作的攻击者文本读起来自然——对于执行过滤的同类型语言模型而言,其统计特征与真实评论无异 [3]。研究团队未对OpenAI Deep Research或Gemini Deep Research等商业产品进行实时操纵测试,因为这需要在开放网络上发布修改后的内容 [3],但他们确实审计了各系统引用用户生成内容的频率,发现差距巨大:Gemini Deep Research在12.1%的观察引用中引用了用户生成内容,而OpenAI Deep Research仅为0.4% [4]。这一差距表明,某些生产系统在尚未遭受利用前,已比其他系统更易受到此类攻击。

Reddit正因成为薄弱环节而获利

令人不安的潜在线索是:在此漏洞未解决期间谁在获利?Reddit的用户生成内容对AI行业而言并非偶然数据源——而是经过授权的数据源。谷歌于2024年2月签署协议,每年支付约6000万美元获取Reddit数据的结构化API访问权限 [6],随后OpenAI也签署了类似协议,作为Reddit IPO时披露的总计2.03亿美元许可合同的一部分 [6]。OpenAI首席执行官山姆·阿尔特曼还有更直接的利益关联:他自2015年至2022年担任Reddit董事会成员,曾短暂担任临时CEO,并持有8.7%的所有权股份——约1220万股,使其成为仅次于纽豪斯家族(Advance)和腾讯的公司第三大股东 [7]。这些事实并未造成WARP漏洞,但意味着与Reddit财务联系最深的两家公司——其中一家由Reddit的主要股东领导——正是论文指出其旗舰研究产品最易受Reddit来源操控的两家公司。

历史背景

阿尔特曼开始担任Reddit董事会董事,任期延续至2022年(包括短暂担任临时CEO),并因此获得8.7%的所有权股份,该持股在Reddit IPO时被披露。
Reddit签署了一项数据授权协议,向谷歌提供用于AI训练的Data API结构化访问权限,价值约为每年6000万美元。
Reddit与OpenAI签署了类似的AI训练数据授权协议,属于Reddit IPO时披露的总计2.03亿美元授权合同价值的一部分。
题为《Deep-Research Agents Can Be Poisoned via User-Generated Content》的WARP论文被上传至arXiv。
404 Media率先报道了WARP研究,首次揭示利用Reddit操控AI搜索是多么轻而易举。

关键关系图

关键玩家
主题

AI深度研究代理易受Reddit内容投毒攻击

CO

Cornell Tech (Tingwei Zhang, Hal Triedman, Vitaly Shmatikov)

WARP研究论文的作者;发现并披露了该漏洞,已在STORM、Co-STORM和OmniThink上进行测试,并评估了防御措施。

OP

OpenAI

运营ChatGPT Deep Research,在观察到的引用中仅0.4%引用了用户生成内容;与Reddit有数据授权协议,每年支付约7000万美元,且CEO山姆·阿尔特曼持有Reddit 8.7%的股份。

GO

Google

运营Gemini Deep Research,在观察到的引用中引用用户生成内容的比例达12.1%——远高于OpenAI——并于2024年2月签署协议,每年向Reddit支付约6000万美元。

RE

Reddit

提供深度研究代理检索的约54%至71%的用户生成内容;其开放评论系统是攻击的入口点,同时该平台又将相同内容授权给OpenAI和谷歌使用。

SA

Sam Altman

OpenAI首席执行官,持有Reddit 8.7%股份(Reddit第三大股东),2015年至2022年曾任Reddit董事会成员,曾短暂担任临时CEO——与其公司产品引用的平台存在财务关联。

事实来源

7 条引用
  1. [1] Deep-Research Agents Can Be Poisoned via User-Generated Content (arXiv:2605.24245)
  2. [2] It Is Trivially Easy to Use Reddit to Manipulate AI Search, Research Suggests
  3. [3] Deep Research AI Agents Can Be Poisoned via UGC
  4. [4] Reddit AI Search Poisoning Research
  5. [5] Attackers Can Poison AI Research Agents Using Reddit and Wikipedia Content
  6. [6] Reddit Signs Google Licensing Deal Ahead of IPO, Discloses Altman Ties
  7. [7] Sam Altman Owns 8.7% Stake in Reddit

来源文章

Top 1

THE SIGNAL.

Analysts

解释称,一段措辞与可能搜索查询相似的简短短语对大语言模型具有不成比例的说服力,这就是为何如此少量的注入文本能可靠地引导代理输出导向垃圾或诈骗内容。

Hal Triedman
研究员,康奈尔科技

认为深度研究代理在综合答案时不按人类方式权衡信息来源可信度,而是将随机Reddit评论与政府网站文章同等对待。

Tingwei Zhang
研究员,康奈尔科技
The Crowd

IT TAKES 13 WORDS OF REDDIT POISON TO INFLUENCE AN AI AGENT! Rail on about just a few things and you can name them if you follow me a bit. Using the Sewage of Reddit for anything AI is the real danger and misalignment. This new Cornell Paper shows why.

@@BrianRoemmele79

Just 13 Words on Reddit Can Hijack AI Research Agents — And the AI Companies Building Them Own the Problem Cornell Tech researchers released a paper that should have detonated inside every AI lab: Deep-Research Agents Can Be Poisoned via User-Generated Content

@@BrianRoemmele42

2 of 2 Anthropic's relationship with Reddit is even more revealing. Reddit sued Anthropic in June 2025, alleging the company continued scraping Reddit at scale (more than 100,000 times) after publicly claiming it had stopped, and after declining the licensing agreements that

@@BrianRoemmele11

REPORT: Cornell Researchers Prove That a Single Reddit Comment as Short as 13 Words Can Reliably Poison AI Search Engines Like ChatGPT and Google, and the Lead Researcher Says the Attack Is Almost Embarrassingly Simple to Pull Off

@u/InterstellarKinetics3800
Broadcast
How Brands Use Reddit to Poison AI Search

How Brands Use Reddit to Poison AI Search

How to poison AI research agents

How to poison AI research agents

AI Overviews, Reddit, and the Future of Local SEO Manipulation

AI Overviews, Reddit, and the Future of Local SEO Manipulation

AI深度研究代理易受Reddit内容投毒攻击 — AI 新闻 | Agentic Brew