为何搜索数据才是真正的奖品——以及匿名化为何可能削弱其价值
谷歌的搜索数据代表了竞争对手难以复制的东西:数十年累积的人类意图信号——人们搜索什么、点击什么、停留多久、忽略什么。这种行为反馈循环正是谷歌搜索精准的原因,也是训练和优化依赖检索与事实依据的AI系统所需的原始材料 [1]。欧盟强制要求向竞争对手共享排名、查询、点击和浏览数据,因此并非一项微小的技术让步,而是试图结构性削弱让竞争对手长期落后的护城河 [2]。但欧盟的匿名化要求确实限制了这些数据的价值。在数据离开谷歌系统前,用户被分组为至少1000人的数据包,罕见查询和敏感信息被抑制,标识符被移除 [3]。对于常见高频查询,这仍然是极其有用的训练和排名信号。但对于长尾查询——那些冷门、小众或新颖的查询,AI助手最容易在此类问题上失败——1000人一组的门槛可能恰好抑制了能够缩小质量差距的关键数据。谷歌保留拒绝向存在网络安全或数据保护风险的企业提供数据的权利,且数据访问成本由定价公式决定 [4]。独立审计将审查接收方企业。实际上,这意味着该强制令最可能惠及微软必应和OpenAI等大型、已建立的公司——它们能够承担合规成本并通过安全审查——而较小的欧盟搜索初创企业可能发现获取路径过于繁重。匿名化批量数据是否真正改变AI竞争力的问题仍悬而未决。竞争对手获得了前所未有的信号;但这些信号是否足以弥补十年的差距,仍是更大的赌注。



