压缩保留了腐烂:为何Anthropic自身技术自相矛盾
Anthropic的应用AI团队正式提出了三种应对长期运行智能体中上下文污染的技术:压缩(compaction),即对接近窗口上限的对话进行总结,并以该总结重新开启新的上下文窗口;结构化笔记(structured note-taking),即在上下文窗口之外写入持久性笔记以便后续重新加载;以及子智能体架构(sub-agent architectures),即将专注任务委托给专门的智能体,由其返回干净的摘要[1]。该团队在同一天(2025年9月29日)推出了配套产品,发布了测试版上下文编辑API和Claude API上的记忆工具[2],组合使用后在长期任务中减少了84%的token使用量,并在100轮次任务中实现了39%的性能提升[3]。
但Anthropic自身的培训材料却使其清晰的分类变得复杂:应用AI团队在关于构建可运行数小时的智能体的演示中明确指出,仅靠压缩并不能解决连贯性漂移问题,而不同阶段或子智能体之间的结构化交接比压缩本身更为重要。这一让步与Claude Code社区流传的五部分‘SCRUB’框架中的反主流批判高度一致,该框架对压缩持怀疑态度,因为压缩后的摘要会像保留事实一样忠实地保留错误——模型不会通过压缩消除错误,只会消除冗长。高级用户描述的实际应对方式是禁用自动压缩,生成子智能体以实现隔离,主动剪切或回滚,并将压缩视为最后手段而非默认选项。Chroma的Context Rot研究为这一切的重要性提供了实证基础:在涵盖GPT-4.1、Claude 4、Gemini 2.5和Qwen3等18个前沿模型的测试中发现,输出可靠性在达到标称上下文窗口容量之前就已显著下降,这意味着仅关注硬性溢出错误的团队忽略了主要的失效模式[4]。



