AI智能体上下文与记忆工程技巧
TECH

AI智能体上下文与记忆工程技巧

27+
Signals

战略概览

  • 01.
    Anthropic的应用AI团队正式提出了三种应对长期运行智能体中上下文污染的技术——压缩(compaction)、结构化笔记(structured note-taking)和子智能体架构(sub-agent architectures),并于2025年9月29日推出了测试版上下文编辑API及Claude API上的记忆工具。
  • 02.
    一项Anthropic内部基准测试报告称,在长期任务中结合使用上下文编辑与记忆工具可将token使用量减少84%,另有一份报告显示,在100轮次任务中性能提升了39%。
  • 03.
    来自斯坦福大学、SambaNova和加州大学伯克利分校的ICLR 2026论文ACE将智能体上下文视为一个不断演进的‘操作手册’,在AppWorld基准测试中准确率最高提升了17.1%,使一个开源模型能够匹敌基于专有GPT-4.1的智能体在排行榜上的表现。
  • 04.
    IBM Research于2026年4月8日发布的ALTK-Evolve利用带有背景合并任务的指南库,将AppWorld综合准确率从50.0%提升至58.9%,其中最大的提升集中在复杂的多步骤任务上。

压缩保留了腐烂:为何Anthropic自身技术自相矛盾

Anthropic的应用AI团队正式提出了三种应对长期运行智能体中上下文污染的技术:压缩(compaction),即对接近窗口上限的对话进行总结,并以该总结重新开启新的上下文窗口;结构化笔记(structured note-taking),即在上下文窗口之外写入持久性笔记以便后续重新加载;以及子智能体架构(sub-agent architectures),即将专注任务委托给专门的智能体,由其返回干净的摘要[1]。该团队在同一天(2025年9月29日)推出了配套产品,发布了测试版上下文编辑API和Claude API上的记忆工具[2],组合使用后在长期任务中减少了84%的token使用量,并在100轮次任务中实现了39%的性能提升[3]

但Anthropic自身的培训材料却使其清晰的分类变得复杂:应用AI团队在关于构建可运行数小时的智能体的演示中明确指出,仅靠压缩并不能解决连贯性漂移问题,而不同阶段或子智能体之间的结构化交接比压缩本身更为重要。这一让步与Claude Code社区流传的五部分‘SCRUB’框架中的反主流批判高度一致,该框架对压缩持怀疑态度,因为压缩后的摘要会像保留事实一样忠实地保留错误——模型不会通过压缩消除错误,只会消除冗长。高级用户描述的实际应对方式是禁用自动压缩,生成子智能体以实现隔离,主动剪切或回滚,并将压缩视为最后手段而非默认选项。Chroma的Context Rot研究为这一切的重要性提供了实证基础:在涵盖GPT-4.1、Claude 4、Gemini 2.5和Qwen3等18个前沿模型的测试中发现,输出可靠性在达到标称上下文窗口容量之前就已显著下降,这意味着仅关注硬性溢出错误的团队忽略了主要的失效模式[4]

ACE vs ALTK-Evolve竞赛:一份持续演化的操作手册 vs 一个精心策划的库

ACE(Agentic Context Engineering)是斯坦福大学、SambaNova和加州大学伯克利分校研究人员在ICLR 2026发表的论文,它彻底否定了将压缩作为目标的做法:该方法将智能体的上下文视为一个通过生成、反思和策展循环不断精炼的‘操作手册’,而非被挤压成简洁摘要的内容[5]。其回报不仅是准确性,还有模型经济性——该技术使AppWorld智能体基准测试准确率最高提升了17.1%,足以让一个较小的开源模型DeepSeek-V3.1在无需重新训练任何权重的情况下,匹敌排行榜上排名第一的专有智能体IBM CUGA(运行GPT-4.1)[5]。更广泛的结果声称,在智能体基准测试中增益10.6%,在领域特定基准测试中增益8.6%,同时相较于基线降低了86.9%的适应延迟[5]

IBM Research大约六个月后于2026年4月8日发布的回应则采取了不同的机制来实现类似目标。ALTK-Evolve是IBM Agent Lifecycle Toolkit的一部分,它将从过往智能体轨迹中学到的指南存储在一个库中,并运行后台的‘合并与评分’任务,以合并重复项、修剪弱规则并推广已被验证的策略[6]。与单一持续演化的文档不同,ALTK-Evolve构建了一个由离散、可检索实体(如指南、政策、标准操作流程)组成的库,按任务查询。其AppWorld数据显示综合准确率从50.0%提升至58.9%,但更值得关注的是增益的分布:复杂多步骤任务的准确率从19.1%跃升至33.3%,相对提升了74%,而简单任务的提升则小得多[6]。两个系统追逐相同的基准并在相似的增益区间内落地,但设计哲学截然不同——ACE押注于单一持续精炼的文档同时承担记忆与推理支架的双重角色,IBM则押注于由独立合并过程构建的、可被策展和修剪的库。

厂商与实践者之间的鸿沟:高级用户如何偏离官方指南

Andrej Karpathy将上下文工程定义为‘以恰到好处的信息填充上下文窗口以推进下一步的微妙艺术与科学’[7],这一表述已成为行业的共同术语。但从业者在这一术语下的实际做法正日益背离厂商的指导方针。独立开发者指出,Claude Code内置的自动压缩相比‘有意压缩’(intentional compaction)——一种手动控制的替代方案——削弱了严肃工作的能力,并描述了通过严格遵循‘研究—计划—实施’的工作流,将上下文利用率控制在40%以下。这些开发者还报告称,在一次长达七小时的会话中,他们成功向一个包含30万行Rust代码的代码库提交了一次性拉取请求,并处理了3.5万行代码。

Reddit上的Claude Code社区也形成了类似的反主流立场,将其编码为SCRUB(子智能体、剪切/回滚、缩减/压缩、上传/交接、清除),明确将反应式压缩置于次要地位,优先采用主动生成子智能体和手动回滚,其理论依据是压缩会保留对话中已有的错误。另一条讨论线则认为,关于记忆架构的争论——图结构与向量数据库方法之争——无关紧要,真正关键的是决定哪些内容应被记录或遗忘的策管策略,而非所选的存储介质。这种批评与Anthropic自身的记忆工具显得格格不入,后者虽明确说明将笔记写入文件,却对智能体应如何判断哪些信息值得保留或丢弃保持沉默[8]。另一个关于赋予一组Claude智能体共享记忆的案例发现,通信更频繁的配置虽然共享状态最积极,但调用的API次数明显多于最终产出更优结果的版本——这直接表明,更多的记忆共享并不自动等于更好的记忆共享。

为何此时:上下文腐烂为趋势提供了实证依据

这一系列技术背后的紧迫性源于一个单一的实证发现:Chroma的Context Rot研究对包括GPT-4.1、Claude 4、Gemini 2.5和Qwen3在内的18个前沿模型进行了压力测试,发现随着输入长度增加,所有模型的可靠性都会下降,即使在执行简单任务时也是如此,且远未达到模型宣称的上下文窗口上限[4]。这将上下文管理重新定义为一个独立于上下文溢出的工程问题——仅监控token限制错误的团队会错过更常见的失效模式:模型在其输入增长过程中悄然退化。

两条独立的学术研究线为此发现提供了结构性响应,而非仅仅依赖压缩技巧。Plan-and-Act是加州大学伯克利分校和东京大学在ICML 2025发表的论文,它将智能体的认知过程分为规划器(Planner)模型生成高层计划和执行器(Executor)模型将这些计划转化为环境特定动作,使每个模型的上下文仅限于其自身职责,而非在一个窗口中累积规划与执行历史[9]。该方法在长期网页导航基准WebArena-Lite上达到了57.58%的最先进成功率,在纯文本WebVoyager基准上达到81.36%[9]。结合长期多轮会话中因工具调用和观察token累积而导致的每请求成本上升,Context Rot的研究发现为整个上下文工程趋势提供了比开发便利性更强的理由:一旦智能体运行时间足够长,其自身历史成为主要错误来源时,可靠性本身便岌岌可危[3]

历史背景

在社交媒体上普及了‘上下文工程’一词,将其作为提示工程的继任学科。
在arXiv上发布了Plan-and-Act论文,为长期智能体引入了明确的规划器/执行器上下文分离机制。
发布了其上下文工程框架,并于同日推出了测试版Claude API上下文编辑与记忆工具原语。
发布了ACE(Agentic Context Engineering)论文并在GitHub上开源了该框架。
发布并开源了ALTK-Evolve,这是Agent Lifecycle Toolkit中的一个记忆与指南学习系统,并附带AppWorld基准测试结果。

关键关系图

关键玩家
主题

AI智能体上下文与记忆工程技巧

事实来源

9 条引用
  1. [1] Effective context engineering for AI agents
  2. [2] Anthropic adds context editing and a memory tool to the Claude API
  3. [3] Claude Memory Tool Guide
  4. [4] Context Rot
  5. [5] ACE, Open-Sourced on GitHub
  6. [6] ALTK-Evolve
  7. [7] Karpathy Said Kill Prompt Engineering. Here's What He Actually Meant
  8. [8] Claude API Memory Tool documentation
  9. [9] Plan-and-Act: Improving Planning of Agents for Long-Horizon Tasks

来源文章

Top 5

THE SIGNAL.

Analysts

普及了‘上下文工程’一词,将其描述为以恰到好处的信息填充上下文窗口以推进下一步的微妙艺术与科学。

Andrej Karpathy
人工智能研究员,前OpenAI / 特斯拉
The Crowd

whoever leaked this has bigger balls than sense someone gave a fleet of Claude agents shared memory so they would stop contradicting each other, then measured both the bill and the output: the version that talked most made 2.4x the api calls of the version that won, and...

@@Argona0x2005

Did Stanford just kill LLM fine-tuning? This new paper from Stanford, called Agentic Context Engineering (ACE), proves something wild: you can make models smarter without changing a single weight. Here's how it works: Instead of retraining the model, ACE evolves the context...

@@akshay_pachaar762

NOT CLICKBAIT: THIS ANTHROPIC'S CONTEXT ENGINEERING POST IS F*CKING GOLD Context engineering is the next era of AI building. Not better prompts. Better curation of what lands in the window Context is finite with diminishing returns. Every token depletes attention. The goal:...

@@beamnxw48

What if AI memory worked like a brain instead of a vector database?

@u/mirkofr67
Broadcast
Context Engineering for Agents

Context Engineering for Agents

Advanced Context Engineering for Agents

Advanced Context Engineering for Agents

Anthropic Workshop: Build Agents That Run for Hours — Ash Prabaker & Andrew Wilson

Anthropic Workshop: Build Agents That Run for Hours — Ash Prabaker & Andrew Wilson