引言
Anthropic 给上下文工程(Context Engineering)下过一个精炼的定义:“在 LLM 推理期间,策展与维护最优 token 集合(信息)的策略集合”——包括系统提示词、用户输入、检索文档、相关对话历史、工具定义,以及 Agent 在会话之间存储的长期记忆。
一句话概括 2026 年的行业共识:精心设计的 Prompt 放进糟糕的上下文里照样失败,而一个设计良好的上下文系统能让平庸的 Prompt 也成功。 2026 年的行业报告显示,82% 的 IT 与数据负责人认为仅靠 Prompt 工程已无法支撑 AI 工作规模化——因为当任务从”单轮问答”变成”多步 Agent 任务”时,瓶颈从”怎么问”转移到了”给什么”。
一、为什么 Prompt 工程不够了
Prompt 工程解决”模型如何理解指令”,上下文工程解决”模型每次推理能看到什么”。两者在单轮场景几乎不可区分,但 Agent 场景立刻分道扬镳:
- Agent 一跑就是几十上百步,每一步的输入都是上一步的输出——上下文在持续自我生成;
- 上下文窗口有限,而 Agent 需要的信息(历史、检索、工具结果、中间推理)总量远超窗口;
- 每一步塞什么、丢什么、压缩什么,直接决定任务成败,而这已经不是”写提示词”能覆盖的问题。
二、核心策略:Write / Select / Compress / Isolate
LangChain 框架把上下文工程归纳为四个策略,2026 年已成为通用语言:
| 策略 | 含义 | 典型手段 |
|---|---|---|
| Write | 把中间结果显式写下来 | 结构化笔记、工作日志、任务清单,而不是只存在对话流里 |
| Select | 只选最相关的信息进上下文 | RAG 检索、工具结果裁剪、历史窗口化 |
| Compress | 窗口快满时浓缩 | 对话摘要、token 预算分配、上下文衰减 |
| Isolate | 隔离互不相关的上下文 | 子 Agent 独立上下文、分会话处理、命名空间隔离 |
其中 Isolate 是 2026 年被验证最有效的策略之一:与其把 10 个任务塞进一个上下文,不如拆成 10 个子 Agent 各管一段——这正是 Claude Agent SDK 的 subagents、OpenAI 的 handoffs 共同的底层逻辑。
三、长任务的两件套:Compaction 与结构化笔记
Anthropic 为”超出单窗口的长任务”给出的两个核心技巧:
- 压缩(Compaction):对话接近上下文上限时,让模型把已有内容总结成一份摘要,用新窗口继续——保持连贯而不丢失关键细节。关键在摘要的质量:按结构化要点(itemized bullets)压缩,而不是自由叙述,否则每压一轮细节就流失一轮。
- 结构化笔记(Structured Note-Taking):让 Agent 把进度与关键信息写到上下文之外(文件、记忆库),需要时再取回。笔记是持久的、可检索的、不会随窗口滚动被冲掉——这是 Agent”长跑不迷路”的根基。
这背后还有一个被 ICLR 2026 的 ACE(Agentic Context Engineering)论文直接点名的陷阱:上下文坍缩(Context Collapse)——Agent 反复重写自己的上下文时,每一轮都倾向更简短,多轮之后领域细节被抹平,Agent 逐渐”失忆”。ACE 的修复思路与 Anthropic 一致:用结构化要点 + 增量更新替代整段重写,让信息只增不减、只改不变。
四、检索与记忆:上下文工程的另外两条腿
- 按需检索(Just-in-time Retrieval):不是把所有资料都塞进窗口,而是用轻量标识符(文件路径、查询串)占位,模型真正需要时才把底层内容拉进来——这正是 Claude Code 等编码 Agent 管理仓库上下文的做法,也是”Select”策略的工程化。
- 长期记忆分层:工作记忆(上下文)+ 长期记忆(跨会话偏好/项目约定/历史摘要)分离,配合上面的记忆框架(Mem0/Letta/Zep,见本站《Agent 长期记忆 2026》)实现跨会话的上下文延续。
五、下一步:上下文图(Context Graph)
2026 年正在兴起的进阶形态是上下文图:不再把上下文当作扁平的 token 列表,而是显式建模”哪个文档引用哪个数据源、哪个 Agent 依赖哪个工具、哪条记忆被哪个任务引用”的关系网。Gartner 预测到 2028 年超过 50% 的 AI Agent 系统会使用上下文图——它能支撑更聪明的检索、冲突消解与上下文审计。
六、实践清单
- 给每个 Agent 任务设定明确的上下文预算(系统提示多少、检索多少、历史多少),超出即触发压缩或隔离;
- 中间产物落盘成结构化笔记(标题 + 要点 + 时间戳),别让 Agent 只靠对话流记忆;
- 压缩时用要点式摘要,定期人工抽查摘要质量,防止上下文坍缩;
- 多任务并行时优先 Isolate(子 Agent 隔离),而不是硬塞进一个窗口;
- 上下文即产品资产:把”给 Agent 什么”当成系统设计来迭代与测试,而不是写一次 Prompt 就交付。
结语
Prompt 工程是”对话的艺术”,上下文工程是”系统的设计”。当你的应用从 Chatbot 进化到 Agent——会跑几十步、会调用工具、会跨会话工作——决定成败的不再是那句 Prompt 写得多漂亮,而是每个推理时刻,模型眼前的信息是否恰好是最优的那一组 token。这门手艺,2026 年值得每个 AI 工程师系统性地补上。