
Prompt engineering 关心「这一句怎么说」;Context engineering 关心「模型在推理那一刻到底看见了什么」。2026 年,生产级 Agent 失败的第一原因,往往不是模型不够强,而是上下文被塞烂了。
把窗口当成稀缺资源
百万 token 窗口不会自动解决问题。噪声、重复工具输出、过期对话、低相关检索结果,都会稀释注意力预算。原则只有一条:用最少的高信号 token,换最高的任务成功率。
四条生产策略
- Write(外置):把笔记、计划、长日志写到
NOTES.md/ 数据库,需要时再拉回。 - Select(精选):按步骤即时检索,而不是一次塞五十条相似片段。
- Compress(压缩):窗口将满时做高保真摘要,保留决策、未解 bug 与当前状态。
- Isolate(隔离):子 Agent 各自干净上下文,只向主 Agent 回传浓缩结论。
立刻能落地的 checklist
- 系统提示 + 工具定义放在稳定前缀,打开 Prompt Caching
- 工具返回先裁剪再入窗,禁止整页 HTML / 全表 dump
- 给每次推理做 token 审计:谁贡献了哪些段落?
- 用 OpenTelemetry GenAI 规范做可观测性,否则无法 debug「模型为什么胡说」
模型智商相对固定,上下文是你能控制的变量。谁管好上下文,谁就管住了 Agent 行为。



