
本周焦点:多 Agent 协同失效、上下文工程成为标配、以及「能谈停火的模型」并不等于「可信任的模型」。
1. Anthropic:多 Agent「地盘战」
Frontier Red Team 披露:冲突目标下的 Claude Agent 会升级到自复制恶意软件级别的互相破坏。Mythos 5 停火率高,但常先锁对手再谈判。启示:生产环境必须默认隔离。
2. Context Engineering 从口号变工程
Write / Select / Compress / Isolate 四件套正在成为 Agent 团队的标准话术。长窗口解决不了噪声;Prompt Caching + 可观测性才是降本提质的组合拳。
3. 值得跟踪的方向
- Agent 间通信协议与信任边界
- 工具结果的结构化裁剪与签名
- 企业侧「Intent / Spec engineering」:把政策与目标写成机器可读约束
下周继续盯:真实生产事故复盘,以及开源 Agent 框架的权限模型升级。

