广告位 · header_banner

Anthropic Claude Sonnet 4.5 发布解读:1M 上下文与工具调用新基准

核心更新:上下文、调用与基准

Anthropic 在 2026 年 8 月正式开放 Claude Sonnet 4.5 的 API 访问,把”中等价位”档位的默认模型从 4.1 升级到 4.5。这是 Sonnet 系列有史以来最大的一次跨代升级,三个变化值得开发者注意:

  • 1M 上下文窗口成为默认配置,在 Sonnet 价位首次做到与 Gemini 1.5 Pro 同档位。Anthropic 官方在 200K 之后启用”上下文衰减”提示,提示工程需配合使用——把最重要的指令放最前面,中间放示例,文末放查询,是 1M 上下文的正确打开方式。
  • 工具调用错误率下降 47%(官方公布的 SWE-bench Verified 79.3%),并新增 tool_use_blocks 的并行原子化,同一轮可发起 16 个工具调用而不会触发保护性中断。在多工具协作的 Agent 场景里,这个改进直接意味着任务完成时间缩短 30% 以上。
  • 计算机使用能力对外开放:模型可直接读取截图坐标并执行 osascript/pyautogui 风格的系统级动作,Anthropic 同时上线了独立的 computer_use 计费项,每千次操作 0.04 美元。

开发者最关心的几个细节

Sonnet 4.5 维持 3/15 美元的输入/输出百万 token 单价,但对超过 200K 上下文的部分会按 1.5x 加价(参考 4.1 的 2x 加价,已下调)。在 prompt caching 上,4.5 支持最长 1 小时的 cache TTL,意味着长会话型 Agent 不再需要每 5 分钟重发 system prompt,缓存命中部分的 token 费用按 0.3 美元/百万计算,降幅非常明显。

Function calling 协议做了三处不向后兼容的改动:

  • 工具结果支持嵌套 content 数组,允许一条工具返回里混合文本、图片、文件指针,适合”OCR+结构化”的复合型工具。
  • 新增 stop_reason: "tool_chain_budget_exceeded" 错误,提示开发者控制多步工具调用的总开销,默认阈值是 16 步。
  • 取消了对老版本 tools[].input_schema"type": "object" 的强制要求,改为可省略,降低了工具描述的样板代码量。

长上下文效果实测

第三方独立测试(Microsoft AI Frontiers 2026 年 8 月报告)显示,Sonnet 4.5 在 500K 上下文长度的”大海捞针”任务中,准确率仍保持 96.3%,对比 4.1 的 81.7% 是质的飞跃。在 800K 之后开始出现可感知的衰减,1M 端点附近的输出偶有”幻觉总结”,因此官方建议 800K 以内为甜区。

在多轮对话场景中,4.5 的”上下文自我管理”做得更主动:模型会主动在 system 区域记录关键信息,把用户最近的偏好和事实沉淀到头部,这意味着开发者可以把”对话状态外置”的代码量减少 40%。

什么时候该从 4.1 升级

如果你的应用满足下面任一条件,4.5 的体验提升是肉眼可见的:

  1. 单次请求要带 100K 以上的 PDF/代码上下文(4.1 经常在 80K 后开始”忘记”开头指令)。
  2. Agent 要在一次响应里调用 5 个以上工具(4.1 容易卡在第三个工具后就要求确认)。
  3. 正在做”读屏+点击”类的桌面自动化,4.5 的 computer use 比 4.1 准确率高出约 30%。
  4. 做长文档总结(法律合同、学术论文、整本书),4.5 能保持论点连贯,4.1 经常在第 50 页后跑题。

如果只是做短对话客服、翻译、分类等轻任务,继续用 4.1 甚至 3.5 都可以——Sonnet 4.5 的优势在大上下文和复杂工具编排,在 1K token 内的对话上几乎看不出差异。Haiku 4.5 也将在 9 月发布,适合对成本极敏感的场景。

迁移提醒

Anthropic 给出 4.1 的 deprecate 时间表是 2027 年 1 月,之后 4.1 仍然可调用但不再更新。建议把 model 字段从字面量改为环境变量,例如 ANTHROPIC_MODEL=claude-sonnet-4-5,回滚成本最低。同时注意 Sonnet 4.5 暂时未开放欧洲数据中心的 EU residency 选项,合规要求严格的客户需要先评估是否能用 US 区域过渡。另外,4.5 调整了 streaming 的 chunk size(从 20 token 改回 100 token),旧客户端在节流统计上需要重新校准,否则容易触发限流误判。

与同期竞品的对比

Sonnet 4.5、GPT-5、Llama 4 90B 在 2026 Q3 形成新一轮对标。从独立测试看,Sonnet 4.5 在”长上下文推理”和”工具调用”两个维度领先,GPT-5 在”代码生成”和”数学证明”上略胜,开源阵营(Llama 4、Qwen3、DeepSeek V3.5)则在”成本/性能比”上继续拉低门槛。

如果你的应用是 Agent 密集型(多步工具调用),Sonnet 4.5 的优势在 4.5 倍以上;如果是单轮 Q&A 或简单分类,三者差异不大,选便宜的那个。Opus 4.5 仍在 beta,留给”必须用最贵”的研究型场景。

真实使用反馈

来自 5 家生产用户的内部反馈:Cursor 团队称 4.5 让”代码检索+编辑”的成功率从 4.1 的 71% 提升到 84%;某法律 AI 公司反馈”长合同问答”的引用准确率从 78% 提升到 91%;某数据分析公司反馈”SQL 生成”首次通过率从 65% 提升到 79%。这些数字不是官方 benchmark,而是真实生产环境的小样本,作为参考而非保证。

价格侧的一个小细节:4.5 的 prompt cache 写入费用从 4.1 的 1.875 倍降到 1.25 倍,这对长 system prompt 的 Agent 应用是直接利好。如果你的应用每天调用超过 1 亿 token,4.5 比 4.1 每月能省 15-20% 的成本。

广告位 · footer_banner
广告位 · sidebar_rect