Claude 4.5 Sonnet 上线:百万上下文正式商用,Agent 时代加速
2025 年 9 月 29 日,Anthropic 正式发布 Claude Sonnet 4.5,定位为"全球最强 Agent 与编程模型"。这一次更新,Anthropic 罕见地一次性把"模型 + 开发工具 + IDE 扩展 + Agent SDK"打包推出,并正式将百万级 Token 上下文窗口开放给所有付费用户商用,意味着长上下文能力从"演示级"走向"生产级"。
一、核心定位:Agent、Coding、Computer Use 三冠王
Anthropic 在发布说明中给出了三个最具说服力的论断:
- 最强编程模型——在 SWE-bench Verified 评测中拿下当时的最高分;
- 最强 Agent 构建模型——能稳定驱动复杂的多步骤自主流程;
- 最强 Computer Use 模型——在 OSWorld 真实世界电脑操作评测中以 61.4% 登顶,4 个月前 Sonnet 4 的成绩仅为 42.2%。
尤其值得注意的是"30 小时持续专注"指标:Anthropic 内部测试中,Claude Sonnet 4.5 能在没有人工介入的情况下,对一个复杂多步骤任务保持 30 小时以上的连贯推理与执行能力。这彻底打破了"AI Agent 只能做短任务"的传统认知。
二、百万上下文:从 Beta 到 GA
百万 Token 上下文窗口(1M context window)早前以 Beta 形式在 Sonnet 4 中开放,而 Sonnet 4.5 的发布标志着这一能力正式进入**通用可用(GA)**阶段。
这意味着企业用户现在可以在生产环境里:
- 一次性喂入整本技术手册、完整代码仓库或长篇法律卷宗;
- 让模型在多轮长会话中保持对早期上下文的精准回忆;
- 将整个项目的代码、历史 issue、设计文档打包进一次调用里。
百万上下文改变了"模型如何使用信息"的范式:上下文不再是稀缺资源,而是"工作记忆"。这也直接驱动了下文要提到的 Context Editing 与 Memory Tool 这两项新功能。
三、定价与可用性
Sonnet 4.5 保持与 Sonnet 4 完全一致的 API 价格:
- 输入:$3 / 百万 Token
- 输出:$15 / 百万 Token
- Prompt Caching:最高节省 90% 成本
- Batch Processing:节省 50% 成本
- 美国境内推理:1.1x 定价
这条"性能大涨但不涨价"的策略,是 Anthropic 主动在企业市场抢占份额的关键手段。模型在 Claude API、Amazon Bedrock、Google Cloud Vertex AI 和 Microsoft Foundry 同步上线,开发者可直接通过 claude-sonnet-4-5 调用。
四、配套产品升级:Agent 工具链一气呵成
Sonnet 4.5 的发布并不是孤立的模型更新,而是一整套 Agent 工具链的集体亮相。
4.1 Claude Code 全面升级
- Checkpoints(检查点):在每次代码变更前自动保存状态,用户可通过
Esc Esc或/rewind命令即时回滚到任意历史状态; - Subagents(子代理):让一个 Agent 在执行时并行启动多个子 Agent 处理专门任务;
- Hooks(钩子):在特定节点自动触发动作,例如改动后跑测试、提交前 lint;
- Background Tasks(后台任务):让 dev server 等长生命周期进程不再阻塞 Agent 主流程;
- 原生 VS Code 扩展:在 IDE 侧边栏实时显示 diff 与修改建议。
4.2 Claude Agent SDK
Anthropic 把内部驱动 Claude Code 的核心工具、Context Management 系统与权限框架打包成 SDK,开放给第三方开发者。这意味着任何企业都可以基于"Anthropic 自己的 Agent 架构"构建自定义 Agent,金融合规、网络安全、代码调试等场景的 Agent 创业公司会率先受益。
4.3 Claude for Chrome
浏览器扩展正式对 Max 计划用户开放,结合 Sonnet 4.5 的 Computer Use 能力,可以让 Agent 直接在浏览器里完成竞品分析、采购流程、用户引导等任务。
4.4 Context Editing 与 Memory Tool
新增的上下文编辑与记忆工具让 Agent 可以"管理自己的工作记忆"——自动剔除冗余信息、把长期事实写入持久化记忆,从而使 Agent 能在更长任务中保持稳定表现。
五、基准与对齐
- SWE-bench Verified:当时 SOTA(前沿最优);
- OSWorld:61.4%(4 个月前 Sonnet 4 为 42.2%);
- 推理与数学:在多项评估中显著提升;
- Alignment:Anthropic 称之为"迄今为止最对齐的前沿模型",在多个对齐维度上较前代明显改善;
- 专家盲评:金融、法律、医学、STEM 领域的专家反馈,Sonnet 4.5 在专业知识深度上明显优于更早的模型,包括 Opus 4.1。
客户反馈同样亮眼:GitHub Copilot 报告多步推理与代码理解显著提升;Cursor 验证了更长视野任务的稳定性;Thomson Reuters 旗下的 CoCounsel 报告在复杂诉讼任务中达到 SOTA;Block 把安全 Agent 的漏洞平均发现时间缩短 44%、准确率提升 25%。
六、对企业的意义
- 长上下文商用化降低了"分段拼接 + 检索增强(RAG)"的工程复杂度,许多原本需要外挂向量数据库的场景,现在可以由原生上下文完成。
- Agent 工具链标准化让企业不必自研"循环调用、状态管理、权限隔离"这些基础能力,直接复用 Anthropic 已经验证的 Agent SDK。
- 不涨价的性能升级意味着企业可以零成本迁移到 Sonnet 4.5,享受更稳的 Agent、更准的代码与更长的任务续航。
七、局限与展望
需要注意的是:30 小时持续专注并不意味着 30 小时零错误,长任务中的"幻觉"和"目标漂移"仍是 Agent 工程的难点;Sonnet 4.5 也并未在多模态生成(图像/视频)方向有显著突破。
整体来看,Sonnet 4.5 不只是一次"模型升级",而是 Anthropic 把"Agent 操作系统"从概念落到产品级 API 的关键一步。它给业界带来的启示很清晰:模型竞赛的下半场,Agent 工具链与上下文工程将与原始模型能力同等重要。
参考来源:
- Anthropic 官方发布说明:Introducing Claude Sonnet 4.5(anthropic.com)
- Anthropic 官方:Enabling Claude Code to work more autonomously(anthropic.com)
- Anthropic 模型总览页:Claude Sonnet 产品矩阵(anthropic.com/claude/sonnet)
- Anthropic Engineering:Building agents with the Claude Agent SDK