Claude Sonnet 5 正是我在 Fable 5 风波之后预期 Anthropic 会推出的模型:不如 Mythos 那样充满戏剧性,比微小的升级更实用,且明确旨在服务于日常代理工作。
Anthropic 于 2026 年 6 月 30 日推出了 Claude Sonnet 5。头条新闻并非 Sonnet 突然击败了所有 Opus 级别的模型。事实并非如此。真正有价值的故事在于成本效益。Sonnet 5 在代理任务上的表现大幅逼近 Opus 4.8,同时保持了 Sonnet 的定价,并成为许多 Claude 用户的新默认模型。
这对我使用 AI 代理的方式至关重要。我不太关心一次性聊天回答,更关心模型能否检查代码库、使用工具、保持任务专注,并在不造成混乱的情况下完成工作。
基准测试快照
Anthropic 的发布表格将 Sonnet 5 与 Sonnet 4.6 和 Opus 4.8 进行了对比。模式很清晰:Sonnet 5 相比 Sonnet 4.6 是一个真正的飞跃,但在一些最艰难的代理任务上,Opus 4.8 仍然领先。

| Benchmark | Sonnet 5 | Sonnet 4.6 | Opus 4.8 |
|---|---|---|---|
| --- | ---: | ---: | ---: |
| SWE-bench Pro | 63.2% | 58.1% | 69.2% |
| Terminal-Bench 2.1 | 80.4% | 67.0% | 82.7% |
| Humanity's Last Exam, no tools | 43.2% | 34.6% | 49.8% |
| Humanity's Last Exam, with tools | 57.4% | 46.8% | 57.9% |
| OSWorld-Verified | 81.2% | 78.5% | 83.4% |
| GDPval-AA v2 | 1618 | 1395 | 1615 |
最强的信号来自 Terminal-Bench 2.1。Sonnet 5 从 Sonnet 4.6 的 67.0% 跃升至 80.4%,接近 Opus 4.8 的 82.7%。这种差距的缩小对编程代理至关重要,因为终端工作会惩罚那些无法规划、恢复和使用工具的模型。
SWE-bench Pro 的表现则更为保守。Sonnet 5 相比 Sonnet 4.6 有所提升,但 Opus 4.8 仍然领先。我会将其解读为采购建议而非炒作答案:在常规代理运行中使用 Sonnet 5,而在额外可靠性值得付出更高价格的场景中保留 Opus。
成本效益才是真正的发布故事
Anthropic 还发布了 BrowseComp 和 OSWorld-Verified 在不同努力程度下的成本效益图表。这些图表比单一的总分更有用,因为 Sonnet 5 现在为团队提供了一个调节旋钮:在中等努力程度下花费更少,或在任务需要时推高努力程度。


这正是 Sonnet 级别模型应该获胜的领域。Opus 存在于更难的推理场景,但大多数工作流需要在可重复运行代理的价格点上获得足够的智能。调试、浏览器 QA、代码库检查、内容运营和小型自动化任务都受益于一个运行成本更低且不会中途丢失上下文的模型。
Anthropic 表示,Sonnet 5 在 2026 年 8 月 31 日之前提供 introductory API 定价,即每百万输入 token 2 美元,每百万输出 token 10 美元。此后,价格将调整为每百万 token 输入 3 美元,输出 15 美元。该标准价格与 Sonnet 4.6 每 token 的价格相匹配,但有一个陷阱:文档指出 Sonnet 5 使用了一种新的 tokenizer,对于相同的文本会生成约 30% 更多的 token。
因此,我不会称这次迁移自动具有成本中性。在将长期运行的代理从 Sonnet 4.6 迁移到 Sonnet 5 之前,我会重新计算 prompt 的 token 数量。
开发者面临的变化
模型 ID 为 `claude-sonnet-5`。Anthropic 将其描述为 Sonnet 4.6 的直接升级替代品,但文档列出了在实际应用中至关重要的行为变化。
首先,自适应思考(adaptive thinking)默认开启。如果您不传递 thinking 字段,Sonnet 5 仍会以自适应思考模式运行。您可以禁用它,但默认设置已更改。
其次,手动扩展思考(manual extended thinking)已被移除。旧的 `thinking: { type: "enabled", budget_tokens: N }` 模式将返回 400 错误。Anthropic 希望开发者改用带有 effort 参数的自适应思考。
第三,非默认采样参数将被拒绝。将 `temperature`、`top_p` 或 `top_k` 设置为非默认值的请求将返回 400 错误。如果您的封装器自动设置采样默认值,这是一个真正的迁移问题。
好的一面是:Sonnet 5 默认支持 1M token 上下文窗口,并支持高达 128k 输出 token。对于代码库规模的工作和长上下文工作流,这为代理在编辑前提供了更多的检查空间。
安全与网络基准测试
Anthropic 将 Sonnet 5 定位为比 Sonnet 4.6 更安全的普通代理使用模型。发布文章称,Sonnet 5 的不良行为率低于 Sonnet 4.6,并且在代理上下文中更安全。
网络图表显示了更重要的限制。Anthropic 表示并未刻意针对网络安全任务训练 Sonnet 5。在 Firefox 147 漏洞开发评估中,Sonnet 5 从未生成过一个完整可用的漏洞利用程序。其在可用漏洞利用成功率上得分为 0.0%,部分成功率为 13.2%。Opus 4.8 和 Mythos 5 在该评估中表现强得多,这正是 Anthropic 对高风险模型保持不同访问权限和护栏策略的原因。

这种定位很有意义。Sonnet 5 应该足够强大以胜任正常的编码和代理工作,但不应针对危险的网络能力进行优化。Anthropic 还表示,Sonnet 5 发布时默认启用了实时网络安全防护。
我的初步解读
我会将 Claude Sonnet 5 视为 Claude 代理的新默认主力模型。
它不是我会为每个艰难代码库问题选择的模型。Opus 4.8 在某些代理编码和计算机使用基准测试中仍然获胜。Fable 5 仍然是更具戏剧性的前沿故事。但 Sonnet 5 落在了大多数构建者实际感受到的市场部分:价格、上下文、工具使用以及代理是否能持续运行。
对于 Claude Code 来说,这可能是最有趣的角度。一个更便宜的模型可以运行更长时间、更好地使用工具,并在许多任务上接近 Opus,这改变了代理循环的经济性。您可以将 Opus 级别的模型保留用于审查、艰难调试或高风险变更,而使用 Sonnet 5 进行主要执行过程。
这就是我会首先测试它的方式:
一个在基准测试中得分很高的模型,仍然必须在真实工作流中表现良好。它必须读取当前文件,避免无关编辑,运行检查,并在下一步需要人类决策时停止。我在关于 Claude Code /loop 和 /goal 的文章→ 中写过这种操作风格。
结论
Claude Sonnet 5 看起来是 Anthropic 针对代理时代的成本效益答案。它缩小了与 Opus 4.8 的差距,而没有假装在所有地方取代它。
基准测试表明,它在终端工作、工具使用、计算机使用、知识工作和推理方面比 Sonnet 4.6 强大得多。文档指出开发者需要注意 token 计数、自适应思考和采样参数的变化。安全故事表明,Anthropic 希望 Sonnet 5 对日常代理来说功能强大,但不赋予其与 Opus 或 Mythos 相同的网络特征。
这是一个务实的发布。我将像一个务实的模型那样测试它。
