Anthropic 正式发布 Claude Sonnet 5,官方将其定位为"迄今最具 Agent 能力的 Sonnet 模型"——它能自主制定计划、使用浏览器和终端等工具,并以几个月前还需要更大更贵的模型才能达到的水平自主运行。本文基于 Anthropic 官方发布文章详细解读。
定位:缩小与 Opus 系列的差距
对很多开发者而言,Agentic AI时代正是从Sonnet系
模型开始的:Claude Sonnet 3.5、3.6、3.7首次在编码
和工具使用上展现出令人印象深刻的能力。但最近一段
时间,Agent能力上最明显的提升都出现在Opus系模型
上。
Sonnet 5 的目标很明确——缩小这个差距。官方表述是:"性能接近 Opus 4.8,但价格更低。"相比上一代 Sonnet 4.6,Sonnet 5 在推理、工具使用、编码和知识型工作等关键 Agent 性能维度上都有实质性提升。
定价与可用性
上线时间:即日起
可用范围:
- Free、Pro计划:默认模型
- Max、Team、Enterprise:可选
定价:
$2 / 百万输入token
$10 / 百万输出token
API调用:claude-sonnet-5
值得注意的是 Sonnet 5 现在是 Free 和 Pro 计划的默认模型——这意味着大量普通用户无需任何额外操作,就能直接用上这一代最新的 Agent 能力更强的 Sonnet。
性能评测:effort 档位下全面碾压前代
对比评测:
- BrowseComp(agentic search评测)
- OSWorld-Verified(computer use评测)
对比对象:Sonnet 5 vs Sonnet 4.6 vs Opus 4.8
(不同effort档位下)
官方给出的图表显示,Sonnet 5 相比 Sonnet 4.6 是"严格意义上的全面提升",并且比 Opus 4.8 覆盖了更广的性价比区间——在中等 effort 档位下,Sonnet 5 的成本效率大幅提升;在更高 effort 档位下,其表现在部分任务上可以匹配 Opus 4.8。用户可以通过调整 Sonnet 5 与 Opus 4.8 之间的 effort 档位,找到成本与性能之间的最佳平衡点。
早期用户反馈:更"能扛事"
早期访问合作伙伴反馈的共同点:
Sonnet 5比前代更agentic——能完成此前Sonnet模型
会中途停下的复杂任务,会在没有被明确要求的情况下
自主检查自己的输出,而且这一切都发生在一个有吸引
力的价格点上
官方引用的多条客户证言中,几个具体案例值得关注:
- 某企业交给Sonnet 5一个两步任务——更新Salesforce
账户等级、给企业联系人发布上线公告——它端到端
完成了整个流程,这在过去经常会卡在中途
- 有测试者要求Sonnet 5调查一个bug,它在没有被
提示的情况下,自己写了一个复现测试、实现修复、
然后stash掉改动来确认bug复现——回退验证一次
性走完
- 某AI编程平台把Sonnet 5跑在了他们最有挑战性的
真实PR上,它能独立把每一个PR跑到测试通过、
可验证的结果,把工程师的精力解放出来专注于
判断、决策和最终签字确认
安全评估:更安全,但网络安全能力刻意受限
安全评估要点:
- Sonnet 5整体不良行为发生率低于Sonnet 4.6,在
Agent场景下总体更安全
- 在自动化行为审计中(覆盖大范围不良行为场景),
Sonnet 5表现优于Sonnet 4.6,但略逊于更强的Opus
4.8和Claude Mythos Preview
- 幻觉率和谄媚率均低于Sonnet 4.6
- 网络安全任务能力显著弱于Opus系列模型——官方
明确表示没有刻意在网络安全任务上训练Sonnet 5
在与 Mozilla 合作开发的 Firefox 浏览器漏洞利用评测中,Sonnet 5(在没有安全防护的情况下)从未能开发出一个完整可用的漏洞利用程序,但"部分成功"的比率略高于 Sonnet 4.6——官方认为这更可能是通用智能水平提升带来的副作用,而非专门针对性训练的结果(所有相关漏洞已在 Firefox 148 中修复)。
实战建议
1. Free/Pro用户无需任何操作,已自动用上Sonnet 5,
可以直接感受本次升级带来的Agent能力提升
2. 中等复杂度的多步骤自动化任务(如CRM更新+邮件
发送这类跨系统操作),是Sonnet 5相比前代提升
最明显的场景
3. 成本敏感但又需要接近Opus水准表现的团队,可以
通过调整effort档位在Sonnet 5和Opus 4.8之间
找到性价比平衡点,不必默认锁定更贵的Opus
4. 涉及安全相关或渗透测试类工作负载,仍建议使用
Opus系列模型,Sonnet 5在这类任务上被刻意限制
了能力上限
总结
Sonnet 5 延续了 Anthropic 一贯的"中量级模型越级挑战"打法——用更低的价格,换取过去只有旗舰模型才能提供的 Agent 自主性。对绝大多数日常编码、自动化办公和知识型工作场景,这可能是目前性价比最高的选择。
来源:Introducing Claude Sonnet 5 — Anthropic 官方博客