资讯

Claude Sonnet 5 正式发布:史上最 Agentic 的 Sonnet,性能逼近 Opus 4.8 但价格更低

Anthropic正式发布Claude Sonnet 5:官方称其为迄今最具Agent能力的Sonnet模型,性能逼近Opus 4.8但价格仅$2/$10每百万token。已成为Free/Pro计划默认模型,附BrowseComp/OSWorld-Verified评测对比、13条客户实测证言、安全评估详情与effort档位选型建议。

2026/8/255分钟 阅读ClaudeEagle

Anthropic 正式发布 Claude Sonnet 5,官方将其定位为"迄今最具 Agent 能力的 Sonnet 模型"——它能自主制定计划、使用浏览器和终端等工具,并以几个月前还需要更大更贵的模型才能达到的水平自主运行。本文基于 Anthropic 官方发布文章详细解读。

定位:缩小与 Opus 系列的差距

对很多开发者而言,Agentic AI时代正是从Sonnet系 模型开始的:Claude Sonnet 3.5、3.6、3.7首次在编码 和工具使用上展现出令人印象深刻的能力。但最近一段 时间,Agent能力上最明显的提升都出现在Opus系模型 上。

Sonnet 5 的目标很明确——缩小这个差距。官方表述是:"性能接近 Opus 4.8,但价格更低。"相比上一代 Sonnet 4.6,Sonnet 5 在推理、工具使用、编码和知识型工作等关键 Agent 性能维度上都有实质性提升。

定价与可用性

上线时间:即日起 可用范围: - Free、Pro计划:默认模型 - Max、Team、Enterprise:可选 定价: $2 / 百万输入token $10 / 百万输出token API调用:claude-sonnet-5

值得注意的是 Sonnet 5 现在是 Free 和 Pro 计划的默认模型——这意味着大量普通用户无需任何额外操作,就能直接用上这一代最新的 Agent 能力更强的 Sonnet。

性能评测:effort 档位下全面碾压前代

对比评测: - BrowseComp(agentic search评测) - OSWorld-Verified(computer use评测) 对比对象:Sonnet 5 vs Sonnet 4.6 vs Opus 4.8 (不同effort档位下)

官方给出的图表显示,Sonnet 5 相比 Sonnet 4.6 是"严格意义上的全面提升",并且比 Opus 4.8 覆盖了更广的性价比区间——在中等 effort 档位下,Sonnet 5 的成本效率大幅提升;在更高 effort 档位下,其表现在部分任务上可以匹配 Opus 4.8。用户可以通过调整 Sonnet 5 与 Opus 4.8 之间的 effort 档位,找到成本与性能之间的最佳平衡点。

早期用户反馈:更"能扛事"

早期访问合作伙伴反馈的共同点: Sonnet 5比前代更agentic——能完成此前Sonnet模型 会中途停下的复杂任务,会在没有被明确要求的情况下 自主检查自己的输出,而且这一切都发生在一个有吸引 力的价格点上

官方引用的多条客户证言中,几个具体案例值得关注:

- 某企业交给Sonnet 5一个两步任务——更新Salesforce 账户等级、给企业联系人发布上线公告——它端到端 完成了整个流程,这在过去经常会卡在中途 - 有测试者要求Sonnet 5调查一个bug,它在没有被 提示的情况下,自己写了一个复现测试、实现修复、 然后stash掉改动来确认bug复现——回退验证一次 性走完 - 某AI编程平台把Sonnet 5跑在了他们最有挑战性的 真实PR上,它能独立把每一个PR跑到测试通过、 可验证的结果,把工程师的精力解放出来专注于 判断、决策和最终签字确认

安全评估:更安全,但网络安全能力刻意受限

安全评估要点: - Sonnet 5整体不良行为发生率低于Sonnet 4.6,在 Agent场景下总体更安全 - 在自动化行为审计中(覆盖大范围不良行为场景), Sonnet 5表现优于Sonnet 4.6,但略逊于更强的Opus 4.8和Claude Mythos Preview - 幻觉率和谄媚率均低于Sonnet 4.6 - 网络安全任务能力显著弱于Opus系列模型——官方 明确表示没有刻意在网络安全任务上训练Sonnet 5

在与 Mozilla 合作开发的 Firefox 浏览器漏洞利用评测中,Sonnet 5(在没有安全防护的情况下)从未能开发出一个完整可用的漏洞利用程序,但"部分成功"的比率略高于 Sonnet 4.6——官方认为这更可能是通用智能水平提升带来的副作用,而非专门针对性训练的结果(所有相关漏洞已在 Firefox 148 中修复)。

实战建议

1. Free/Pro用户无需任何操作,已自动用上Sonnet 5, 可以直接感受本次升级带来的Agent能力提升 2. 中等复杂度的多步骤自动化任务(如CRM更新+邮件 发送这类跨系统操作),是Sonnet 5相比前代提升 最明显的场景 3. 成本敏感但又需要接近Opus水准表现的团队,可以 通过调整effort档位在Sonnet 5和Opus 4.8之间 找到性价比平衡点,不必默认锁定更贵的Opus 4. 涉及安全相关或渗透测试类工作负载,仍建议使用 Opus系列模型,Sonnet 5在这类任务上被刻意限制 了能力上限

总结

Sonnet 5 延续了 Anthropic 一贯的"中量级模型越级挑战"打法——用更低的价格,换取过去只有旗舰模型才能提供的 Agent 自主性。对绝大多数日常编码、自动化办公和知识型工作场景,这可能是目前性价比最高的选择。


来源:Introducing Claude Sonnet 5 — Anthropic 官方博客

相关文章推荐

资讯Claude Opus 5 发布:以一半价格逼近 Fable 5 的前沿智能Anthropic 发布 Claude Opus 5,编程和知识工作评测登顶业界最佳,价格与 Opus 4.8 持平。详解基准测试数据、真实案例和定价可用性。2026/8/6资讯Claude Code v2.1.197 更新:默认模型切换为 Sonnet 5,原生 1M Token 上下文Claude Code v2.1.197 将默认模型切换为 Claude Sonnet 5,带来原生 100 万 Token 上下文窗口。本文解析此次升级的核心变化、对现有工作流的影响,以及升级和回退方法。2026/7/3资讯Claude Sonnet 5 正式发布:最强 Agentic Sonnet,性能逼近 Opus 4.8Anthropic 于 2026 年 6 月 30 日正式发布 Claude Sonnet 5,定位为最强 Agentic Sonnet。新模型在编程、工具调用、推理等关键维度大幅超越 Sonnet 4.6,性能逼近 Opus 4.8,同时保持更低价格,即日起成为 Claude 免费版和 Pro 版的默认模型。2026/7/1资讯Claude Opus 4.7 正式发布:编程能力大幅提升,CursorBench 得分 70% vs Opus 4.6 的 58%Claude Opus 4.7 发布详解:CursorBench 得分从 58% 跳至 70%,Rakuten 生产任务解决数 3×,XBOW 视觉精度从 54.5% 跳至 98.5%。覆盖新增 xhigh 努力级别、/ultrareview 命令、Auto Mode 扩展,以及从 Opus 4.6 迁移的 Token 使用变化注意事项。2026/4/22资讯Claude Opus 4.6 正式发布:Terminal-Bench 第一、1M 上下文、Agent Teams 全面升级Anthropic 发布 Claude Opus 4.6:Terminal-Bench 2.0 第一、Humanity's Last Exam 最高分、1M Token 上下文窗口。同步推出自适应思考、上下文压缩、Agent Teams 等重磅 API 功能。Notion、GitHub、SentinelOne 等 20+ 合作伙伴确认超越前代。2026/2/28资讯Claude Sonnet 4.6 正式发布:编程能力大幅提升,1M 上下文窗口上线Anthropic 发布 Claude Sonnet 4.6,编程能力全面跃升,在 Claude Code 中 70% 的用户更偏好它而非 Sonnet 4.5,OSWorld 计算机使用得分从 15% 飙升至 72.5%,同时带来 1M Token 上下文窗口、自适应思考和上下文压缩等新功能。2026/2/28