资讯

Claude Opus 5 发布:以一半价格逼近 Fable 5 的前沿智能

Anthropic 发布 Claude Opus 5,编程和知识工作评测登顶业界最佳,价格与 Opus 4.8 持平。详解基准测试数据、真实案例和定价可用性。

2026/8/66分钟 阅读ClaudeEagle

2026 年 7 月 24 日,Anthropic 发布了 Claude Opus 5,距离上一代 Opus 4.8 发布仅过去两个月。这次更新的核心卖点非常直接——以一半的价格,逼近旗舰模型 Fable 5 的前沿智能水平。本文基于官方公告梳理这次发布的核心信息。

定位:每天都能用得起的高智能模型

Claude Opus 5 is available today. It's a thoughtful and proactive model that comes close to the frontier intelligence of Claude Fable 5 at half the price.

官方公告用「thoughtful and proactive(深思熟虑且主动)」来形容 Opus 5,并强调它被设计为可以每天使用的模型——工作效率高于其他模型。它现在是 Claude Max 的新默认模型,也是 Claude Pro 上最强的模型

基准测试表现:编程和知识工作双双登顶

在编程和知识工作类评测(如 Frontier-Bench、GDPval-AA)上,Opus 5 已经是新的业界最佳水平(state-of-the-art),不过在网络安全任务上仍落后于 Mythos 5。

几个具体数据点:

  • Frontier-Bench v0.1:Opus 5 超越所有其他模型,性能是 Opus 4.8 的两倍以上,且单任务成本更低
  • CursorBench 3.2:在最大 effort 设置下,与 Fable 5 峰值分数的差距仅 0.5%,但成本只有一半;在 high/xhigh/max 等 effort 档位上,单位成本下的表现优于所有其他模型
  • ARC-AGI 3(要求模型解决全新问题的评测):Opus 5 分数是次优模型的 三倍
  • Zapier AutomationBench(衡量模型能否从头到尾完成业务任务):Opus 5 通过率约为次优模型的 1.5 倍(相同单任务成本下);即便在最低 effort 设置下,通过的任务数依然比其他任何模型都多
  • OSWorld 2.0(计算机使用基准):Opus 5 在任意成本水平下都优于其他模型,仅用略高于三分之一的成本就超越了 Fable 5 的最佳成绩

科学研究能力显著提升

Opus 5 在生命科学相关评测(结构生物学、有机化学、生物信息学)上全面优于 Opus 4.8。提升最明显的两项:

  • 有机化学任务(比如从光谱数据推断分子结构):内部基准分数比 Opus 4.8 高 10.2 个百分点
  • 蛋白质相关任务(比如预测蛋白质序列变异如何影响其功能):高 7.7 个百分点

三个体现「主动性和严谨性」的真实案例

官方公告给出了几个颇具说服力的早期测试案例:

案例一:无法直接看图,自己写视觉识别代码

在一项 Frontier-Bench 任务中,Opus 5 拿到一张机械零件的手绘图,被要求写代码在 FreeCAD 中重建 3D 模型——但任务刻意不给模型直接查看图纸的能力。Opus 5 的应对方式是自己写了一套计算机视觉流水线,从原始像素中提取几何信息,然后重建出完整的零件模型,并且能够重复稳定地完成——同样设置下,没有任何竞品模型能在五次尝试内解决这个问题。

案例二:修复根因,而非表面症状

面对一个知名开源包管理器中的真实 Bug,Opus 5 找到了根本原因,并修复了社区补丁遗漏的一个边界情况。而竞品模型只修复了表面症状(未触及底层原因),却报告说 Bug 已解决。

案例三:没有实时数据可验证,自己搭测试框架

一家交易公司的工程师用 Opus 5 在单次会话中为一个新交易所搭建了行情数据源——此前的模型即便拿到详细方案也完全无法完成这项任务。由于没有实时数据源可用于验证,Opus 5 甚至自己搭建了一套测试框架,用来验证代码是否正确解析了交易所的数据。

早期客户的真实反馈

官方公告引用了多家早期接入客户的评价,节选几条有代表性的:

Claude Opus 5 topped Zapier's AutomationBench leaderboard without spending more tokens than prior Claude models. It took a raw account-health workbook and ran a full churn-prevention sequence end to end... Previous models didn't pass; Opus 5 hit 100%.

Claude Opus 5 came out ahead of every model in its family on our internal evals... up 22% over Opus 4.7, it's steadier, with far less variance run to run. For the millions of builders on Lovable, that consistency is the whole game.

Claude Opus 5 is the biggest leap in the Opus family since 4.5. On the same full-stack app builds, the front end shows it first: the best animations, games, and 3D work we have seen from an Opus model.

一位来自金融研究领域的用户评价:Opus 5 在数值推理、表格处理、以及需要精确度的批判性思维上表现突出,是他们日常financial research 工作流的明显提升。

定价与可用性

价格:与 Opus 4.8 完全一致 输入:$5 / 百万 token 输出:$25 / 百万 token Fast mode:$10 / $50 每 Mtok 上下文窗口:1M token(原生支持) 默认状态:Claude Max 默认模型;Claude Pro 上最强可选模型 可用平台:今天起,所有平台已全量开放

值得注意的是,Opus 5 是在与 Opus 4.8 完全相同的价格下实现了这些性能提升——这意味着几乎没有理由继续使用 Opus 4.8。

同批发布的两个 API 级更新

Anthropic 同一天还发布了两个面向开发者的 Claude Platform 更新:

  • 对话中途切换工具(Mid-conversation tool changes):开发者现在可以在对话进行中更改 Claude 可用的工具集合,且不会使 Prompt Cache 失效
  • 自动降级(Automatic fallbacks):当 Opus 5 或 Fable 5 的安全分类器拦截某个请求时,可以选择让请求自动路由到另一个模型,而不是直接被拒绝——开启后,API 请求默认总会路由到当前可用的最佳模型,而不是被简单地阻断

总结

Opus 5 延续了 Anthropic 近期「用更低成本逼近前沿智能」的产品策略——继 Sonnet 5 之后,Opus 系列也完成了一次同价位大幅提质的迭代。对于日常依赖 Opus 处理复杂编程和知识工作任务的用户来说,这是一次没有理由拒绝的免费升级:同样的价格,明显更强的推理能力、更稳定的多轮任务表现,以及更强的科学计算能力。


来源:Introducing Claude Opus 5 — Anthropic 官方公告

相关文章推荐

资讯Claude Opus 4.8 最新更新:1M 上下文、Fast Mode 和 Agent 编程改进Anthropic 发布 Claude Opus 4.8,面向复杂推理、长程 Agent 编程和高自治工作负载,带来 1M 上下文、Fast Mode、prompt cache 门槛降低和更好的工具触发。2026/6/6资讯Claude Opus 4.7 正式发布:编程能力大幅提升,CursorBench 得分 70% vs Opus 4.6 的 58%Claude Opus 4.7 发布详解:CursorBench 得分从 58% 跳至 70%,Rakuten 生产任务解决数 3×,XBOW 视觉精度从 54.5% 跳至 98.5%。覆盖新增 xhigh 努力级别、/ultrareview 命令、Auto Mode 扩展,以及从 Opus 4.6 迁移的 Token 使用变化注意事项。2026/4/22资讯Claude Opus 4.6 深度解析:1M Token 上下文、SWE-bench 72.5%,AI 编程进入新阶段Claude Opus 4.6 深度解析:1M Token 上下文(Beta)、SWE-bench 72.5%,三大改进(谨慎计划/多步骤稳定/自我 review),以及何时选 Opus 而不是 Sonnet 的成本与性能权衡。2026/4/12资讯Claude Opus 4.6 正式发布:Terminal-Bench 第一、1M 上下文、Agent Teams 全面升级Anthropic 发布 Claude Opus 4.6:Terminal-Bench 2.0 第一、Humanity's Last Exam 最高分、1M Token 上下文窗口。同步推出自适应思考、上下文压缩、Agent Teams 等重磅 API 功能。Notion、GitHub、SentinelOne 等 20+ 合作伙伴确认超越前代。2026/2/28资讯Claude Sonnet 4.6 正式发布:编程能力大幅提升,1M 上下文窗口上线Anthropic 发布 Claude Sonnet 4.6,编程能力全面跃升,在 Claude Code 中 70% 的用户更偏好它而非 Sonnet 4.5,OSWorld 计算机使用得分从 15% 飙升至 72.5%,同时带来 1M Token 上下文窗口、自适应思考和上下文压缩等新功能。2026/2/28资讯Anthropic 2026 年 7 月产品线全景:Claude Science、Reflect、Cowork 扩容与 Fable 5 复出一文汇总 Anthropic 2026年6月底至7月初的密集产品更新:面向科学家的全新工作台 Claude Science、AI 使用习惯反思工具 Claude Reflect、Cowork 正式登陆移动端和 Web、以及 Fable 5 出口管制风波的终章,并梳理这些更新背后串联起来的产品战略主线。2026/7/13