2026 年 7 月 24 日,Anthropic 发布了 Claude Opus 5,距离上一代 Opus 4.8 发布仅过去两个月。这次更新的核心卖点非常直接——以一半的价格,逼近旗舰模型 Fable 5 的前沿智能水平。本文基于官方公告梳理这次发布的核心信息。
定位:每天都能用得起的高智能模型
Claude Opus 5 is available today. It's a thoughtful and proactive model that comes close to the frontier intelligence of Claude Fable 5 at half the price.
官方公告用「thoughtful and proactive(深思熟虑且主动)」来形容 Opus 5,并强调它被设计为可以每天使用的模型——工作效率高于其他模型。它现在是 Claude Max 的新默认模型,也是 Claude Pro 上最强的模型。
基准测试表现:编程和知识工作双双登顶
在编程和知识工作类评测(如 Frontier-Bench、GDPval-AA)上,Opus 5 已经是新的业界最佳水平(state-of-the-art),不过在网络安全任务上仍落后于 Mythos 5。
几个具体数据点:
- Frontier-Bench v0.1:Opus 5 超越所有其他模型,性能是 Opus 4.8 的两倍以上,且单任务成本更低
- CursorBench 3.2:在最大 effort 设置下,与 Fable 5 峰值分数的差距仅 0.5%,但成本只有一半;在 high/xhigh/max 等 effort 档位上,单位成本下的表现优于所有其他模型
- ARC-AGI 3(要求模型解决全新问题的评测):Opus 5 分数是次优模型的 三倍
- Zapier AutomationBench(衡量模型能否从头到尾完成业务任务):Opus 5 通过率约为次优模型的 1.5 倍(相同单任务成本下);即便在最低 effort 设置下,通过的任务数依然比其他任何模型都多
- OSWorld 2.0(计算机使用基准):Opus 5 在任意成本水平下都优于其他模型,仅用略高于三分之一的成本就超越了 Fable 5 的最佳成绩
科学研究能力显著提升
Opus 5 在生命科学相关评测(结构生物学、有机化学、生物信息学)上全面优于 Opus 4.8。提升最明显的两项:
- 有机化学任务(比如从光谱数据推断分子结构):内部基准分数比 Opus 4.8 高 10.2 个百分点
- 蛋白质相关任务(比如预测蛋白质序列变异如何影响其功能):高 7.7 个百分点
三个体现「主动性和严谨性」的真实案例
官方公告给出了几个颇具说服力的早期测试案例:
案例一:无法直接看图,自己写视觉识别代码
在一项 Frontier-Bench 任务中,Opus 5 拿到一张机械零件的手绘图,被要求写代码在 FreeCAD 中重建 3D 模型——但任务刻意不给模型直接查看图纸的能力。Opus 5 的应对方式是自己写了一套计算机视觉流水线,从原始像素中提取几何信息,然后重建出完整的零件模型,并且能够重复稳定地完成——同样设置下,没有任何竞品模型能在五次尝试内解决这个问题。
案例二:修复根因,而非表面症状
面对一个知名开源包管理器中的真实 Bug,Opus 5 找到了根本原因,并修复了社区补丁遗漏的一个边界情况。而竞品模型只修复了表面症状(未触及底层原因),却报告说 Bug 已解决。
案例三:没有实时数据可验证,自己搭测试框架
一家交易公司的工程师用 Opus 5 在单次会话中为一个新交易所搭建了行情数据源——此前的模型即便拿到详细方案也完全无法完成这项任务。由于没有实时数据源可用于验证,Opus 5 甚至自己搭建了一套测试框架,用来验证代码是否正确解析了交易所的数据。
早期客户的真实反馈
官方公告引用了多家早期接入客户的评价,节选几条有代表性的:
Claude Opus 5 topped Zapier's AutomationBench leaderboard without spending more tokens than prior Claude models. It took a raw account-health workbook and ran a full churn-prevention sequence end to end... Previous models didn't pass; Opus 5 hit 100%.
Claude Opus 5 came out ahead of every model in its family on our internal evals... up 22% over Opus 4.7, it's steadier, with far less variance run to run. For the millions of builders on Lovable, that consistency is the whole game.
Claude Opus 5 is the biggest leap in the Opus family since 4.5. On the same full-stack app builds, the front end shows it first: the best animations, games, and 3D work we have seen from an Opus model.
一位来自金融研究领域的用户评价:Opus 5 在数值推理、表格处理、以及需要精确度的批判性思维上表现突出,是他们日常financial research 工作流的明显提升。
定价与可用性
价格:与 Opus 4.8 完全一致
输入:$5 / 百万 token
输出:$25 / 百万 token
Fast mode:$10 / $50 每 Mtok
上下文窗口:1M token(原生支持)
默认状态:Claude Max 默认模型;Claude Pro 上最强可选模型
可用平台:今天起,所有平台已全量开放
值得注意的是,Opus 5 是在与 Opus 4.8 完全相同的价格下实现了这些性能提升——这意味着几乎没有理由继续使用 Opus 4.8。
同批发布的两个 API 级更新
Anthropic 同一天还发布了两个面向开发者的 Claude Platform 更新:
- 对话中途切换工具(Mid-conversation tool changes):开发者现在可以在对话进行中更改 Claude 可用的工具集合,且不会使 Prompt Cache 失效
- 自动降级(Automatic fallbacks):当 Opus 5 或 Fable 5 的安全分类器拦截某个请求时,可以选择让请求自动路由到另一个模型,而不是直接被拒绝——开启后,API 请求默认总会路由到当前可用的最佳模型,而不是被简单地阻断
总结
Opus 5 延续了 Anthropic 近期「用更低成本逼近前沿智能」的产品策略——继 Sonnet 5 之后,Opus 系列也完成了一次同价位大幅提质的迭代。对于日常依赖 Opus 处理复杂编程和知识工作任务的用户来说,这是一次没有理由拒绝的免费升级:同样的价格,明显更强的推理能力、更稳定的多轮任务表现,以及更强的科学计算能力。
来源:Introducing Claude Opus 5 — Anthropic 官方公告