Claude Opus 5 发布:基准测试与定价
TECH

Claude Opus 5 发布:基准测试与定价

27+
Signals

战略概览

  • 01.
    Anthropic 于 2026 年 7 月 24 日在 Claude Max、Pro 和 API 上同步推出 Claude Opus 5,上下文窗口达 100 万 token,定价与前代 Opus 4.8 相同,为每百万输入/输出 token 5 美元/25 美元(快速模式价格翻倍)[1]
  • 02.
    该模型在主要基准测试中领先或几乎追平竞品 Fable 5——在 Frontier-Bench 上得分超过 Opus 4.8 的两倍,在 CursorBench 上以每任务一半的成本达到 Fable 5 99.5% 的水平,并在 ARC-AGI 3 上得分约为次优模型的三倍。
  • 03.
    Anthropic 预计 Opus 5 的安全分类器触发频率比 Fable 5 低约 85%,从而减少编码过程中的误拒,并同时推出一项可选的“自动降级”功能,将被拦截的请求路由至较弱模型。
  • 04.
    Zapier、Box 和 Cognition 的 Devin 等早期企业部署已报告具体的工作流提升,Opus 5 也是 Anthropic 在不到两个月内发布的第四款 Claude 5 代模型。

深度分析

以 Opus 的价格实现前沿智能:基准测试的真实表现

Anthropic 的基准测试主张在成本维度上异常具体,而不仅仅是原始能力。在 Frontier-Bench v0.1 上,Opus 5 的得分超过前代 Opus 4.8 一倍以上,同时每任务成本更低 [1]。独立基准测试网站 MarkTechPost 记录了该主张背后的精确数据:Opus 5 得分为 43.3%,Opus 4.8 为 18.7%,Fable 5 为 33.7% [2]。在 CursorBench 3.2 的最大努力模式下,Opus 5 以每任务成本一半的代价,得分与 Fable 5 的峰值仅相差不到 0.5 个百分点 [1];在计算机操作基准 OSWorld 2.0 上,它以约三分之一的成本超越 Fable 5 的最佳成绩 [1],MarkTechPost 的拆解显示其得分为 70.57% [2]。Artificial Analysis 自主的知识工作评估 AA-Briefcase 将 Opus 5 定位在 1,720 Elo 分数——领先 Fable 5 的 1,574 分 146 分,分析质量 Elo 分数高出近 300 分 [3]。在所有列出的基准测试中,模式一致:Opus 5 无需全面击败 Fable 5 即可成为更具吸引力的选择,它只需以极低的成本接近其水平即可,而其定价与所取代的 4.8 代模型完全相同。

更少的拒绝、更紧的护栏——以及一次仍出现误判的案例

Anthropic 表示,预计 Opus 5 的安全分类器触发频率比 Fable 5 低约 85% [1],独立分析师 Zvi Mowshowitz 对系统卡的解读证实了这一转变的规模:FrontierBench 会话中,分类器干预从 42% 的试验下降至 5% [4]。同一系统卡分析报告称,提示注入攻击成功率从 5.5% 降至 2.0%,在启用扩展思维后,计算机操作攻击成功率从 7.14% 降至 0.54% [4]——Anthropic 将 Opus 5 定位为其迄今为止最对齐的模型,而不仅仅是“最不烦人”的模型。Anthropic 还推出了可选的“自动降级”功能,将被拦截的请求路由至较弱模型而非直接拒绝 [5],这隐含承认了即使更严格的分类器仍会偶尔误判。社区对护栏变更的反应两极分化:许多人认为该模型更宽松,误拒更少,但也有声音强烈指出——尤其是从事合法安全和网络测试工作的用户——分类器仍会拦截无害请求,直到通过 Anthropic 自身的验证渠道才得以解决。85% 的平均降幅仍只是平均值,而非对任何看似对抗性提示的个体保证。

这究竟是重大突破还是渐进式更新?反向解读

并非所有评测者都完全接受基准测试的叙事。代码审查供应商 CodeRabbit 进行了独立测试,发现其在可操作审查意见上的精确度确实有所提升(39.3% 对比前代的 35.2%),但也发现 Opus 5 漏掉了部分此前能捕捉到的已知问题,并生成了约四倍的低价值‘吹毛求疵’评论 [6]——这提醒我们,基准测试的提升与日常实用性并不总是一致。Every 在一周实际使用后的上手评测称该模型‘灵光闪现,实操却令人沮丧’[7],指出其与为早期 Claude 版本构建的现有技能和插件存在摩擦。更广泛的社区情绪也反映了这种分裂:一方面对成本调整后的基准提升充满热情,另一方面 Reddit 上也有讨论称赞 Opus 5 Low 在更宽松的护栏下击败了 Sonnet 5 High,同时抱怨发布时使用限额未重置——这都表明‘登顶排行榜’与‘对日常用户而言是明确升级’并非同一主张。

现实世界验证与两个月内四次发布的节奏

脱离基准测试,早期企业集成提供了第二个更接地气的数据点。Cognition 的 CEO Scott Wu 表示,Opus 5 在其 Devin 编码代理内部以一半成本达到了接近 Fable 水平的性能,尤其在调试和根因分析方面表现突出 [8]。Zapier 的 CEO Wade Foster 报告称,该模型在未消耗比此前同价 Claude 版本更多 token 的情况下,登顶了其内部 AutomationBench 排行榜 [9]。Box 集成 Opus 5 后测量到整体性能比 Opus 4.8 提升 8%,其中数据分析(11%)和尽职调查工作流(17%)的提升尤为显著 [10]。这些数字比任何单一基准测试都更重要,因为它们来自生产工作负载,而非精心策划的测试套件。它们也嵌入在一个更广泛的模式中:Opus 5 是 Anthropic 在不到两个月内发布的第四款 Claude 5 代模型 [11],这种发布节奏更像在成本、速度和可靠性上的持续迭代,而非单一的重磅发布——这正是企业买家当前最关心的维度。

历史背景

发布了前代模型 Opus 4.8,其定价(每百万 token 5 美元/25 美元)与 Opus 5 完全相同。
在不到两个月内推出 Claude Opus 5,作为其第四款 Claude 5 代模型发布,定位为以约一半每任务成本实现接近 Fable 5 智能水平的模型。

关键关系图

关键玩家
主题

Claude Opus 5 发布:基准测试与定价

AN

Anthropic

模型开发者与发布方;在 Claude Max、Pro 和 API 上同步推出 Opus 5,将其定位为成本高效的近前沿模型,作为其顶级 Fable 5 模型的替代选择。

CO

Cognition (Devin)

编码代理供应商;CEO Scott Wu 表示 Opus 5 在 Devin 内部以一半成本接近 Fable 水平的性能,在调试和根因分析方面尤为突出。

ZA

Zapier

自动化平台;CEO Wade Foster 报告称 Opus 5 在未比此前 Claude 版本消耗更多 token 的情况下登顶其 AutomationBench 排行榜。

BO

Box

企业内容管理客户;集成 Opus 5 后报告其整体性能比 Opus 4.8 提升 8%,在数据分析和尽职调查工作流中提升更大。

CO

CodeRabbit

AI 代码审查供应商;独立评测 Opus 5,发现其在可操作审查意见上精确度更高,但漏掉更多已知问题,且比前代模型生成远更多的低价值吹毛求疵评论。

EV

Every

独立评测者;在首周实际使用中发现该模型‘灵光闪现,实操却令人沮丧’,指出其与现有技能和插件存在摩擦。

事实来源

11 条引用
  1. [1] Claude Opus 5
  2. [2] Meet the New Claude Opus 5: Frontier-Class Agentic Coding and Computer Use at Unchanged Opus Pricing
  3. [3] Anthropic Launches Claude Opus 5, Tops AI Benchmark Index at Half the Cost of Fable 5
  4. [4] Claude Opus 5: The System Card
  5. [5] Anthropic launches Opus 5
  6. [6] Opus 5 Model Review
  7. [7] Vibe Check: Opus 5
  8. [8] Claude Opus 5
  9. [9] Claude Opus 5 Release Details
  10. [10] Anthropic Launches Claude Opus 5 and Puts a Dial on Your AI Bill: Here's What It Means for B2B Teams
  11. [11] Anthropic releases new model Opus 5

来源文章

Top 3

THE SIGNAL.

Analysts

表示 Opus 5 在 Devin 内部以一半成本接近 Fable 水平的性能,尤其在调试和根因分析方面表现强劲。

Scott Wu
Cognition 首席执行官

报告称 Opus 5 在未比早期同价 Claude 版本消耗更多 token 的情况下,登顶了 Zapier 内部的 AutomationBench 排行榜。

Wade Foster
Zapier 首席执行官

深入分析了 Opus 5 的系统卡,强调了 FrontierBench 上安全分类器触发次数的下降。

Zvi Mowshowitz
独立 AI 安全分析师 / 通讯作者
The Crowd

Introducing Claude Opus 5. It's a thoughtful and proactive model that comes close to the frontier intelligence of Fable 5 at half the price.

@@claudeai60799

Just over 6 months later, Opus 5 now produces near-superhuman level spreadsheets and slide decks that match what a consultant would make. Things are changing fast.

@@alexalbert__3610

claude opus 5 vs fable 5 vs gpt 5.6 sol vs kimi k3 @AnthropicAI released claude opus 5 today. per the announcement, it's "a thoughtful and proactive model that comes close to the frontier intelligence of claude fable 5 at half the price." key facts from the release: • priced [thread continues, truncated by X's "Show more"]

@@thehypedotnews62

Introducing Claude Opus 5

@u/ClaudeOfficial2900
Broadcast
Claude Opus 5 Is INSANE – Is This the BEST Model Yet?

Claude Opus 5 Is INSANE – Is This the BEST Model Yet?

Opus 5 Is Here: It Beats Fable

Opus 5 Is Here: It Beats Fable

We Tested Claude Opus 5. It's Frustrating with Flashes of Brilliance.

We Tested Claude Opus 5. It's Frustrating with Flashes of Brilliance.

Claude Opus 5 发布:基准测试与定价 — AI 新闻 | Agentic Brew