Anthropic发布Claude Opus 5,性能接近Fable-5但价格仅一半
TECH

Anthropic发布Claude Opus 5,性能接近Fable-5但价格仅一半

51+
Signals

战略概览

  • 01.
    Anthropic于2026年7月24日发布了Claude Opus 5,称其为性能最强且最具成本效益的模型,可在Claude.ai、Claude Code、Claude Cowork、Claude Max、Claude Pro及API中使用。
  • 02.
    Opus 5的定价为每百万输入token 5美元,每百万输出token 25美元,与前代Opus 4.8保持一致,而其基准测试性能已接近Fable 5,成本却约为后者的一半。
  • 03.
    Opus 5引入了一个可切换的‘努力程度’选项(低、中、高),让用户在成本与能力之间进行权衡,同时还提供‘快速模式’,价格为基础价格的两倍,推理速度约为2.5倍。
  • 04.
    Opus 5在ARC-AGI-3测试中得分为30.2%,远超此前任何模型的最高分(GPT-5.6 Sol的7.8%),相较Opus 4.8在相同基准上的表现提升了约20倍。
  • 05.
    Opus 5已成为Claude Max的默认模型以及Claude Pro上的最强模型,并于同日在GitHub Copilot的Pro+、Max、Business和Enterprise层级全面上线。
  • 06.
    尽管在多数基准测试中领先,Opus 5在网络安全和双重用途漏洞利用任务上仍落后于竞争对手模型Mythos 5。

为何Fable 5几乎刚起步就被超越

2026年7月24日,Anthropic发布了Claude Opus 5,称其“在价格仅为一半的情况下,接近Claude Fable 5的前沿智能水平”[1]。彭博社将此次发布直接解读为对成本效率的追求[2]:输入token每百万5美元,输出token每百万25美元,与Opus 4.8持平,尽管模型性能已逼近Anthropic自家旗舰。真正的故事在于发布时间。《财富》杂志指出,Opus 5是Anthropic在不到两个月内的第四次重大模型发布,紧随Mythos 5、Fable 5和Sonnet 5之后,这些模型均于2026年6月发布[3]

Anthropic自身的说法则提供了另一种不那么悲观的解读,与另一种时间压力相关。雅虎财经报道称,该公司正准备于2026年晚些时候进行IPO,并将Opus 5定位为能够证明其不仅在原始能力上,而且在成本上也能与OpenAI、Google和中国实验室竞争的证据[4]。Cognition公司CEO Scott Wu在使用Anthropic的FrontierCode 1.1调试基准测试该模型后表示,Opus 5“以一半的成本达到了接近Fable级别的性能”[4],而Anthropic负责研究的产品管理主管Dianne Penn向CNBC表示,企业买家现在会权衡价格与实际质量,而非默认选择最强的模型[5]。无论这是否反映了真正的效率提升,还是为IPO前战略性地压低Fable 5价格的决策,结果都是一样的:Anthropic最新的‘性价比’模型在其旗舰模型发布仅数周后,就开始侵蚀旗舰模型的市场空间。

Opus 5在ARC-AGI-3测试中30%的得分远超此前最佳

Opus 5在ARC-AGI-3测试中得分为30.2%,远超此前任何模型的最佳成绩——GPT-5.6 Sol的7.8%——约为Opus 4.8在相同基准上得分的20倍[6]。仅围绕这一跃升的标题,容易让读者将其视为通用推理能力实现质的飞跃的证据[6]

‘努力程度’切换功能比基准测试本身更具意义

除了模型本身,Anthropic还推出了三档‘努力程度’切换功能——低、中、高——允许用户根据任务在能力与成本之间进行权衡,同时还提供‘快速模式’,价格为基础价格的两倍,推理速度约为2.5倍[1][3]。Marketscale将这一功能对买家的实际影响总结为“为你的AI账单装上了一个调节旋钮”[7],早期企业数据也支持这一说法:Zapier CEO Wade Foster表示,Opus 5在公司内部的AutomationBench测试套件中达到了100%的通过率,且使用的token数并未超过早期Claude模型[4]

早期测试者更有趣的发现是,这一切换功能改变了最初值得购买的模型选择:一位早期测试者报告称,Opus 5在‘低努力’模式下的表现优于Sonnet 5在‘高努力’模式下的表现,尤其是在长周期的代理和编码任务中。如果这一现象在早期轶事性测试之外仍能成立,它将颠覆通常认为更便宜层级模型是经济默认选择的假设——现在,Anthropic最昂贵的模型调低设置后,反而能击败其调高设置的中端模型,这改变了那些优化支出而非仅选择标价更低模型的团队的决策逻辑。

基准测试的胜利未能平息实践者的质疑

发布当天的信号并非全是庆祝。Anthropic仍承认Opus 5在网络安全和双重用途漏洞利用任务上落后于竞争对手模型Mythos 5[8]。这延续了Anthropic自身发布历史中的模式:CNN报道称,Opus 4.6于2026年2月发布后,因市场对AI颠覆的担忧,引发了软件股的显著抛售[9],而Opus 5以更低的成本实现接近旗舰的性能,再次引发了市场对前沿能力被快速商品化的速度的疑问。

发布当天,从业者的反应也比基准测试图表所显示的更为复杂。在热烈报道ARC-AGI-3和编码得分的同时,实际测试者也报告了摩擦点——模型会与指令争辩或在任务完成前停止——这削弱了部分发布当天的基准测试热度,尽管GitHub已在VS Code、Visual Studio、JetBrains及其CLI和云代理工具中实现了当日Copilot集成,明确针对“需要仔细推理的复杂、长时间编码任务”[10]。基准测试的主导地位与早期实际表现的不一致,可能是检验Opus 5的价值主张是否成立的真正考验。

YouTube的报道分为三类:炒作、实测与付费验证

早期YouTube对Opus 5的报道并未统一叙事,而是分为三个截然不同的方向。观看次数最多的视频是Chase AI的《Opus 5刚刚发布,其数据确实惊人》(约5.4万次观看),最倾向于炒作基准测试数据,呼应了发布当天媒体报道的基调。BridgeMind的《用Claude Opus 5进行氛围编程》(约4.3万次观看)则采取了实践导向的方法,将发布视为可尝试的编程工具,而非仅报告分数。Nick Saraev的《我花了400美元测试Opus-5》(约2.5万次观看)更进一步,用真金白银独立验证模型的声明,而非重复Anthropic自身的基准数据。综合来看,这种分化——炒作、实测演示与付费验证——表明早期采用者已从多个角度测试Opus 5的声明,而非不加批判地接受发布当天的数据。

历史背景

发布Claude Opus 4.1,作为Opus 4的即插即用替代品,提升了编码和代理性能。
发布Claude Opus 4.5,当时最智能的Anthropic模型,在编码、代理和计算机使用方面树立了新标准。
发布Claude Opus 4.6,因AI颠覆担忧, reportedly 引发软件股显著抛售。
发布Claude Opus 4.7,提升了编码、视觉和多步专业知识工作能力。
发布Claude Opus 4.8,强化了编码、代理任务和长时间自主工作能力。
发布Mythos 5、Fable 5和Sonnet 5,使Opus 5成为该公司不到两个月内的第四次重大模型发布。
发布Claude Opus 5,这是迄今为止性价比最高的Opus模型,并于当日集成至GitHub Copilot。

关键关系图

关键玩家
主题

Anthropic发布Claude Opus 5,性能接近Fable-5但价格仅一半

事实来源

10 条引用
  1. [1] Introducing Claude Opus 5
  2. [2] Anthropic Unveils More Cost-Efficient Model for Everyday Tasks
  3. [3] Anthropic debuts Claude Opus 5 with feature that lets users toggle between cost and capability
  4. [4] Anthropic debuts Opus 5 model as company preps for IPO later this year
  5. [5] Anthropic's Claude Opus 5 arrives near Fable 5 performance at half the cost
  6. [6] Claude Opus Scores 30% On ARC-AGI 3, Triples Previous Best Score By Any Model
  7. [7] Anthropic Launches Claude Opus 5 and Puts a Dial on Your AI Bill: Here's What It Means for B2B Teams
  8. [8] Anthropic Unveils Claude Opus 5 At Half The Cost Of Fable 5
  9. [9] Anthropic Opus update triggers software stock selloff
  10. [10] Claude Opus 5 is now available in GitHub Copilot

来源文章

Top 5

THE SIGNAL.

Analysts

向CNBC表示,企业客户更看重价值而非价格本身——更便宜的模型只有在保持可比质量的情况下才重要。

Dianne Penn
Anthropic研究产品管理主管

表示Opus 5在Zapier内部自动化基准测试中实现了完美通过率,且使用的token数未超过之前的Claude模型。

Wade Foster
Zapier首席执行官

表示Opus 5以一半的成本达到了接近Fable 5级别的编码性能,在调试和根本原因分析方面表现尤为突出。

Scott Wu
Cognition(Devin开发者)首席执行官
The Crowd

Introducing Claude Opus 5. It's a thoughtful and proactive model that comes close to the frontier intelligence of Fable 5 at half the price.

@@claudeai51103

BREAKING: Claude Opus 5 is OUT NOW! And…it’s a hard model to love. We’ve spent the last week @every testing it across coding, writing, knowledge work, and our internal agent. It argued with instructions, stopped before the work was finished, and generally didn’t play well

@@danshipper2041

claude opus 5 vs fable 5 vs gpt 5.6 sol vs kimi k3 @AnthropicAI released claude opus 5 today. per the announcement, it's "a thoughtful and proactive model that comes close to the frontier intelligence of claude fable 5 at half the price." key facts from the release: • priced

@@thehypedotnews36

Introducing Claude Opus 5

@u/ClaudeOfficial2200
Broadcast
Opus 5 Just Dropped and Its Numbers Are Legit INSANE

Opus 5 Just Dropped and Its Numbers Are Legit INSANE

Vibe Coding With Claude Opus 5

Vibe Coding With Claude Opus 5

I Spent $400 Benching Opus-5. Here's What It Can Do

I Spent $400 Benching Opus-5. Here's What It Can Do

Anthropic发布Claude Opus 5,性能接近Fable-5但价格仅一半 — AI 新闻 | Agentic Brew