Claude Fable 5.1发布:基准测试领先但成本争议
TECH

Claude Fable 5.1发布:基准测试领先但成本争议

72+
Signals

战略概览

  • 01.
    Anthropic于2026年9月1日发布了Claude Fable 5.1和Claude Mythos 5.1。Fable 5.1已全面开放,而Mythos 5.1——与前者为同一底层模型但具备不同安全限制——仅限受邀的网络安全和生命科学组织使用。
  • 02.
    缓存读取(cache-read)定价下调75%,从每百万输入令牌1.00美元降至0.25美元,而基础输入定价(10美元/百万)和输出定价(50美元/百万)保持不变。
  • 03.
    Fable 5.1现已通过Anthropic的API(模型ID为claude-fable-5-1)、Amazon Bedrock/AWS、Google Cloud以及Microsoft Foundry/Azure提供。
  • 04.
    独立基准测试机构Artificial Analysis测得Fable 5.1(最大努力度)在其智能指数(Intelligence Index)中得分为66,为历史最高分,领先于Opus 5(63)、Fable 5(62)、GPT-5.6 Sol(61)和Grok 4.6(61)。

并非真正的折扣(在最大努力度下)

Anthropic的宣传重点是缓存读取定价下调75%,从每百万令牌1.00美元降至0.25美元,公司称这使典型工作负载成本降低约25%,高度代理型工作负载成本最多降低45%[4]。但这一说法在Artificial Analysis的独立测试中仅部分成立。该机构发现,在最大推理努力度下,Fable 5.1每项任务的实际成本比Fable 5高出约20%——分别为3.76美元与较低的基准相比;若无缓存读取折扣,成本将接近5.16美元[6]。原因是Fable 5.1在最大努力度下每项任务消耗的输出令牌约为1.7倍,而输出令牌仍按未变的每百万50美元计费,因此缓存读取的节省被额外生成所抵消。与最大努力度下的Opus 5(每任务2.34美元)相比,Fable 5.1的成本高出约61%。the-decoder.com的解读更为直接:缓存读取折扣确实在代理型工作负载中每任务节省近1.40美元,但这一节省仅在你不同时调高努力度时才成立[7]。独立LLM评测者Simon Willison在X上以轶事方式捕捉到同样的矛盾,指出Max思维层级为他生成了有史以来最好的SVG鹈鹕图像,但单次测试的‘高昂成本为3.30美元’。

一个模型,两套规则:Fable、Mythos与新的隐私技巧

Fable 5.1和Mythos 5.1并非两个不同模型——独立报道指出它们是同一底层系统,仅通过开启的安全限制不同而区分[2]。Mythos应用了针对网络安全和生命科学工作的安全限制,并仅限于经审核的、受邀的美国组织[1]。伴随发布,Anthropic推出了企业前沿安全限制(Enterprise Frontier Safeguards, EFS),这是一种隐私架构,允许客户将滥用监控数据存储在自有云基础设施上,同时Anthropic的检测系统仍能对其进行分析——明确宣称结合了零数据留存协议的隐私性与主动滥用检测[1]。安全限制调优似乎正朝着Anthropic期望的方向发展:与Fable 5相比,网络安全误报减少约60%,对良性生物学和医学问题的拒绝减少约85%[4]。但改进并未在实践中消除摩擦。Reddit上,生物科技、护理和药代动力学等受监管领域的专业用户报告称,在任务中途被自动降级至Opus 5;一段广受关注的构建日志视频描述了一次网络安全相关操作中,任务中途触发自动安全标志降级——表明新的安全限制调优仍可能将合法的专业工作纳入其范围。

真正提升的基准测试成绩:在上下文中解读终端基准(Terminal-Bench)的跃升

此次点版本发布的原始分数提升异常显著。Terminal-Bench-Science 0.1从Fable 5的24.7%跃升至Fable 5.1的52.6%,Terminal-Bench 4.0从42.0%升至55.8%(Mythos 5.1达到60.9%)[7]。AutomationBench也几乎翻倍,从17.1%升至31.4%[3]。这些提升使Fable 5.1在Artificial Analysis的智能指数中以66分位居榜首,领先于Anthropic仅数周前发布的Opus 5(63分),以及GPT-5.6 Sol和Grok 4.6(均为61分)[6]。此次发布的时机使竞争格局尤为重要:Fable 5在6月因美国出口管制指令部分时间下线,直至7月1日更新安全限制后才恢复全球服务[8],而Opus 5在Fable 5.1发布前不到六周推出[6]。在Opus 5发布后如此迅速推出,Fable 5.1的基准领先更像Anthropic试图在竞争对手赶上之前重夺榜首,而非简单的增量更新——这一解读被一则法语发布日演示强化,该演示在约80分钟内从PRD(产品需求文档)构建了一个完整的CRM应用,并直接引用了Anthropic公告中的代理编码和知识工作基准数据。

使用账单实际揭示的内容:构建者撞上成本墙

营销与实测成本差距最清晰的现实证据并非来自基准报告,而是早期用户消耗使用额度的速度。一个在Reddit上广泛讨论的构建案例中,单个提示导致Fable 5.1启动约14个并行子代理来构建一个浏览器游戏,消耗了近200万输出令牌和超过1.18亿缓存读取令牌,在约一小时内耗尽了发布者的五小时使用限额。另一则X帖子描述在一天内耗尽28个Max 20x计划配额,发布者归因于可能的缓存错误。两个Reddit帖子独立提出了相同的抱怨:五小时使用限额迅速耗尽,同时评论中有人怀疑这些炫目的多代理展示帖可能是人为炒作。结合Artificial Analysis发现Fable 5.1在最大努力度下使用约1.7倍输出令牌,这一模式并非与定价争议无关——它正是定价争议在实践中的体现。高度代理型、多子代理编排正是最能快速放大输出令牌量的工作负载类型,也正是在这一场景下,宣传的45%节省最可能反转为实际成本增加。

历史背景

Claude Fable 5发布,随后因美国政府出口管制指令短暂下线。
Anthropic在出口管制指令解除后,以更新的网络安全限制重新在全球部署Claude Fable 5。
Anthropic签署《欧盟人工智能法案》关于AI生成内容透明度的行为准则,该承诺导致2026年8月2日后发布的模型强制实施水印。
Claude Opus 5发布;它后来成为Fable 5.1智能指数得分和每任务成本的基准对比点。

关键关系图

关键玩家
主题

Claude Fable 5.1发布:基准测试领先但成本争议

AN

Anthropic

Developer and publisher of Claude Fable 5.1 and Mythos 5.1

AR

Artificial Analysis

Independent benchmarking firm with pre-release access; published the Intelligence Index score and disputed Anthropic's cost-savings framing

AM

Amazon Web Services (AWS)

Cloud partner distributing Fable 5.1 via Amazon Bedrock and co-building Enterprise Frontier Safeguards

GO

Google Cloud and Microsoft Azure/Foundry

Additional cloud platforms distributing Fable 5.1 alongside AWS

RA

Ramp

Enterprise customer cited running an unattended 38-hour machine-learning workload on Fable 5.1

VE

Vetted cybersecurity and life-sciences organizations

Trusted-access-program recipients of the invitation-only Mythos 5.1 variant

事实来源

8 条引用
  1. [1] Introducing Claude Fable 5.1 and Claude Mythos 5.1
  2. [2] Anthropic Launches Claude Fable 5.1 and Mythos 5.1
  3. [3] Anthropic's Claude Fable 5.1 and Mythos 5.1 Arrive With a 75% Cost Reduction for Cache Reads
  4. [4] Anthropic Releases Claude Fable 5.1
  5. [5] Claude Fable 5.1 Now Available on AWS
  6. [6] Claude Fable 5.1: Independent Benchmark Analysis
  7. [7] Anthropic's Claude Fable 5.1 Promises Better Coding and Research at Up to 45 Percent Less
  8. [8] Claude Fable 5 Release and Export-Control Rollback

来源文章

Top 5

THE SIGNAL.

Analysts

确认Fable 5.1在智能指数中以66分领先于Opus 5的63分,但发现最大推理努力度下,尽管缓存读取价格下调,Fable 5.1每项任务成本仍比Fable 5高出约20%,因其消耗的输出令牌约为1.7倍。

Artificial Analysis
基准测试权威,质疑Anthropic的节省说法

指出Anthropic宣传的节省与Artificial Analysis在最大努力度下实测的每任务成本之间存在差距——缓存读取折扣在代理型工作负载中每任务节省约1.40美元,但Fable 5.1在最大努力度下每任务成本仍比Fable 5整体高出20%。

the-decoder.com
对营销与实测成本持怀疑态度

反对无法禁用的隐形输出水印,将其比作无法控制的强制签名,并质疑Anthropic在广泛发布前以安全为中心宣传新模型的模式。

Forum commenters (via MacRumors)
对强制水印持批评态度
The Crowd

We’re introducing Claude Fable 5.1 and Claude Mythos 5.1. They're the world’s most advanced models for coding and knowledge work.

@@claudeai62698

A few notes on Anthropic's new Claude Fable 5.1 - with Max thinking level I got the best SVG pelican I've had from any Anthropic model (at a hefty cost of $3.30!), which I then had it animate

@@simonw1750

Something definitely seems screwy with the Fable 5.1 usage. Probably a caching bug in the new Claude Code if I had to guess. I managed to blow through all my 28 Max 20x accounts today (at least the 5-hour usage limits) just doing audits of a bunch of my projects. First time ever.

@@doodlestein1277

ok this is wild. Used Claude Fable 5.1 and said "build me Cities: Skylines in three.js"

@u/DesignEddi1400
Broadcast
Vibe Coding With Claude Fable 5.1

Vibe Coding With Claude Fable 5.1

Claude Fable 5.1 + Claude Design = INSANE Instagram Carousels!

Claude Fable 5.1 + Claude Design = INSANE Instagram Carousels!

Claude Fable 5.1 est sorti et Opus 5 est MORT

Claude Fable 5.1 est sorti et Opus 5 est MORT