Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1
TECH

Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1

34+
Signals

战略概览

  • 01.
    Anthropic 于 2026 年 9 月 1 日发布了 Claude Fable 5.1(全面可用)和 Claude Mythos 5.1(仅限经过审核的网络安全与生命科学组织使用),称两者是同一底层模型,仅在安全防护级别上有所区分。
  • 02.
    此次发布将 Fable 5.1 的缓存读取定价降低 75% 至每百万 token 0.25 美元,而基础输入和输出价格仍维持在每百万 token 10 美元和 50 美元。
  • 03.
    Fable 5.1 在长周期、与科学相关的智能体基准测试中表现最为突出,其 Terminal-Bench-Science 得分从 24.7% 提升至 52.6%,实现翻倍以上增长;而在 CursorBench 等短周期编码测试中的提升则相对较小。
  • 04.
    新的安全机制将网络安全误报率降低了 60%,生物学相关误报率降低了 85%,同时 Fable 5.1 获得了一项有限能力:可发现软件漏洞,但不能加以利用。

真实价格标签:更便宜的缓存读取,更昂贵的任务

Anthropic 宣称 Fable 5.1 的缓存读取价格下降了 75%,降至每百万 token 0.25 美元,这意味着典型工作负载的成本大约降低 25%,高度智能体化的任务成本最多可节省 45% [1]。然而,来自 Artificial Analysis 的独立基准测试使这一说法变得复杂:Fable 5.1 每项 Intelligence Index 任务的实际成本为 3.76 美元——比 Fable 5 高出约 20%,即便已享受缓存降价 [2]。价目表更便宜,并不意味着按每项任务总成本计算后账单也一定更低。

一个模型,两种治理层级

据 Anthropic 称,Fable 5.1 与 Mythos 5.1 是同一个底层模型,主要区别在于其安全机制的严格程度 [1]。Fable 5.1 面向广泛用户提供标准保护,而 Mythos 5.1 则未对公众开放,仅通过可信访问计划提供给经过审核的网络安全和生命科学组织,目前仅限于一组美国机构 [3]。Anthropic 此次发布还搭配了“企业前沿防护”(Enterprise Frontier Safeguards)计划,该计划将于 2026 年秋季推出,允许企业客户将滥用监控数据保留在自身控制的基础设施中,而非 Anthropic 的系统内 [4]。这些举措共同勾勒出一种双层访问模式:大多数用户享有保守防护的广泛可用性,而一小部分经批准的用户则可获得更宽松、面向研究的版本——这种结构引发了关于准入圈层如何选定以及未来可能如何扩展的公开疑问。

独立基准测试确认进步,但有保留

除 Anthropic 自身公布的数据外,Artificial Analysis 测得 Fable 5.1 在 Intelligence Index 上得分为 66,是其记录以来的最高分,领先于 Opus 5、Fable 5、GPT-5.6 Sol 和 Grok 4.6,并在 Terminal-Bench v2.1(91.4%)和 SciCode(62.0%)上创下新高 [2]。第三方验证之所以重要,是因为正如 VentureBeat 在报道中指出的那样,Anthropic 发布材料中的大部分具体基准对比均为厂商自报,而非独立复现 [5]。外部实验室复现强劲结果,与公司自我评估之间的差距,正是营销主张与经验证主张的区别所在——而在此案例中,两者基本一致,但并非完全吻合。

能力提升的实际集中领域

能力提升集中在长周期和与科学相关的智能体任务上:Fable 5.1 在 Terminal-Bench-Science 上的得分从 Fable 5 的 24.7% 提升至 52.6%,实现翻倍以上增长,且优于 Opus 5 的 29.0% [1]。在较短、成熟度较高的任务上提升较为温和——CursorBench 从 70.5% 提升至 73.4%;而在智能体浏览器自动化测试中则有显著跃升,Fable 5.1 完成了 82% 的 Browserbase 任务,高于 Opus 5 的 74%,AutomationBench 得分也从 17.1% 几乎翻倍至 31.4% [5]。这一模式表明,Anthropic 此次更新专门针对持续性的多步骤智能体任务进行了优化,而非在所有任务类型上实现均匀提升。

双重用途安全:发现漏洞而不制造武器

Fable 5.1 现在可用于发现软件漏洞,但 Anthropic 明确禁止使用该模型为其所发现的漏洞开发攻击载荷,同时在生成文本中嵌入不可见水印,并推出处于私测阶段的检测 API [6]。Anthropic 还报告称,其新安全机制在 Claude Code 中减少了 60% 的网络安全误报,在良性生物与医学问题上的触发频率降低了 85% [1]。综合来看,这些变化似乎旨在减轻 Fable 5 对合法安全与科研用户造成的使用摩擦,同时并未简单移除防止模型被用于攻击性目的的防护屏障。

实际体验反馈:能力突破与现实摩擦并存

Anthropic 自身基准之外的用户活动呈现出类似图景:真实能力提升伴随着真实抱怨。在 X 平台上,一位自称非程序员的用户在约三十分钟内构建了三个可运行的网页应用;开发者 @bridgemindai 一次性完成了一个可玩的马里奥赛车风格游戏,称其相比 Fable 5 是显著进步。Reddit 上的技术爱好者进一步探索了智能体方向:r/ClaudeCode 用户使用约十四个并行子智能体,在 three.js 中组装出一款《城市:天际线》风格的城市建造器,尽管同帖其他评论者反驳称,该演示并不比先前模型所能实现的效果更令人印象深刻,且更复杂的逻辑问题仍未得到验证;另有人在 r/ClaudeAI 上通过将逐帧视频分析输入基于 Blender 的资产管线,以约 20 美元成本制作出一个可运行的《我的世界》模组。YouTube 评测者观点分裂:一频道称赞 Fable 5.1 在智能体能力上表现“凶猛”,但指出五小时使用限制对重度用户造成摩擦;另一频道则指出了模型自动续写功能中的 bug。整体图景强化了前述基准结论——在持续性多步骤智能体任务上确实取得进展,但也受到成本与使用限制的影响,技术评审者对其最亮眼输出究竟代表全新能力,还是旧模型包装升级,仍持怀疑态度。

历史背景

发布了前代产品 Claude Fable 5(全面可用)和 Claude Mythos 5(仅限 Project Glasswing 合作伙伴及选定生物医学研究人员),输入/输出定价为每百万 token 10 美元和 50 美元。
Fable 5 与 Mythos 5 的访问权限曾在 2026 年 7 月 1 日短暂暂停,随后恢复。
发布 Claude Fable 5.1 与 Claude Mythos 5.1,将缓存读取价格降低 75%,并在长周期智能体与编码基准测试上相较 Fable 5 实现提升。

关键关系图

关键玩家
主题

Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1

AN

Anthropic

模型开发者与发布方;同时发布 Fable 5.1(全面可用)和 Mythos 5.1(受限),将其定位为同一模型因安全机制不同而分化。

VE

Vetted cyber-defense and life-science organizations

Mythos 5.1 的唯一授权用户,该版本在网络安全防御与生物研究方面放宽了安全限制,目前仅限于一组美国机构。

SI

Simon Willison

独立开发者与评论员,对 Fable 5.1 运行了其标准的鹈鹕 SVG 基准测试并发布了实测反馈。

AR

Artificial Analysis

独立基准测试机构,测量了 Fable 5.1 的 Intelligence Index 与每任务成本,对 Anthropic 自身声明起到验证作用。

OP

OpenAI (GPT-5.6 Sol) and competing labs

比较对象;Anthropic 与评测者将 Fable 5.1 定位为在 Artificial Analysis Intelligence Index 上优于 GPT-5.6 Sol 与 Grok 4.6。

事实来源

6 条引用
  1. [1] Claude Fable and Mythos 5.1
  2. [2] Claude Fable 5.1: Independent Benchmarks
  3. [3] Claude Mythos
  4. [4] Anthropic launches Claude Fable 5.1 and Mythos 5.1
  5. [5] Anthropic's Claude Fable 5.1 and Mythos 5.1 arrive with a 75% cost reduction for Fable cache reads
  6. [6] Anthropic's Claude Fable 5.1 Can Find Security Vulnerabilities, But Can't Exploit Them

来源文章

Top 5

THE SIGNAL.

Analysts

称 Fable 5.1 在其鹈鹕 SVG 测试中的全力输出是他见过的任何 Anthropic 模型中最佳的,赞扬其细节严谨,但指出相比竞品模型缺乏创意 flair。

Simon Willison
独立 AI 评论员与开发者

提醒注意,Anthropic 在其发布材料中的基准对比是厂商自报结果,而非独立复现。

VentureBeat
科技报道分析机构

确认 Fable 5.1 在其 Intelligence Index 及多个智能体基准测试中领先,但发现其每项 Intelligence Index 任务的成本比 Fable 5 高出 20%,尽管已有缓存降价。

Artificial Analysis
独立模型基准测试机构

描述了给 Fable 5.1 提供模糊、混乱的指令,并信任它推断出预期任务的过程,称这种体验是‘直接就能用’。

Unnamed Anthropic researcher
Anthropic 员工,在实测报道中被引用
The Crowd

We're introducing Claude Fable 5.1 and Claude Mythos 5.1. They're the world's most advanced models for coding and knowledge work.

@@claudeai65198

Claude Fable 5.1 is insane. i know literally NOTHING about coding. ZERO. and i just built 3 fully functioning web apps in 30 minutes. http://localhost:3000/ http://localhost:8000/ http://localhost:5000/ check it out.

@@araseb_5875

Claude Fable 5.1 ONE SHOTTED this Mario Kart game. This is one of the best results I've had so far and I am SUPER impressed with the game development capabilities. Fable 5.1 is a huge step up from Fable 5.

@@bridgemindai3409

Fable 5.1 Max gave me the most reasonable local setup guide

@u/Delicious-Flan883100
Broadcast
Introducing Claude Fable 5.1

Introducing Claude Fable 5.1

Claude Fable 5.1 is savage

Claude Fable 5.1 is savage

Claude Fable 5.1 Is Here But There's One Big Problem!

Claude Fable 5.1 Is Here But There's One Big Problem!

Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1 — AI 新闻 | Agentic Brew