Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1
战略概览
- 01.Anthropic 于 2026 年 9 月 1 日发布了 Claude Fable 5.1(全面可用)和 Claude Mythos 5.1(仅限经过审核的网络安全与生命科学组织使用),称两者是同一底层模型,仅在安全防护级别上有所区分。
- 02.此次发布将 Fable 5.1 的缓存读取定价降低 75% 至每百万 token 0.25 美元,而基础输入和输出价格仍维持在每百万 token 10 美元和 50 美元。
- 03.Fable 5.1 在长周期、与科学相关的智能体基准测试中表现最为突出,其 Terminal-Bench-Science 得分从 24.7% 提升至 52.6%,实现翻倍以上增长;而在 CursorBench 等短周期编码测试中的提升则相对较小。
- 04.新的安全机制将网络安全误报率降低了 60%,生物学相关误报率降低了 85%,同时 Fable 5.1 获得了一项有限能力:可发现软件漏洞,但不能加以利用。
一个模型,两种治理层级
据 Anthropic 称,Fable 5.1 与 Mythos 5.1 是同一个底层模型,主要区别在于其安全机制的严格程度 [1]。Fable 5.1 面向广泛用户提供标准保护,而 Mythos 5.1 则未对公众开放,仅通过可信访问计划提供给经过审核的网络安全和生命科学组织,目前仅限于一组美国机构 [3]。Anthropic 此次发布还搭配了“企业前沿防护”(Enterprise Frontier Safeguards)计划,该计划将于 2026 年秋季推出,允许企业客户将滥用监控数据保留在自身控制的基础设施中,而非 Anthropic 的系统内 [4]。这些举措共同勾勒出一种双层访问模式:大多数用户享有保守防护的广泛可用性,而一小部分经批准的用户则可获得更宽松、面向研究的版本——这种结构引发了关于准入圈层如何选定以及未来可能如何扩展的公开疑问。
独立基准测试确认进步,但有保留
除 Anthropic 自身公布的数据外,Artificial Analysis 测得 Fable 5.1 在 Intelligence Index 上得分为 66,是其记录以来的最高分,领先于 Opus 5、Fable 5、GPT-5.6 Sol 和 Grok 4.6,并在 Terminal-Bench v2.1(91.4%)和 SciCode(62.0%)上创下新高 [2]。第三方验证之所以重要,是因为正如 VentureBeat 在报道中指出的那样,Anthropic 发布材料中的大部分具体基准对比均为厂商自报,而非独立复现 [5]。外部实验室复现强劲结果,与公司自我评估之间的差距,正是营销主张与经验证主张的区别所在——而在此案例中,两者基本一致,但并非完全吻合。
能力提升的实际集中领域
能力提升集中在长周期和与科学相关的智能体任务上:Fable 5.1 在 Terminal-Bench-Science 上的得分从 Fable 5 的 24.7% 提升至 52.6%,实现翻倍以上增长,且优于 Opus 5 的 29.0% [1]。在较短、成熟度较高的任务上提升较为温和——CursorBench 从 70.5% 提升至 73.4%;而在智能体浏览器自动化测试中则有显著跃升,Fable 5.1 完成了 82% 的 Browserbase 任务,高于 Opus 5 的 74%,AutomationBench 得分也从 17.1% 几乎翻倍至 31.4% [5]。这一模式表明,Anthropic 此次更新专门针对持续性的多步骤智能体任务进行了优化,而非在所有任务类型上实现均匀提升。
双重用途安全:发现漏洞而不制造武器
实际体验反馈:能力突破与现实摩擦并存
Anthropic 自身基准之外的用户活动呈现出类似图景:真实能力提升伴随着真实抱怨。在 X 平台上,一位自称非程序员的用户在约三十分钟内构建了三个可运行的网页应用;开发者 @bridgemindai 一次性完成了一个可玩的马里奥赛车风格游戏,称其相比 Fable 5 是显著进步。Reddit 上的技术爱好者进一步探索了智能体方向:r/ClaudeCode 用户使用约十四个并行子智能体,在 three.js 中组装出一款《城市:天际线》风格的城市建造器,尽管同帖其他评论者反驳称,该演示并不比先前模型所能实现的效果更令人印象深刻,且更复杂的逻辑问题仍未得到验证;另有人在 r/ClaudeAI 上通过将逐帧视频分析输入基于 Blender 的资产管线,以约 20 美元成本制作出一个可运行的《我的世界》模组。YouTube 评测者观点分裂:一频道称赞 Fable 5.1 在智能体能力上表现“凶猛”,但指出五小时使用限制对重度用户造成摩擦;另一频道则指出了模型自动续写功能中的 bug。整体图景强化了前述基准结论——在持续性多步骤智能体任务上确实取得进展,但也受到成本与使用限制的影响,技术评审者对其最亮眼输出究竟代表全新能力,还是旧模型包装升级,仍持怀疑态度。
历史背景
关键关系图
事实来源
[1] Claude Fable and Mythos 5.1
[2] Claude Fable 5.1: Independent Benchmarks
[3] Claude Mythos
[4] Anthropic launches Claude Fable 5.1 and Mythos 5.1
[5] Anthropic's Claude Fable 5.1 and Mythos 5.1 arrive with a 75% cost reduction for Fable cache reads
[6] Anthropic's Claude Fable 5.1 Can Find Security Vulnerabilities, But Can't Exploit Them
来源文章
THE SIGNAL.
“称 Fable 5.1 在其鹈鹕 SVG 测试中的全力输出是他见过的任何 Anthropic 模型中最佳的,赞扬其细节严谨,但指出相比竞品模型缺乏创意 flair。”
“提醒注意,Anthropic 在其发布材料中的基准对比是厂商自报结果,而非独立复现。”
“确认 Fable 5.1 在其 Intelligence Index 及多个智能体基准测试中领先,但发现其每项 Intelligence Index 任务的成本比 Fable 5 高出 20%,尽管已有缓存降价。”
“描述了给 Fable 5.1 提供模糊、混乱的指令,并信任它推断出预期任务的过程,称这种体验是‘直接就能用’。”
“We're introducing Claude Fable 5.1 and Claude Mythos 5.1. They're the world's most advanced models for coding and knowledge work.”
“Claude Fable 5.1 is insane. i know literally NOTHING about coding. ZERO. and i just built 3 fully functioning web apps in 30 minutes. http://localhost:3000/ http://localhost:8000/ http://localhost:5000/ check it out.”
“Claude Fable 5.1 ONE SHOTTED this Mario Kart game. This is one of the best results I've had so far and I am SUPER impressed with the game development capabilities. Fable 5.1 is a huge step up from Fable 5.”
“Fable 5.1 Max gave me the most reasonable local setup guide”

Introducing Claude Fable 5.1

Claude Fable 5.1 is savage

Claude Fable 5.1 Is Here But There's One Big Problem!