Meta发布Muse Code AI编程代理
TECH

Meta发布Muse Code AI编程代理

55+
Signals

战略概览

  • 01.
    Meta于2026年8月5日发布了其首款基于终端的AI编程代理Muse Code(测试版),由新的Muse Spark 1.2模型驱动。
  • 02.
    Muse Code目前以测试版形式支持macOS和Linux系统,可通过单条终端命令安装。
  • 03.
    对于大型任务,Muse Code可将工作分发给多个持久化的子代理并行运行,每个子代理在独立的git worktree中操作,以避免运行中途出现文件冲突。
  • 04.
    每次模型调用、工具执行、审批和编辑都会在执行前写入本地仅追加事件日志,确保运行过程可精确重放,并在崩溃后安全恢复而非从头重启。
  • 05.
    Muse Code内置多项技能:/plan将任务转换为需审批通过的计划,/grill对这些计划进行压力测试,/goal则引导代理完成更广泛的总体目标。
  • 06.
    Muse Spark 1.2在Terminal-Bench 2.1上得分为82.9%,在DeepSWE v1.1上得分为59.3%,相比Muse Spark 1.1的76.2%和53.0%有所提升。
  • 07.
    Muse Code的标准定价为每百万输入token 1.25美元,每百万输出token 4.25美元;而折扣贡献者层级定价为每百万输入token 0.10美元、每百万输出token 0.20美元(约便宜20倍),但需允许Meta使用您的提示词和生成内容训练未来模型。
  • 08.
    标准层级支持每分钟3,000次请求和4,000,000个token,而贡献者层级上限低得多,仅为每分钟60次请求和2,100,000个token。
  • 09.
    Meta表示,公司要求数千名内部工程师每周使用Muse Code,约7,000名活跃内部用户生成了超过800项改进,用于优化模型。

一场精心策划的价格战,你的代码是货币

Muse Code的标准定价为每百万输入token 1.25美元,每百万输出token 4.25美元,但Meta还提供大幅折扣的贡献者层级,仅需每百万输入token 0.10美元、每百万输出token 0.20美元,价格约为标准层的二十分之一 [1]。代价是,贡献者层级要求开发者允许Meta使用其提示词和生成内容来训练未来模型,且Meta为此设置了更严格的吞吐量限制:每分钟60次请求和210万个token,远低于标准层级的每分钟3,000次请求和400万个token [1]

这一权衡并未被忽视。MacRumors论坛上一个专门讨论该定价策略的帖子显示,多数评论持怀疑态度,不少用户认为折扣不足以换取向Meta让渡代码训练权,尽管也有少数人愿意接受这种交换 [2]。这种对数据的渴求对Meta而言并非新鲜事:该公司称已要求数千名内部工程师每周使用Muse Code,约7,000名活跃内部用户产生了超过800项修复,反馈至模型优化中 [3]——这表明贡献者层级并非实验,而是Meta已在内部运行的数据飞轮机制的延伸。

Meta发布了自己的现实检验

在Meta选定的基准测试中,Muse Spark 1.2相较前代确实取得进步:Terminal-Bench 2.1得分为82.9%,DeepSWE v1.1得分为59.3%,高于Muse Spark 1.1的76.2%和53.0% [4]。这一成绩略胜于OpenAI在Codex中使用的GPT-5.6 Terra(Terminal-Bench 2.1得分为81.8%)以及xAI在Grok Build中使用的Grok 4.5(81.6%)[4]

但同一张图表也暴露了Meta在真正市场领导者面前的劣势:Claude Opus 5运行Claude Code时,在Terminal-Bench 2.1上得分为86.7%,DeepSWE v1.1上为65.0%,两项均优于Muse Spark 1.2;据称Meta内部一项涉及440个拉取请求的测试也显示,Claude Opus 5领先约九个百分点 [5][6]。换言之,Meta选择了自己的记分牌,却仍公开了证据,表明其旗舰竞争对手在所有它选择展示的指标上都处于领先地位。

与DeepSeek的对比:在激烈价格战中的有利定位

Meta此次发布也引发了与DeepSeek V4 Flash 0731的比较,后者同样是低成本模型,而Muse Spark 1.2在此类对比中略微领先:Artificial Analysis的智能指数评分为54,高于DeepSeek的50;其GDPval-AA v2 Elo评分为1631,也高于DeepSeek的1559 [7][8]。在Meta发布时强调的具体基准测试中,其自报的Terminal-Bench 2.1得分为82.9%,DeepSWE 1.1得分为59.3%,均略高于DeepSeek在其工程博客上公布的V4 Flash 0731成绩:分别为82.7%和54.4% [9]

不过这些数据需谨慎看待:它们来自不同的测量环境,而非统一测试。智能指数和Elo评分来自Artificial Analysis的独立评估,而Terminal-Bench和DeepSWE数据则是Meta自报结果与DeepSeek自报结果的对比。Artificial Analysis在关于Muse Spark 1.2的独立分析中另列出了一个更低的、由其独立运行的Terminal-Bench v2.1得分——80%,不同于Meta自报的82.9% [8]。综合来看,与DeepSeek的对比真实存在但经过筛选:Meta突出了自己微弱领先的唯一一项直接对比,而其自身图表在其他地方却显示其在所有关键指标上落后于Claude Code。

分析师质疑联合训练优势难以持久

独立分析师对Meta将模型与代理框架联合训练的做法能否带来持久优势表示怀疑。Omdia首席分析师Lian Jye Su指出,竞争对手已在进行类似的集成工作,例如OpenAI和Anthropic已将框架工程纳入训练流程的一部分,并强调企业对安全性和治理的要求可能成为采用的主要障碍 [10]

Pareekh Consulting的Pareekh Jain认为,Muse Code真正的考验在于企业项目成果及其实际减少的人工干预程度,预计企业会先将其用于范围狭窄、风险较低的任务,再逐步信任其处理生产级代码 [10]。Counterpoint Research的Neil Shah进一步指出,厂商发布的基准图表(如Meta选择发布的Terminal-Bench和DeepSWE对比)不如实际结果重要,因为CIO们最关心的是工具在企业自有流水线上的通过率 [10]

历史背景

Meta在发布Muse Spark 1.2和Muse Code之前约四个月推出了首个Muse Spark模型。
Muse Code(测试版)与Muse Spark 1.2共同登陆macOS和Linux平台,标志着Meta正式进入终端式自主编程代理领域,该领域此前已被OpenAI的Codex和Anthropic的Claude Code占据。
Meta股价在Muse Code发布前约一个月创下自2024年初以来的最佳周表现,单周上涨15%。

关键关系图

关键玩家
主题

Meta发布Muse Code AI编程代理

ME

Meta Platforms / Meta Superintelligence Labs

Developer and publisher of Muse Code and Muse Spark 1.2; positions the product as a lower-cost alternative to rivals to gain developer adoption, using the contributor tier's data-training rights as an extension of the internal data flywheel Meta already runs.

OP

OpenAI (Codex)

Competing terminal/agentic coding product; Muse Spark 1.2 edges out GPT-5.6 Terra in Codex on Terminal-Bench 2.1 (82.9% vs 81.8%) but trails on DeepSWE v1.1 long-horizon tasks.

AN

Anthropic (Claude Code)

Market leader Muse Code is explicitly built to challenge; Claude Opus 5 (max effort) leads Terminal-Bench 2.1 at 86.7%, ahead of Muse Code, and Meta's own launch benchmarks show Claude Opus 5 beating Muse Code on every comparison Meta itself published.

XA

xAI (Grok Build / Grok 4.5) and Google (Gemini 3.6 Flash)

Secondary competitors also benchmarked at launch; Grok Build scored 81.6% on Terminal-Bench 2.1, behind Muse Spark 1.2, which also exceeds Grok and Gemini 3.6 Flash on DeepSWE 1.1.

DE

DeepSeek

Competing lower-cost model provider (V4 Flash 0731); Meta's launch positions Muse Spark 1.2 as narrowly ahead of DeepSeek V4 Flash on several benchmarks, situating this launch within a broader agentic-coding price war beyond just the Meta/OpenAI/Anthropic rivalry.

MA

Mark Zuckerberg

Meta CEO; publicly announced Muse Code's beta launch.

AL

Alexandr Wang

Meta Superintelligence Labs AI chief; publicly framed Muse Code's value proposition around cost-effectiveness, saying the tool 'can be an incredibly good option, especially from a cost perspective' for many workflows.

事实来源

12 条引用
  1. [1] Meta's Muse Code for Mac
  2. [2] Meta's New Mac Coding Agent Costs Up to 20x Less if You Let Meta Train on Your Data
  3. [3] Meta Launches Muse Code AI
  4. [4] Meta Launches Muse Code, a New AI Coding Agent Powered by Spark 1.2
  5. [5] Zuckerberg's Muse Code vs Anthropic Benchmarks
  6. [6] Meta's Muse Code Loses to Anthropic's Claude Opus 5 in AI Coding Benchmark
  7. [7] Muse Spark 1.2 vs DeepSeek V4 Flash - Model Comparison
  8. [8] Muse Spark 1.2
  9. [9] DeepSeek V4 Flash 0731 GA: Agent Benchmarks
  10. [10] Meta Launches Muse Code for Complex Software Work With Persistent AI Agents
  11. [11] Introducing Muse Code and Muse Spark 1.2
  12. [12] Meta Launches Muse Code, an AI Agent for Large Code Bases

来源文章

Top 5

THE SIGNAL.

Analysts

对Meta将模型与代理框架联合训练的做法能否带来持久优势持怀疑态度,因为竞争对手也在进行类似的集成工作;同时指出安全与治理要求可能抑制企业在生产环境中的采用。

Lian Jye Su
首席分析师,Omdia

认为Muse Code的竞争优势必须通过真实企业项目成果和减少人工干预的程度来验证;预计企业将从范围有限、风险较低的任务开始试点,再逐步扩展到生产级代码。

Pareekh Jain
CEO,Pareekh Consulting

认为厂商发布的基准对比(如Meta自行选择发布的Terminal-Bench和DeepSWE图表)不如第三方或同框架评估有意义,因为企业买家更关注工具在其自有流水线中的通过率,而非头条基准分数。

Neil Shah
研究副总裁,Counterpoint Research
The Crowd

Releasing Muse Code in beta today. It's a terminal coding agent that takes on complete software engineering tasks across large repos: planning changes, writing code, validating the results. Powered by Muse Spark 1.2, a coding-focused model update.

@@finkd13523

Introducing Muse Code (beta), a terminal coding agent built for long-horizon software engineering, powered by our new Muse Spark 1.2 model. Muse Code plans, implements, and validates complex, multi-file changes across large repositories with persistent sub-agents that solve

@@AIatMeta3348

Meta just launched a coding agent that costs 21x less than Claude Code and Codex. But there's a catch. It's called Muse Code. The contributor tier charges $0.20 per million output tokens. For context, Claude Code and Codex both start at $20 a month and go up to $200 depending

@@VaibhavSisinty60

Meta releases Muse Code in beta

@u/troll_khan227
Broadcast
Meta Muse Code Is HERE – Spark 1.2 & Meta's NEW Coding Agent!

Meta Muse Code Is HERE – Spark 1.2 & Meta's NEW Coding Agent!

Muse Code with Muse Spark 1.2: Fan-Out Coding Agent with Vision

Muse Code with Muse Spark 1.2: Fan-Out Coding Agent with Vision

How to Install Meta AI Muse Code Coding Tool on Mac OS

How to Install Meta AI Muse Code Coding Tool on Mac OS