xAI Grok 4.6 发布及 GitHub Copilot 集成
TECH

xAI Grok 4.6 发布及 GitHub Copilot 集成

38+
Signals

战略概览

  • 01.
    xAI 于2026年8月12日发布了其新旗舰模型 Grok 4.6,专注于长期运行的智能体、编码和知识工作,是在 Grok 4.5 基础上的演进。
  • 02.
    该模型延续了 Grok 4.5 的50万token上下文窗口,支持文本和图像输入,仅输出文本内容,且未声明输出长度限制。
  • 03.
    Grok 4.6 在发布两天后,即2026年8月14日,成为 GitHub Copilot 中可选的模型,覆盖八个平台:VS Code、Visual Studio、Copilot CLI、Copilot 云智能体、Copilot 应用、JetBrains IDE、Xcode 和 Eclipse。
  • 04.
    定价维持不变,为每百万输入token 2美元,每百万输出token 6美元,比 GPT-5.6 Sol($5/$30)和 Claude Opus 5($5/$25)低逾60%。
  • 05.
    开发者 Matt Shumer 运行了一项无监督的“试炼循环”(Gauntlet Loop),让 Grok 4.6 自主编写、测试和重写代码约48小时,最终生成了一个完全可玩的3D第一人称射击游戏,全程无人工干预。
  • 06.
    在 Artificial Analysis 智能指数中,Grok 4.6 得分为61,与 GPT-5.6 Sol 并列,仅次于 Claude Opus 5(63)和 Claude Fable 5(62)。

价格与性能的颠覆性组合

xAI 将 Grok 4.6 的定价维持在每百万输入token 2美元、每百万输出token 6美元——与 Grok 4.5 相同——使其价格比 GPT-5.6 Sol($5/$30)和 Claude Opus 5($5/$25)低逾60%[1]。如果 Grok 4.6 是一款入门级模型,这一差距或许不足为奇,但它在 Artificial Analysis 智能指数中得分为61,与 GPT-5.6 Sol 并列,仅比 Claude Opus 5(63)低两分[1]。效率故事的影响甚至比标价更具意义:在长周期智能体任务中,Grok 4.6 完成一项任务平均需要约53轮交互和5亿输入token,而 Claude Opus 5 则需约103轮和20亿输入token[1],这使得标价优势在实际应用中进一步放大为更大的成本差距。以每项任务0.84美元的成本,Grok 4.6 处于智能与成本之间的帕累托前沿[1]。独立评论员更倾向于将其视为利润率威胁而非单纯的编码突破:据称 Anthropic 和 OpenAI 均接近IPO,而一款接近前沿水平却如此激进定价的模型,将对投资者关注的推理利润率构成压力[2]。微软的 Azure 业务为 OpenAI 的经济模式提供了一定缓冲,但 Anthropic 尤其缺乏抵御这场非由其发起的价格战的能力。官方基准之外的实际测试也从不同角度得出了类似结论:独立创作者在跨平台执行相同任务时发现,Grok 4.6 的质量接近前沿水平,而成本仅为 Claude 顶级模型的大约四分之一,印证了官方数据所显示的价格-性能差距。

试炼循环:无模型卡支撑的持续自主能力

关于 Grok 4.6 最受热议的证明并非来自基准测试表,而是一次长达48小时的无监督编码运行。开发者 Matt Shumer 设置了一个“试炼循环”——一个迭代过程,模型自主编写代码、运行测试、识别失败并重写,全程无需人工介入[3]——并让它构建出一个完全可玩的3D第一人称射击游戏,全程零干预。一款模型能够在两天内持续保持连贯、自我修正的工作状态,而不是退化为重复或错误输出,这比以往单次提示演示所宣称的能力具有更深远的意义,也是该故事在 xAI 领导层推广后迅速传播的原因。独立测试者在 Shumer 的演示之外也报告了类似的持续构建行为:在独立的单次智能体测试中,Grok 4.6 组装出了带有可用地图、邮件、照片和日历应用的模拟移动操作系统界面,以及对猎鹰9号助推器着陆序列的物理细节模拟,表明这种长周期构建能力并非一次性噱头。然而,这一旗舰演示仍缺乏可供外界验证的文档:该主张未附带模型卡,也未公布故障模式、重试次数或用于确认“零人工干预”的评估方法[3]。这一缺失对 Grok 4.6 而言比一般主张更为重要,因为“试炼循环”的核心卖点正是可信的长周期自主性——而这恰恰是最难凭空采信的特性。在 xAI 公布更多内容之前,“试炼循环”最好被视为一个有前景的存在性证明,而非经过基准验证的能力。

一次以编码为名、实则对标知识工作的发布

xAI 将 Grok 4.6 推入 GitHub Copilot 时主打编码功能,但基准记录却讲述了一个更复杂的故事。独立评测发现,Grok 4.6 在 DeepSWE 上落后 GPT-5.6 Sol 7.1分,在 Terminal-Bench v3.0 上落后8.6分,仅取得26%的成绩[2]——这并不符合一款旨在引领软件工程的模型画像。同一评测认为,该模型真正的优势体现在其他方面:在 Harvey 法律分析基准上,其表现约为 GPT-5.6 Sol 的6倍,并在各类知识工作测试中得分优异,因此得出结论称这是“一款被当作编码模型发布的知识工作模型”[2]。社区基准测试从另一角度得出了相关结论:Grok 4.6 在 Grok 4.5 到 4.6 之间,其非幻觉率显著跃升,成为当前所有模型中最大的校准改进,而这一数据并未被 xAI 自身的发布材料强调。在此指标下,当模型明确不知道答案时,其错误回答中约三分之一是自信的虚构,而非诚实承认不确定性[2],这对旨在无人监督运行的编码智能体而言是一个切实担忧。社区讨论还指出,据报道 Grok 4.6 建立在与 Grok 4.5 相同的约1.5万亿参数基础上,通过额外的强化学习层优化,而非全新预训练——这更符合一次针对校准和知识工作的升级,而非彻底重构编码能力,进一步印证了两个独立来源分别得出的主题:无论 Grok 4.6 的最大飞跃是什么,它都不在原始编码能力上。

GitHub Copilot 策略:借力分发而非自建IDE

xAI 并未通过独立编辑器争夺开发者注意力,而是利用 GitHub Copilot 的模型选择架构,将 Grok 4.6 推送至八个平台——VS Code、Visual Studio、Copilot CLI、Copilot 云智能体、Copilot 应用、JetBrains IDE、Xcode 和 Eclipse——仅在其公开发布两天后即完成部署[4][5]。这一节奏本身值得注意:Grok 4.5 于2026年7月28日接入 GitHub Copilot[6],这意味着 xAI 已连续两次将旗舰模型在约十七天内集成至 Copilot,将原本看似一次性的整合转变为两家公司间的常规节奏。不过,此次发布并非毫无摩擦。Grok 4.6 对个人 Pro、Pro+ 和 Max 订阅用户默认可用,但企业版和商业版管理员必须手动开启策略开关才能为组织启用该模型[4]。这种默认关闭的做法是新模型集成中常见的企业安全模式,但也意味着最快采用者将是使用个人账户进行实验的个体开发者,而组织层面的部署将滞后于各公司的管理审批流程。

历史背景

埃隆·马斯克公开推出 xAI,宣称其使命是构建追求探索宇宙真理的AI。
xAI 为 X Premium 订阅用户推出了基于自研 Grok-1 模型的原始 Grok 聊天机器人测试版。
xAI 发布了 Grok-2,提升了推理、工具使用和视觉能力,并推出了较轻量的‘Grok-2 mini’变体。
xAI 发布了 Grok-3,定位为在计算资源上大幅提升训练的重大推理飞跃,擅长数学、科学和代码问题解决。
Grok 4.5 成为 GitHub Copilot 中的可选模型,是 Grok 4.6 推广的前身集成。
xAI 发布 Grok 4.6 作为其新旗舰模型,首日即上线 Cursor、Grok Build 和 API。
Grok 4.6 在其通用发布两天后,进入 GitHub Copilot 的八个开发平台。

关键关系图

关键玩家
主题

xAI Grok 4.6 发布及 GitHub Copilot 集成

XA

xAI / SpaceXAI

Grok 4.6 的开发与发布方;以性价比和长周期智能体能力定位,抗衡 OpenAI 和 Anthropic。

GI

GitHub / Microsoft (GitHub Copilot)

将 Grok 4.6 集成为八个 Copilot 平台中的可选模型,企业管理员默认关闭。

EL

Elon Musk

xAI 创始人;公开推广了48小时自主制作射击游戏的演示,并声称 Grok 4.6 在智能、速度和成本上领先。

MA

Matt Shumer

开发者,运行并公开了生成自主3D射击游戏的‘试炼循环’。

OP

OpenAI (GPT-5.6 Sol)

主要竞争对手,其旗舰模型被 Grok 4.6 在基准测试中对标并在价格上超越。

AN

Anthropic (Claude Opus 5 / Fable 5)

竞争对手,其顶级模型仍在 Artificial Analysis 智能指数中领先;Grok 4.6 的折扣定价被认为在计划IPO前对其推理利润率构成压力。

CU

Cursor

编码工具/IDE,Grok 4.6 作为 xAI 进军编码市场的组成部分,在所有计划中上线。

GA

Gavin Baker

投资者,公开评估 Grok 4.6 的性价比相对于 Claude Fable 5 Max 为‘帕累托主导’。

事实来源

8 条引用
  1. [1] Grok 4.6: Benchmarks and Analysis
  2. [2] Grok 4.6 Review
  3. [3] Grok 4.6 Built a 3D Shooter in 48 Hours, No Human Required
  4. [4] Grok 4.6 is now available in GitHub Copilot
  5. [5] Grok 4.6 Arrives in GitHub Copilot Across Eight Development Surfaces
  6. [6] Grok 4.5 is now available in GitHub Copilot
  7. [7] Grok 4.6
  8. [8] Grok 4.6 in Cursor

来源文章

Top 5

THE SIGNAL.

Analysts

评估 Grok 4.6 的性能与 Claude Fable 5 Max 相当,但价格显著更低,称其在性价比上具有帕累托优势。

Gavin Baker
投资者(在 X 平台发表公开评论)

声称 Grok 4.6 在综合考量智能、速度和成本时是市场上最佳模型,并推广了自主游戏构建演示,作为其长周期能力的证据。

Elon Musk
xAI 创始人

认为 Grok 4.6 的真正优势在于知识工作而非编码,尽管 xAI 的市场宣传聚焦于编码,并指出其在编码基准测试中落后于 GPT-5.6 Sol,且存在幻觉风险。

eesel AI (independent review)
独立AI产品评测机构

将模型从 Grok 4.5 到 4.6 的基准跃升描述为实质性的代际进步而非小幅版本更新,同时指出其非幻觉率中仍存在自信虚构的风险。

eesel AI (independent review)
独立AI产品评测机构

注意到自主游戏构建能力存在文档空白:未发布正式模型卡来详细说明‘试炼循环’演示的故障模式或评估方法。

gagadget (tech outlet analysis)
科技新闻媒体
The Crowd

Grok 4.6 is now available in GitHub Copilot. Try it out in the GitHub Copilot CLI, IDE, and cloud products!

@@grok1932

Grok 4.6 worked non-stop for 48 hours to build this shooter. Turns out Grok is powerful enough to run Gauntlet Loops. Let the game-making begin!

@@mattshumer_2185

Gavin Baker on Grok 4.6 Outpacing Anthropic "This is pretty wild ... You're well ahead of Fable 5, which I think most people would agree is the gold standard ... Very few investors talk about Grok at all and it is Pareto dominant on a lot of measures ... Maybe people should" [continued]

@@TheChiefNerd856

Grok 4.6 is an equivalent to Sol 5.6 according to artificial analysis arena

@u/Snoo26837837
Broadcast
xAI actually did it... (Grok 4.6)

xAI actually did it... (Grok 4.6)

Grok 4.6 IS REALLY GOOD Beating GPT-5.6 Sol, Opus 5, & Kimi k3?! (Fully Tested)

Grok 4.6 IS REALLY GOOD Beating GPT-5.6 Sol, Opus 5, & Kimi k3?! (Fully Tested)

Grok 4.6 is Claude Fable 5, but dirt cheap

Grok 4.6 is Claude Fable 5, but dirt cheap