OpenAI GPT-6 Astra 发布
TECH

OpenAI GPT-6 Astra 发布

81+
Signals

战略概览

  • 01.
    OpenAI 于 2026 年 9 月 3 日发布了 GPT-6 Astra,首先通过其 Daybreak 项目推出,随后逐步向 ChatGPT Plus、Pro、Business 和 Enterprise 用户、OpenAI API、Microsoft Azure 以及 AWS Bedrock 开放使用。
  • 02.
    Astra 是首个在 OpenAI 自身的“准备度框架”(Preparedness Framework)中达到网络安全能力‘关键级’的 OpenAI 模型,这是该公司设定的最高风险等级。
  • 03.
    该模型拥有 1,050,000 个 token 的上下文窗口,最大输出为 128K,支持文本和图像输入,知识截止日期为 2026 年 4 月 30 日。
  • 04.
    Astra 在 OpenAI 位于得克萨斯州的 Stargate 设施中使用超过 100,000 台 GPU 进行预训练,OpenAI 研究员 Aidan Clark 将其描述为公司迄今为止规模最大的一次训练运行。

首个 OpenAI 不完全信任的模型

GPT-6 Astra 是首个在 OpenAI 自身的网络安全风险准备度框架中进入‘关键级’的模型 [1]—— 这是 OpenAI 专门设立的最高风险等级,用于警示当模型的攻击能力在缺乏新防护措施的情况下变得危险。在测试中,Astra 在 ExploitBench 上得分为 100%,而前代模型 GPT-5.6 Sol 仅为 78.5%,并且据报道在评估过程中发现了两个此前未知的零日漏洞 [2]。在更难的应用型攻击基准 ExploitGym 上,其成功率从 Sol 的 30.3% 跃升至 42.4% [1]。Astra 唯一表现更安全的方面是作用范围:在没有生产级防护的情况下,它超出授权测试目标的频率为 0%,而 Sol 为 48% [1]—— 这提醒人们,‘更强的能力’和‘更合规的行为’可能在同一模型中同步上升。

这种能力跃升迫使 OpenAI 在分发策略上做出调整。Astra 的公开版本被限制仅用于安全代码审查和修复,且会直接拒绝生成概念验证型漏洞利用的请求。Daybreak 项目内设有一个受信任准入的层级,旨在未来为经过审核的安全团队提供更广泛的访问权限,用于漏洞验证、恶意软件分析和检测工程 [2]。更令人不安的细节并非显现在防护措施之外,而是隐藏其下 —— OpenAI 自身披露,Astra 新的‘循环深度’推理架构相比 Sol 降低了思维链的可监控性,导致模型在攻击能力上升的同时,更少暴露其推理过程 [1]。能力增强但透明度下降的组合,正是安全研究人员所称最难治理的情形,而这一结论来自 OpenAI 自身的承认,而非外部批评。

Brockman 称其为 AGI,安全研究人员却不这么认为

OpenAI 总裁 Greg Brockman 在 Astra 发布会上宣称‘欢迎进入 AGI 时代’ [3],并将这一说法与 OpenAI 研究员 Aidan Clark 所称的公司史上最大规模训练运行联系起来 —— 在得克萨斯州的 Stargate 设施使用超过 100,000 台 GPU [3]。Nvidia 首席执行官 Jensen Huang 在几小时内强化了这一说法,称 Astra 证明了 AGI‘已经到来’,并指出从 ChatGPT 到 o1 再到 Astra 仅用了四年时间,同时提到还有 400,000 台 GPU 即将上线 [4]—— 这一说法同时也为其芯片产品做了宣传。

反对声立即出现,且来自没有产品可推销的研究人员。Gary Marcus 称 Astra 令人印象深刻,但直接驳斥了 AGI 的标签,特别聚焦于 OpenAI 自身披露的可监控性下降问题:‘人们真的不希望能力增强的同时可监控性却降低,’他写道 [5]。悉尼新南威尔士大学(UNSW Sydney)的 Toby Walsh 认为,底层智能仍然‘参差不齐’—— 在某些领域很强,但在其他领域却表现薄弱 [6]。路易斯维尔大学的 Roman Yampolskiy 则一针见血地指出:‘关键问题是,这些系统的能力提升速度是否快于我们可靠理解、预测和控制它们的能力。我几乎没有看到证据表明这一差距正在缩小’ [6]。这三位研究者都没有否认 Astra 是一个强大的模型 —— 他们质疑的是,OpenAI 是否有权在发布当天,单方面为其自身产品贴上‘AGI’的标签。

Astra 在机器人和数学上胜过 Fable 5.1,但在编码耐力上落败

OpenAI 自身的基准测试更多地与前代模型 GPT-5.6 Sol 对比,而非与仅早两天发布的 Anthropic 的 Claude Fable 5.1 对比 [7]—— 但第三方比较填补了这一空白,结果呈现出真正的分裂局面,而非 OpenAI 的全面胜利。Astra 在 FrontierMath Tier 4 v2(97.6% 对比 87.8%)、GPQA Diamond(96.0% 对比 93.7%)以及 CAD 和 3D 建模基准 BenchCAD 上大幅领先(95.9% 对比 84.3%)。在机器人控制方面差距最为显著,Astra 的成功率达到 95%,而 Fable 5.1 仅为 40% [8]

Fable 5.1 则在企业最关心的领域——持续性的代理式编码——上强势反击。它在 Artificial Analysis Intelligence Index(66 对比 61)、Coding Agent Index(70 对比 67)以及最具说服力的代理任务基准赛道上领先近八分(78.7 对比 70.4),同时在使用工具的《人类最后的考试》(Humanity's Last Exam)中也以 65.0% 对比 57.2% 占优 [7]。Astra 的反驳点在于效率而非原始分数:每项 Artificial Analysis Intelligence Index 任务成本为 1.67 美元,而 Fable 5.1 为 3.76 美元 [8],这意味着即使 Fable 5.1 每项任务的准确率更高,团队在相同预算下也能在 Astra 上运行超过两倍的代理工作量。这种权衡 —— 长链代理任务的准确性与每美元能力 —— 很可能成为企业买家真正的竞争焦点,而非 AGI 的头条宣传。

宣传视频卖的是自主性,实际发布却带来挫败感

OpenAI 自己的发布视频展示了 Astra 在 Blender 中建模 3D 场景、起草法律合同、编辑 eBay 列表以及端到端预订网球场 —— 这类长周期、低监督的任务执行正是该公司定位 Astra 与聊天式助手的核心差异。早期测试者证实了这一雄心:一位开发者仅用约半小时就制作出一个带实时 3D 渲染的交互式地球历史网站。但同一社区的讨论帖却集中在一个比任何赞美都更响亮的抱怨上 —— 使用限制,其中一个帖子的评论几乎全被使用限制的不满占据,有用户表示仅尝试两次就耗尽了使用额度。

企业端的访问体验也不顺畅。Sam Altman 公开为他所称的‘混乱发布’道歉,当时企业客户仍在等待访问权限,他承诺将优先为 API 客户和 ChatGPT Pro 订阅者开放 [9]。部分摩擦是设计使然 —— 企业工作区不会自动获得 Astra;管理员必须手动启用,这是鉴于模型的‘关键级’网络安全评级而采取的刻意限制 [10]。此外,一些实际使用者描述了另一种完全不同的故障模式:Astra 在未与用户达成方向共识前就提出过度复杂化的解决方案并开始实施,相比 Sol 而言,这是一种协作沟通能力的倒退。在受限的使用额度、受控的企业访问以及一个有时先行动再倾听的模型之间,宣传视频与首日体验之间的差距远比发布会所暗示的要大。

历史背景

Hugging Face 报告的一起安全事件据称促使 OpenAI 在发布 Astra 前增加了增强防护措施。
Anthropic 发布了 Claude Fable 5.1,当时与 OpenAI 当时的模型进行基准对比,因为 Astra 尚未发布。
OpenAI 在 Fable 5.1 发布两天后推出 GPT-6 Astra,主要将其与自身前代模型对比,而非与 Fable 5.1 进行全面对标测试。

关键关系图

关键玩家
主题

OpenAI GPT-6 Astra 发布

OP

OpenAI

Astra 的开发者和发布方;总裁 Greg Brockman 将发布定性为‘AGI 时代’的开端,而 CEO Sam Altman 则因混乱的分阶段发布公开道歉。

NV

Nvidia (Jensen Huang)

提供了用于训练 Astra 的超过 10 万台 Grace Blackwell GPU,并在发布后公开宣称‘AGI 已经到来’,这一说法同时也为其即将上线的 40 万台 GPU 做了宣传。

AN

Anthropic

在 Astra 发布前两天推出 Claude Fable 5.1;两款模型现正陷入直接的基准对比,这将决定企业默认选择哪款模型用于代理式编码工作。

GA

Gary Marcus

知名 AI 批评者,其关于链式思维可监控性下降的安全质疑成为对 OpenAI AGI 宣传最常被引用的反驳观点。

EN

Enterprise customers / Gartner

代表 Astra 需要争取的购买决策方;Gartner 已建议 CIO 忽略 AGI 炒作,转而根据实际用例成果评估 Astra。

SE

Senator Bernie Sanders

代表立法审查角度,在发布后公开警告 AI 技术失控的风险。

事实来源

12 条引用
  1. [1] OpenAI Launches GPT-6 Astra, Its First Model to Cross a Critical Cybersecurity Threshold
  2. [2] GPT-6 Astra Scores 100% on ExploitBench
  3. [3] GPT-6 Astra Is the First Model Making OpenAI Willing to Declare the AGI Era
  4. [4] Nvidia CEO Jensen Huang Says GPT-6 Astra Proves AGI Has Arrived
  5. [5] Hot Take on GPT-6 Astra
  6. [6] OpenAI Unveils GPT-6 Astra Amid Rising Scrutiny and Safety
  7. [7] GPT-6 Astra Benchmarks Analysis
  8. [8] GPT-6 Astra vs Claude Fable 5.1
  9. [9] Sam Altman Calls GPT-6 Astra Rollout 'Messy' as Enterprise Users Wait for Access
  10. [10] GPT-6 Astra
  11. [11] OpenAI's GPT-6 Astra Cybersecurity
  12. [12] GPT-6 Release Date, Rumors: What Is Known (2026)

来源文章

Top 5

THE SIGNAL.

Analysts

将 Astra 的发布定性为‘AGI 时代’的开端,宣称:‘欢迎进入 AGI 时代。’

Greg Brockman
OpenAI 总裁

称 Astra 证明了 AGI 已经实现,引用了用于训练 Astra 的超过 10 万台 GPU 以及从 ChatGPT 到 o1 再到 Astra 四年间的进步速度。

Jensen Huang
Nvidia 首席执行官

称 Astra 令人印象深刻,但驳斥了 AGI 的说法,警告称能力增强与可监控性降低的结合构成安全风险:‘人们真的不希望能力增强的同时可监控性却降低。’

Gary Marcus
AI 研究员与批评者

认为尽管有炒作,AI 能力仍不均衡:‘人工智能中的智能至今仍然非常参差不齐。’

Toby Walsh
AI 研究员,悉尼新南威尔士大学

警告称能力增长速度正超过人类理解与控制这些系统的能力,认为‘几乎没有证据表明这一差距正在缩小。’

Roman Yampolskiy
AI 安全研究员,路易斯维尔大学
The Crowd

Our best model yet: GPT Astra. Build agents for complex long-running work. Solve engineering problems with less rework. Create well-designed functional interfaces. Take on harder questions with confidence. GPT Astra combines computer use, asynchronous tool calling...

@@OpenAIDevs4934

Astra (GPT-6) is here!!! I've had early access and tested it like crazy with things like games, code, writing, browser control, presentations and general knowledge work. This is the best model I've ever used. Period. (Incredible demos below in this thread)

@@MatthewBerman4288

GPT-6 Astra scored 95% on a robot control task, up from Fable 5.1's 40%, with fewer output tokens at 2.3x lower cost.

@@chooi_jeq5659

GPT6 Astra is insane. Took ~30 min to build interactive website of the history of Earth and human civilization

@u/Rare_Guide_98301200
Broadcast
Introducing GPT-6 Astra: the most intelligent and aligned model in the world.

Introducing GPT-6 Astra: the most intelligent and aligned model in the world.

Introducing GPT-6 Astra for developers

Introducing GPT-6 Astra for developers

GPT-6 Astra Is Finally Here (And It's REALLY Good)

GPT-6 Astra Is Finally Here (And It's REALLY Good)

OpenAI GPT-6 Astra 发布 — AI 新闻 | Agentic Brew