OpenAI的GPT-6 Astra发布与“AGI时代”宣言
TECH

OpenAI的GPT-6 Astra发布与“AGI时代”宣言

23+
Signals

战略概览

  • 01.
    OpenAI于2026年9月3日星期四发布了GPT-6,命名为‘Astra’,称其为迄今为止世界上最智能且最对齐的模型。
  • 02.
    Astra在多个主要基准测试中表现卓越:FrontierMath Tier 4达到98%,ARC-AGI-3达到99.9%,ExploitBench达到100%,OpenAI称其为迄今为止最适合软件工程的模型。
  • 03.
    发布采用分阶段方式进行:从2026年9月3日起,一小部分组织通过OpenAI的‘Daybreak Access’计划率先获得访问权限,随后几天内逐步向ChatGPT Plus、Pro、Business和Enterprise用户以及API和AWS开放。
  • 04.
    Astra是首个被OpenAI根据其‘准备度框架’(Preparedness Framework)归类为达到‘关键’(Critical)网络安全阈值的模型,意味着它可能无需人类逐步指导即可发现并利用高度保护系统中的未知漏洞。

欢迎来到AGI时代——还是并非如此?

格雷格·布罗克曼(Greg Brockman)宣布的不仅是一个新模型,更是一个新时代。他将Astra称为‘代际飞跃’,并将OpenAI自身的AGI阈值重新定义为‘一种使命概念或精神概念’[1]。这种软化至关重要:就在公司声称已跨越该门槛的同一周,放宽定义使OpenAI得以在修辞上宣称达成里程碑,而无需承担正式声明所引发的严格审查。

这些基准数据确实令人瞩目——Astra在FrontierMath Tier 4中达到98%,ARC-AGI-3中达到99.9%,ExploitBench中达到100%[2]——但加里·马库斯(Gary Marcus)直接反驳了将基准饱和等同于AGI的观点:“在ARC-AGI上取得成功固然出色且令人印象深刻,但并不能——尽管任务名称如此——证明实现了AGI”[3]。他还指出,与热情的早期测试者不同,持怀疑态度的研究人员在发布前未被提前授予评估模型的权限。

OpenAI的叙事框架与马库斯的质疑之间的差距,比基准分数本身更能揭示此次发布的真正故事。

人工智能行业的共享单点故障

就在Astra发布的当天,ChatGPT和Codex、Claude以及Grok几乎在同一时间段内全部宕机[4]。报告的中断规模巨大——一个追踪平台记录到超过4万条与OpenAI相关的故障报告,另一个则统计到三大服务合计超过1.4万条报告,仅ChatGPT一项就一度峰值超过1.2万条[5][6]

目前尚未有任何相关公司确认,但主流推测认为问题源于对微软Azure计算基础设施的共同依赖[6]。OpenAI服务的大致恢复时间是在中断发生约30分钟后,而据报道,Grok的服务中断在ChatGPT和大部分Anthropic服务恢复后仍持续存在。

这次中断甚至实时反映在OpenAI自己的发布讨论中。在r/OpenAI论坛宣布Astra的帖子下,Reddit用户-ignotus直接评论称‘ChatGPT一整天都在经历服务中断’,社区成员在讨论发布新闻的同时也讨论着服务中断,而非将其视为独立事件。

这种时机将本应是一场胜利预告的发布变成了一场无意的玩笑:一款以即时执行命令为核心卖点的模型,在发布之时其底层聊天产品本身却无法访问。这提醒我们,前沿AI所谓的‘多供应商’韧性叙事,仍然受限于其底层云基础设施的高度集中性。

执行任务,而非解释任务:‘Put That There’的致敬

OpenAI的发布视频开头重现了1979年MIT的演示‘Put That There’,并明确致谢MIT媒体实验室、克里斯·施曼德特(Chris Schmandt)和埃里克·赫尔滕(Eric Hulteen)为原始片段创作者[7][8]。这一选择具有明确的定位意图:原版演示展示的是能够响应语音和手势指令的计算机,而非仅仅回答问题;四十多年后,OpenAI借此将Astra置于同样的语境之中。

这种定位不仅停留在营销意象层面,还伴随着具体的产品改进。Astra为Codex引入了一种新的上下文保留机制,使其在上下文窗口填满后不再需要反复压缩上下文[2]。这是‘执行而非解释’主张的功能基础——支持长时间运行的编码或代理任务,不会因运行时间延长而悄然丢失早期决策。

社区反响也延续了这一脉络,将Astra与JARVIS、HAL、电影《她》(Her)以及《星际迷航》中的计算机相提并论。但也有持异议者在相关讨论中指出,该演示不过是‘带语音的Codex电脑操作’,并无结构性创新——这对判断此次发布究竟有多少技术突破,还是只是对已有能力进行界面优化,提供了有益的反思。

OpenAI的首个‘关键’模型及其可监控性难题

Astra是首个在OpenAI自身‘准备度框架’下达到‘关键’网络安全阈值的模型——意味着它可能无需人类逐步指导即可独立发现并利用高度保护系统中的未知漏洞[2]。这是一种类别上的转变,而非渐进式提升:区别在于,模型是从辅助安全研究人员,转变为能够自主发现可利用漏洞。

加里·马库斯认为,同一发布也引发了相反的担忧。Astra采用的‘不透明递归’(opaque recurrence)推理技术使其思维链更难被研究人员追踪,他直言不讳地指出:‘人们真的不希望在能力增强的同时,监控性反而降低’[3]

综合来看,OpenAI所描绘的这款能够自主执行任务的模型——呼应‘Put That There’的愿景,并配备Codex上下文保留升级——恰恰也是首次进入历史上仅限于最强大系统的威胁类别。这一组合使得一个OpenAI尚未充分回答的问题变得尤为沉重:当Astra承担起更长、更自主的任务,且其推理路径更难审计时,究竟由谁来监督它的运作?

历史背景

首次展示了‘Put That There’,这是一个允许用户通过指向和语音构建并修改图形显示的语音与手势系统——正是OpenAI Astra发布视频所重现的演示。
发表了题为《Put That There: Voice and Gesture at the Graphics Interface》的正式论文,描述了该系统及其目标:打造一种对话式、容错的多模态界面。
在OpenAI发布GPT-6 Astra的同一天,ChatGPT/Codex、Claude和Grok均遭遇同时段服务中断,引发关于在自家聊天机器人不可用时测试‘AGI时代’模型的调侃。

关键关系图

关键玩家
主题

OpenAI的GPT-6 Astra发布与“AGI时代”宣言

OP

OpenAI

GPT-6 Astra的开发者与发布方;主导了此次发布、复古MIT演示的营销预热,以及通过总裁格雷格·布罗克曼表达的AGI叙事。

GR

Greg Brockman (OpenAI President)

公开宣称OpenAI已实现AGI,称Astra为‘代际飞跃’,并宣告‘欢迎来到AGI时代’,同时将AGI阈值重新定义为‘一种使命概念或精神概念’。

AN

Anthropic (Claude)

Claude在与ChatGPT相同的时段内同时离线,加剧了关于故障源于共享基础设施而非OpenAI专属事件的猜测。

XA

xAI (Grok)

Grok也在与ChatGPT和Claude相同的时间段内宕机,且据报道其服务中断在OpenAI和大部分Anthropic服务恢复后仍未解决。

MI

Microsoft Azure

关于共享原因导致中断的主流但未经证实的假设。

MI

MIT Media Lab / Architecture Machine Group (Chris Schmandt, Eric Hulteen, Richard Bolt)

1979至1982年间原创‘Put That There’语音与手势演示的创作者,该演示被OpenAI的Astra发布视频重现并致谢。

事实来源

9 条引用
  1. [1] Axios: OpenAI's Astra and the AGI-era claim
  2. [2] 9to5Mac: report on the ChatGPT/Codex GPT-6 Astra upgrade
  3. [3] Gary Marcus (Substack): commentary on GPT-6 Astra
  4. [4] 9to5Mac: report on the ChatGPT/Codex outage
  5. [5] LADbible: report on the ChatGPT/Gemini/Grok/Claude outage
  6. [6] BiGGo Finance: report on the AI outage coinciding with Astra's launch
  7. [7] King of Geek: coverage of the GPT-6 Astra launch video
  8. [8] MIT Media Lab: publication page for 'Put That There'
  9. [9] 9to5Google: coverage of the GPT-6 Astra launch

来源文章

Top 1

THE SIGNAL.

Analysts

称Astra为‘代际飞跃’,并表示他个人相信OpenAI已实现AGI,将AGI‘阈值’重新定义为‘一种使命概念或精神概念’:‘欢迎来到AGI时代。’

Greg Brockman
OpenAI总裁

对AGI叙事持怀疑态度,认为ARC-AGI的成功虽令人印象深刻,但并非AGI的证明——‘在ARC-AGI上取得成功固然出色且令人印象深刻,但并不能——尽管任务名称如此——证明实现了AGI’——并警告Astra的‘不透明递归’推理方式降低了可监控性:‘人们真的不希望在能力增强的同时,监控性反而降低。’

Gary Marcus
人工智能研究者、AGI怀疑论者,《Marcus on AI》(Substack)作者

在测试Astra的编程、写作和知识工作表现后给出了实操性对比评价,称其相比OpenAI此前模型确有提升,但也指出‘令人沮丧的习惯’,使其在顶级表现上仍不及某一竞品模型。

Dan Shipper
X用户@danshipper(在@every测试Astra)
The Crowd

GPT-6 Astra is state-of-the-art on FrontierMath Tier 4, ARC-AGI 3, and TerminalBench-4.0. GPT‑6 Astra is also a major advance for scientific discovery, with state-of-the-art performance on Terminal-Bench Science 0.1 and HealthBench Pro.

@@OpenAI5751

guess what just happened 💀 OpenAI launched GPT-6 Astra… and somehow, around the same time: ChatGPT went down. Claude went down. Grok went down. Gemini went down. Cursor went down. Coincidence? Probably. But what if OpenAI secretly stress-tested Astra on the entire AI

@@insanekrishnaa8

BREAKING: OpenAI just dropped GPT-6 ASTRA!!! 🚀✨ We've been testing it extensively at @every across coding, writing, and knowledge work. My take: it's a big upgrade from 5.6-Sol, with some frustrating habits that keep it from matching Fable at the top end. Here's your vibe

@@danshipper484

GPT-6 Astra | OpenAI

@u/MatricesRL662
Broadcast
GPT-6 Astra Preview: FIRST LOOK, Opus 5.1, Claude's Downfall? & HY4 - Best Open Model?! AI NEWS!

GPT-6 Astra Preview: FIRST LOOK, Opus 5.1, Claude's Downfall? & HY4 - Best Open Model?! AI NEWS!

OpenAIs Astra (GPT-6) Will Shock The World

OpenAIs Astra (GPT-6) Will Shock The World

GPT 6 Astra Could Be OpenAI's Biggest Model Yet!

GPT 6 Astra Could Be OpenAI's Biggest Model Yet!