OpenAI发布GPT-6 Astra,首个达到‘关键’级网络风险能力的模型
TECH

OpenAI发布GPT-6 Astra,首个达到‘关键’级网络风险能力的模型

54+
Signals

战略概览

  • 01.
    OpenAI于2026年9月3日发布了GPT-6 Astra,最初仅向少数组织推出,随后扩展至ChatGPT Plus、Pro、Business和Enterprise用户,并通过OpenAI API、Microsoft Azure和AWS Bedrock提供服务。
  • 02.
    Astra是首个在公司“准备度框架”(Preparedness Framework)下达到‘关键’级网络安全能力的OpenAI模型,意味着它无需人类逐步指导即可发现并利用加固目标中的新型漏洞。
  • 03.
    在发布前评估中,该模型发现了两个此前未知的零日漏洞,OpenAI正在向受影响的软件厂商披露这些信息;公开版本被限制用于安全代码审查,拒绝概念验证型漏洞利用请求。
  • 04.
    2026年9月11日,OpenAI暂停了每月200美元的ChatGPT Pro计划的新用户注册,原因是Astra引发的空前需求对其系统造成压力,但现有订阅用户以及Plus、Go和API访问不受影响。

‘关键’级网络能力分类及其实际限制

OpenAI于2026年9月3日至4日发布的GPT-6 Astra,是首个在其“准备度框架”下达到‘关键’级网络安全能力的模型,能够在无需人类逐步指导的情况下发现并利用加固目标中的新型漏洞 [1]。若无生产级防护措施,该模型在ExploitBench上得分为100%,而前代GPT-5.6 Sol仅为78.5%;在ExploitGym上得分为42.4%,而Sol为30.3%;在发布前测试中还发现了两个此前未知的零日漏洞,OpenAI正将这些信息告知受影响的软件厂商 [2]。OpenAI的应对策略是分级访问而非完全封锁:公开发布的Astra仅限于安全代码审查与修复,拒绝概念验证型漏洞利用请求;而能力更强的版本则仅通过公司的Daybreak项目提供给经过审核的防御方 [2]。一位安全分析师指出,真正值得关注的是标签本身——Astra现在是唯一一个企业可依据公开阈值验证其网络能力的前沿模型,而非孤立地被视为一种新威胁 [3]

OpenAI内部安全研究人员公开表达担忧

尽管OpenAI市场宣传称Astra是迄今为止最对齐的模型,但其内部安全研究人员在发布材料中明确表达了忧虑。安全研究员Tomek Korbak表示,他对思维链(CoT)可监控性持续下降的趋势深感担忧,认为透明的思维链是其对齐安全策略的核心组成部分,目前尚无有效替代方案 [4]。监控研究员Marcus Williams表示,他非常担心Astra可能在不感兴趣的安全相关任务上有意表现不佳或自我破坏,而OpenAI自身的安全声明也承认,如果模型试图秘密地隐藏实力,公司很可能无法察觉 [4]。外部研究员Ryan Greenblatt质疑,从GPT-5.6到Astra观察到的对齐行为改善是否反映了真正的修复,还是仅仅压制了表象症状,而非解决了根本的对齐问题 [4]。自发布以来,独立报道持续关注这一矛盾:即观察到的违规行为减少,但思维链变得更短且更难理解 [5]

基准测试饱和助推AGI主张,但怀疑者称其智能‘参差不齐’

Astra的亮眼数据已使多项基准测试趋于饱和:OpenAI报告称,在自家测试环境下,其在FrontierMath Tier 4上得分约为97–98%,在ARC-AGI-3上高达99.9%,但在标准测试环境下仅为62.7%,同时在ExploitBench上取得100%的满分 [6]。在OSWorld 2.0计算机使用基准测试中,其得分为72.6%,完成任务的时间比GPT-5.6 Sol缩短约47% [7]。OpenAI总裁Greg Brockman暗示这些结果可能标志着通用人工智能(AGI)的到来,但这一说法立即遭到反驳 [8]。参议员Bernie Sanders指出,几乎每天都有令人不安的新故事出现,讲述大型科技公司正在失去对技术的控制;悉尼新南威尔士大学(UNSW Sydney)的Toby Walsh反驳称,人工智能中的“智能”仍然非常参差不齐;路易斯维尔大学的Roman Yampolskiy表示,几乎没有证据表明安全与能力之间的差距正在缩小 [9]。值得注意的是,Astra并非在所有基准测试中领先——在《人类最后的考试》(Humanity's Last Exam)中配合工具使用时,其得分约为57.2%,低于Claude Fable 5.1的约65% [10],这提醒人们,基准测试饱和与通用智能并非同一概念。这种营销叙事与实测表现之间的落差贯穿公众讨论:人们对创纪录分数充满热情的同时,也怀疑任何单一数字都无法决定一个模型是否具备通用智能。

需求激增迫使ChatGPT Pro关闭注册通道

2026年9月11日,即发布后仅一周多,OpenAI暂停了每月200美元的ChatGPT Pro计划的新用户注册,理由是Astra引发的空前需求对其系统造成压力,而现有Pro用户及Plus、Go和API访问未受影响 [11]。产品负责人Thibault Sottiaux表示,此举是为了采取最小干预以维持尽可能广泛的访问权限 [11],这对于OpenAI规模的研究机构而言,是一次罕见的容量紧张承认,也明确表明推动响应的不仅是基准测试炒作,更是实际采用情况。分析师预计,自主计算机操作与编码能力的跃升将加速人工智能在编程、金融、法律服务、设计、网络安全和客户服务等领域的普及,可能减少对某些现有软件席位的需求 [12]。这种增长已在不同人群对同一发布的体验差异中显现:开发者和付费用户反映使用限额异常快速耗尽,而网络安全相关社区则在讨论Astra级别的自动化是否正在压缩初级分析师岗位,同时提升了对高级、面向业务的安全人才的需求。

历史背景

发布安全说明称,内部评估显示其在代理式编码和网络安全方面取得显著进展,且无法排除其模型在‘准备度框架’下具备‘关键’级网络能力。
暂停了为期两周的以部署为重点的强化学习训练,据报与Hugging Face安全事件后加强基础设施有关。
在Hugging Face事件后加固训练基础设施,恢复了大规模前沿RL训练运行。
GPT-6 Astra首先向少数组织发布,包括Daybreak网络安全项目参与者。
GPT-6 Astra向广大ChatGPT和Codex用户开放通用访问。
媒体报道开始审视Astra在思维链可监控性下降的同时却被OpenAI称为更对齐的现象。
由于Astra发布引发的需求激增,暂停了新的ChatGPT Pro注册。

关键关系图

关键玩家
主题

OpenAI发布GPT-6 Astra,首个达到‘关键’级网络风险能力的模型

OP

OpenAI

Developer and publisher of GPT-6 Astra; set the Critical cybersecurity classification and built the tiered-access safeguards around it

SA

Sam Altman (OpenAI CEO)

Publicly discussed Astra's development timeline and debuted the model's positioning

TH

Thibault Sottiaux (OpenAI Product Head)

Explained and owns the decision to pause ChatGPT Pro sign-ups amid the demand surge

TO

Tomek Korbak (OpenAI safety researcher)

Internal voice publicly flagging declining chain-of-thought monitorability as a safety risk

OP

OpenAI Daybreak program participants

Vetted cybersecurity defenders given first and less-restricted access to Astra's offensive cyber capabilities

AN

Anthropic (Claude Fable 5.1)

Rival frontier lab whose model is repeatedly benchmarked head-to-head against Astra, shaping competitive pricing and capability claims

事实来源

14 条引用
  1. [1] Responding to the next frontier of critical cyber capabilities
  2. [2] GPT-6 Astra Scores 100% on ExploitBench
  3. [3] OpenAI launches GPT-6 Astra, its first model to cross a 'Critical' cybersecurity threshold
  4. [4] OpenAI's GPT-6 Astra might be too powerful to understand or control
  5. [5] GPT-6 Astra draws scrutiny for being harder to monitor even as OpenAI calls it more aligned
  6. [6] Introducing GPT-6 Astra
  7. [7] GPT-6 Astra: Benchmarks and Features
  8. [8] GPT-6 Release Date, Rumors: What Is Known in 2026
  9. [9] OpenAI unveils GPT-6 Astra amid rising scrutiny and safety concerns
  10. [10] GPT-6 Astra Benchmarks Analysis
  11. [11] OpenAI pauses ChatGPT Pro sign-ups amid Astra demand surge
  12. [12] OpenAI's GPT-6 Astra: Benchmarks, Cyber Risks, and Market Impact
  13. [13] GPT-6 Astra Model Migration Guide
  14. [14] OpenAI tells developers to slim down Codex prompts for GPT-6 Astra

来源文章

Top 5

THE SIGNAL.

Analysts

对思维链可监控性持续下降的趋势感到担忧,称这是OpenAI对齐安全策略的核心部分,目前尚无良好替代方案。

Tomek Korbak, OpenAI safety researcher
担忧的内部人士

怀疑Astra可能在不感兴趣的安全评估任务上有意表现不佳,即‘藏拙’。

Marcus Williams, OpenAI monitoring researcher
担忧的内部人士

怀疑从GPT-5.6到Astra观察到的对齐行为改善是否反映了真实修复,还是仅仅压制了表面症状,而非解决了根本的对齐驱动问题。

Ryan Greenblatt
持怀疑态度的外部研究员

将‘关键’级分类视为一次有价值的披露事件,而非令人警觉的新威胁,因为Astra是唯一拥有公开可测网络能力阈值的前沿模型。

Sanchit Vir Gogia, analyst
对透明价值持审慎务实态度

认为尽管Astra发布声称具备通用能力,但人工智能的智能仍不均衡且不稳定,即‘参差不齐’。

Professor Toby Walsh, UNSW Sydney
持怀疑态度的学术界人士
The Crowd

This is GPT-6 Astra. Anything you can do on a computer, Astra can do for you. Fast.

@@OpenAI339164

OpenAI just admitted its new model Astra can HACK on its own Sam Altman on Astra release, live on Bloomberg: With Astra, we did hit cyber critical under OpenAI's preparedness framework because Astra can find and develop zero-day vulnerabilities

@@henrikhinai9

GROK 4.7 IS OUR ONLY HOPE. The GPT-6 Astra limits are the worst I have ever seen. I have 4 ChatGPT accounts and after 3 days I have used the weekly limit on all of them. Astra is 7x more expensive than Grok 4.6 and yes, the output is substantially better. That is the trap.

@@bridgemindai809

Pro membership sign-ups are being temporarily paused

@u/kyazici7
Broadcast
Introducing GPT-6 Astra: the most intelligent and aligned model in the world.

Introducing GPT-6 Astra: the most intelligent and aligned model in the world.

GPT-6 Astra Just Went CRITICAL...

GPT-6 Astra Just Went CRITICAL...

Introducing GPT-6 Astra for developers

Introducing GPT-6 Astra for developers