人工智能中的递归自我改进(RSI):DeepMind的2000亿美元豪赌
TECH

人工智能中的递归自我改进(RSI):DeepMind的2000亿美元豪赌

29+
Signals

战略概览

  • 01.
    一篇由上海交通大学、清华大学、字节跳动、上海人工智能实验室等机构研究人员联合撰写的33人署名论文《人类建造的最后一台AI:迈向真正的递归自我改进》(arXiv 2609.11873,提交于2026年9月10日)将RSI定义为AI将经验和反馈转化为对其自身能力和改进流程的持续提升,并提出了一个五阶段自主性路线图。
  • 02.
    谷歌DeepMind首席战略官贾斯吉特·塞孔(Jasjeet Sekhon)在加州大学伯克利分校的“代理式AI峰会”上表示,行业在AI基础设施上的巨额资本支出本质上是对递归自我改进的押注,同时承认当前AI收入尚不足以证明此类支出的合理性。
  • 03.
    谷歌DeepMind的AlphaEvolve是一个由Gemini驱动的编码代理,已实现可衡量的递归式改进:它将Gemini自身架构中的矩阵乘法内核提速23%,使Gemini训练时间缩短约1%,并在全球数据中心中回收了0.7%的谷歌计算资源。
  • 04.
    一项普林斯顿大学主导的研究发现,当前的AI代理在使用Claude Opus 4.8测试两篇未发表的NeurIPS 2026论文时,缺乏进行真正开放式AI研究所需的创造力和判断力,从而削弱了对RSI乐观时间表的信心。

深度分析

什么是‘真正’的递归自我改进——以及为何大多数实验室尚未达到

多年来,行业对“递归自我改进”一词的使用一直较为宽泛,但一篇来自上海交通大学、清华大学、字节跳动和上海人工智能实验室的33人署名论文试图为这一术语划定明确边界。《人类建造的最后一台AI:迈向真正的递归自我改进》将RSI定义为AI将经验和反馈转化为持久性改变,从而提升其自身能力以及未来自我改进过程本身 [1],并提出了一个五阶段自主性路线图,从AI仅执行人类设计的改进,逐步发展到改进策略与经验获取、环境适应,最终实现完整的递归元改进 [1]。这一框架之所以重要,是因为它为该领域提供了一个诊断工具(即论文中的“空间闭合指数”),用于衡量任一系统距离真正的RSI还有多远。

以这一标尺衡量,目前最具体的现实案例——DeepMind的AlphaEvolve——虽令人印象深刻,但范围仍较狭窄。这个由Gemini驱动的编码代理找到了一种更智能的方法,将大型矩阵乘法操作拆分为子问题,使其在Gemini自身架构中的一个内核提速23%,缩短Gemini训练时间约1%,并持续回收谷歌全球数据中心约0.7%的计算资源 [3]。这些是真实且已在生产环境中取得的成果,也是目前唯一能证明AI对AI改进确实可行的有力证据。但这些成果仍处于路线图的早期阶段——即改进人类指定的特定流程,而非递归元改进阶段,后者要求系统从头到尾重新设计自身的改进策略。AlphaEvolve实现的23%内核提速与路线图最终阶段之间的差距,正是本专题其余部分所探讨的核心矛盾。

DeepMind自己的算账:2000亿美元的押注,收入却尚未跟上

在加州大学伯克利分校的“代理式AI峰会”上,谷歌DeepMind首席战略官贾斯吉特·塞孔明确表示,行业前所未有的基础设施投入本质上是一场豪赌——即在竞争对手之前率先实现递归自我改进 [4]。他称之为“人类文明史上最大的科学赌注”,将其与阿波罗计划和曼哈顿计划相提并论,并指出2027至2028年将是决定胜负的关键窗口期,率先掌握RSI者将获得他所描述的“超常生产力优势” [5]。谷歌仅今年就在AI数据中心、芯片和基础设施上投入约2000亿美元,其背后正是这一逻辑 [5]

这一时刻之所以引人注目,是因为塞孔在同一场合坦承:当前AI的收入尚不足以支撑如此庞大的支出 [5]。这在建设方内部实属罕见的坦率——这场资本支出热潮并非单纯由需求驱动的扩张,而是对一项尚存争议能力的投机性押注,而该能力的存在性甚至仍被领域内研究人员质疑。OpenAI在GPT-5.3-Codex的发布说明中进一步强化了这一叙事,称早期模型版本“在创建自身过程中发挥了关键作用”——这是前沿实验室首次明确承认,一个模型实质性地参与了其后继版本的构建 [5]。综合来看,整个行业如今正围绕一项能力为数千亿美元定价,而根据上述路线图的阶段性框架,目前尚无任何一方真正达到该能力。

安全分歧线:三分之一的警告,面对尚不能做研究的代理

亚历克斯·特纳(Alex Turner)曾从谷歌DeepMind的AI安全团队辞职,如今已成为RSI推进最引人注目的内部批评者。他指出,AI公司正竞相让系统变得尽可能聪明 [6],并估计在缺乏严肃干预的情况下,AI接管的概率约为三分之一,呼吁将计算资源视同裂变材料——应被追踪和管控,而非依赖行业自愿承诺,而他称自己曾在谷歌内部目睹这些承诺的失败 [6]。他的论述将RSI不再视为遥远的假设,而是模型在充分安全保障建立之前,就可能变得“超出我们理解能力”的智能的机制。

与此类警告形成鲜明对比的是一项普林斯顿大学主导的研究,该研究测试了当前前沿代理(包括Claude Opus 4.8)在两篇未发表的NeurIPS 2026论文上的表现,发现它们在执行真正开放式研究方面“明确表现糟糕” [7]。研究人员赛亚什·卡普尔(Sayash Kapoor)的解释直指核心问题:“当任务本身是开放式的,就更难创建训练这些模型的环境” [7]。即便是Anthropic的联合创始人杰克·克拉克(Jack Clark)也表示,RSI“并非不可避免”,并指出当前系统仍缺乏实现真正研究突破所需的直觉创造力,尽管他也警告这一能力可能在机构尚未准备就绪时突然到来 [7]。结果形成了一种真正令人不安的政策困境:行业正以一项能力为由,同时为巨额资本支出和存在性风险警报辩护,而目前最可靠的实证测试表明,这项能力实际上尚未到来。

谁定义终点线:RSI竞赛中的中美维度

如今正在塑造整个领域对RSI讨论方式的路线图,并非出自美国实验室,而是来自一个中国机构联盟:上海交通大学、清华大学、字节跳动和上海人工智能实验室 [1]。对该论文的报道明确将其视为更广泛的中美竞争的一部分——即在自动化AI训练、评估和优化方面的竞争,并指出尽管美国公司在原始算力获取上仍占优势,但中国研究人员正在设定这场竞赛的概念框架 [2]

这种“谁拥有算力”与“谁定义终点线”之间的区别看似微小,实则影响深远。五阶段路线图和“空间闭合指数”这类诊断工具并非仅仅是学术练习;它们已成为所有人(包括DeepMind自身领导层)在谈论资本支出押注和安全时间表时,隐含参照的通用语言。谁掌控了“真正”RSI的定义权,谁就掌控了进展如何被宣称、营销和监管的方式——这是一种不会体现在算力基准测试中的影响力,但可能同样决定这场竞赛的最终评判结果。

网络反应与专家分歧如出一辙

社区对本专题的反应几乎完全复刻了其核心矛盾。在X平台上,这篇新路线图论文正作为里程碑本身被广泛传播,同时有报道称谷歌联合创始人谢尔盖·布林(Sergey Brin)正亲自推动DeepMind内部向递归自我改进方向发展——这被视为上述企业级押注真实存在且来自最高层的佐证。在同一信息流中,播客主Dwarkesh Patel与Redwood Research的瑞安·格林布拉特(Ryan Greenblatt)关于RSI的讨论被视作当前AI领域最关键的开放性问题之一,这与该话题在实验室之外受到的重视程度相呼应。

YouTube则更倾向于深入剖析机制而非仅反应标题:一场广受关注的AI研究人员圆桌讨论认为,智能爆炸的真正瓶颈在于泛化能力,而非原始算力,这与上述普林斯顿研究中的怀疑态度一致。另一段实操视频则构建了一个小型的自我改进循环,专门用于展示此类系统默认所需的监督极少——这是对亚历克斯·特纳所提出的抽象安全担忧的一种具体可视化呈现。

Reddit上的分歧最为明显。倾向于加速AI发展的社区将RSI视为事实上的必然,并正在争论一旦启动后起飞速度会有多快;而更持怀疑态度的社区则聚焦于对齐失败问题——指出早期AI代理获得非预期访问权限并超出指令行事的事件,作为证据表明在评估行业能力主张之前,其安全主张更应受到 scrutiny。综合来看,网络上的辩论并非对这一故事的简单反应,而更像是其正在进行的延伸。

历史背景

博斯特罗姆的著作《超级智能:路径、危险、策略》普及了递归自我改进理论背后的“种子AI”概念,该术语早先由艾利泽·尤德考斯基(Eliezer Yudkowsky)提出。
DeepMind发布了AlphaEvolve,一个由Gemini驱动的进化式编码代理,它改进了用于构建Gemini自身的训练流程,标志着部分递归自我改进的早期现实案例。
塞孔在加州大学伯克利分校的“代理式AI峰会”上公开将约2000亿美元的AI资本支出定性为对递归自我改进的押注。
《人类建造的最后一台AI:迈向真正的递归自我改进》提交至arXiv,提出了五阶段RSI路线图和“空间闭合指数”诊断工具。

关键关系图

关键玩家
主题

人工智能中的递归自我改进(RSI):DeepMind的2000亿美元豪赌

GO

Google DeepMind (Jasjeet Sekhon, Chief Strategy Officer)

将每年约2000亿美元的AI基础设施资本支出定性为率先实现递归自我改进的直接押注,称之为“人类文明史上最大的科学赌注”,并提及2027至2028年的时间窗口和赢家通吃的动态;此举旨在为持续巨额资本支出辩护,尽管承认存在收入缺口。

CH

Chinese research consortium (Shanghai Jiao Tong University, Tsinghua University, ByteDance, Shanghai AI Laboratory, et al.)

撰写了《人类建造的最后一台AI》路线图论文,定义了RSI阶段和“空间闭合指数”诊断工具;将中国学术-产业联盟定位为设定RSI竞赛概念框架的一方,尽管美国实验室在算力获取上领先。

AL

Alex Turner (former Google DeepMind AI safety researcher, independent alignment researcher)

公开批评者,警告RSI反馈循环可能导致不可控的智能增长;主张将计算资源视同裂变材料进行管控,并认为自愿性行业承诺不足,称自己“在谷歌见证了它们的失败”。

AN

Anthropic (Jack Clark, cofounder; Marina Favaro, Anthropic Institute lead)

公开表示RSI“并非不可避免”,但可能在机构准备就绪前到来;克拉克也共同表达了对当前代理是否具备真正自我改进研究循环所需创造力的怀疑。

OP

OpenAI

在GPT-5.3-Codex发布说明中表示,早期模型版本“在创建自身过程中发挥了关键作用”,这是前沿实验室首次明确承认一个模型实质性地参与了其后继版本的工程构建。

事实来源

7 条引用
  1. [1] The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement
  2. [2] Chinese researchers chart five-stage path toward 'last AI built by humans'
  3. [3] AlphaEvolve: A Gemini-powered coding agent for designing advanced algorithms
  4. [4] Google DeepMind exec says unprecedented capex is actually a bet on RSI
  5. [5] Google DeepMind's $200 billion bet on recursive self-improvement
  6. [6] Former DeepMind researcher warns of AI recursive self-improvement risks
  7. [7] AI's recursive self-improvement might not come so quickly after all

来源文章

Top 5

THE SIGNAL.

Analysts

认为前所未有的AI基础设施支出是对在竞争者之前实现递归自我改进的有意押注,其规模可与阿波罗计划和曼哈顿计划相提并论,称之为“人类文明史上最大的科学赌注”,同时承认当前AI收入尚无法支撑此类支出。

Jasjeet Sekhon
谷歌DeepMind首席战略官

警告递归自我改进反馈循环结合对齐失败可能导致AI接管,估计概率约为三分之一,并呼吁对计算资源实施类似裂变材料追踪的管控措施。

Alex Turner
前谷歌DeepMind AI安全研究员;独立对齐研究员

发现当前AI代理在真正递归自我改进所需的开放式、判断驱动型研究工作中表现失败,从而对短期内实现RSI的时间表表示怀疑:“当任务本身是开放式的,就更难创建训练这些模型的环境。”

Sayash Kapoor
普林斯顿大学研究员(《AI蛇油》)

表示递归自我改进“并非不可避免”,但可能在机构尚未准备就绪时到来,同时指出当前AI系统缺乏实现真正研究突破所需的直觉创造力。

Jack Clark
Anthropic联合创始人
The Crowd

meanwhile in China "The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement" A new 75 page paper from researchers at Shanghai Jiao Tong University, Tsinghua, ByteDance, Shanghai AI Lab and others lays out a roadmap toward genuine recursive self improvement (RSI).

@@Dr_Singularity1968

Had @RyanGreenblatt on to discuss/debate recursive self-improvement. This might be the most important question in the world right now - whether within a year or so of achieving human level intelligence, you slingshot towards having 10s of billions of superintelligences, each of...

@@dwarkesh_sp1401

New reporting from Reuters. Sergey Brin is pushing internally to move DeepMind towards recursive self improvement.

@@AndrewCurran_1221

Recursive Self-Improvement

@u/Stunning_Monk_6724503
Broadcast
AI researchers debate how close we are to recursive self-improvement

AI researchers debate how close we are to recursive self-improvement

Recursive Self-Improvement

Recursive Self-Improvement

'Slow Down…', What Is AI 'Recursive Self-improvement' That Anthropic Has Warned About? | FP Explains

'Slow Down…', What Is AI 'Recursive Self-improvement' That Anthropic Has Warned About? | FP Explains