什么是‘真正’的递归自我改进——以及为何大多数实验室尚未达到
多年来,行业对“递归自我改进”一词的使用一直较为宽泛,但一篇来自上海交通大学、清华大学、字节跳动和上海人工智能实验室的33人署名论文试图为这一术语划定明确边界。《人类建造的最后一台AI:迈向真正的递归自我改进》将RSI定义为AI将经验和反馈转化为持久性改变,从而提升其自身能力以及未来自我改进过程本身 [1],并提出了一个五阶段自主性路线图,从AI仅执行人类设计的改进,逐步发展到改进策略与经验获取、环境适应,最终实现完整的递归元改进 [1]。这一框架之所以重要,是因为它为该领域提供了一个诊断工具(即论文中的“空间闭合指数”),用于衡量任一系统距离真正的RSI还有多远。
以这一标尺衡量,目前最具体的现实案例——DeepMind的AlphaEvolve——虽令人印象深刻,但范围仍较狭窄。这个由Gemini驱动的编码代理找到了一种更智能的方法,将大型矩阵乘法操作拆分为子问题,使其在Gemini自身架构中的一个内核提速23%,缩短Gemini训练时间约1%,并持续回收谷歌全球数据中心约0.7%的计算资源 [3]。这些是真实且已在生产环境中取得的成果,也是目前唯一能证明AI对AI改进确实可行的有力证据。但这些成果仍处于路线图的早期阶段——即改进人类指定的特定流程,而非递归元改进阶段,后者要求系统从头到尾重新设计自身的改进策略。AlphaEvolve实现的23%内核提速与路线图最终阶段之间的差距,正是本专题其余部分所探讨的核心矛盾。


