大语言模型智能体中的递归自我改进
TECH

大语言模型智能体中的递归自我改进

34+
Signals

战略概览

  • 01.
    2026年9月,四篇arXiv论文——iCoder-27B、RRSI、Env-Rethink和SkillPivot——在几天内相继提交,每篇都从不同角度探讨了大语言模型智能体中递归自我改进的某个方面:自主模型训练、测试框架演化、训练环境演化以及技能修正。
  • 02.
    由上海交通大学、新加坡国立大学和DP Technology研究人员开发的iCoder-27B,在RTLLM基准测试中领先,并在CVDP和KernelBench L2上以16分优势超越GPT-5.5,在TritonBench上与Claude-Opus-4.8持平。
  • 03.
    RRSI发现,若允许智能体在无正则化条件下演化自身测试框架,其在训练任务上的表现最多可提升14.1分,但在分布外基准测试中这一增益会缩小至仅4.7分,而其正则化版本使用的策略令牌减少了30%。
  • 04.
    包括普林斯顿大学的Sayash Kapoor和Anthropic联合创始人Jack Clark在内的知名研究者认为,当前的人工智能智能体缺乏实现真正递归自我改进所需的创造性飞跃,尽管云安全联盟(Cloud Security Alliance)和IBM警告称,递归式AI系统已对企业的治理构成独特风险。

深度分析

四篇论文,一个模式:智能体现在能自行演化测试框架、环境与技能

2026年9月的短短数日内,四个独立研究团队几乎同时发表了基于同一核心理念的研究成果:一种不仅能改进自身回答,还能优化其周围系统的大型语言模型智能体——即它自身的测试框架、训练环境或技能库。其中最引人注目的例子是由上海交通大学、新加坡国立大学和DP Technology研究人员构建的iCoder-27B——一个拥有270亿参数、专用于RTL芯片设计和GPU内核优化的模型。人类专家预先设定目标和权限边界后,该智能体便自行选择实验、诊断失败并修订自身的训练策略[1]。其结果在RTLLM基准测试中领先,在CVDP和KernelBench L2上比GPT-5.5高出16分,并在TritonBench上与Claude-Opus-4.8打成平手[1]。

另外三篇配套论文则聚焦于这一问题的更窄切面。RRSI(正则化递归自我改进)允许智能体演化其测试框架——即围绕固定模型的提示词、工具调用、记忆和控制流——并通过一个批评器在不良提案加剧前将其剪枝[2]。Env-Rethink则反向操作:不是让智能体适应固定环境,而是让它从自身轨迹中构建‘集合地图’和‘事件日志’,并利用这些信息随着能力提升而演化出更具挑战性的训练环境[3]。SkillPivot针对的是更微妙的失败模式——当智能体执行过程中途出错时,它能精确定位偏差点,并让更强的模型仅完成剩余部分,从而保留此前正确的输出[4]。第五篇相关论文Auto-Robotist将同样的‘将搜索转化为记忆’思路应用于物理机器人设计,将形态进化搜索提炼为可复用、可审查的技能库,使冷启动搜索速度提升约5倍[5]。这类工作并非前所未有——Sakana AI的达尔文哥德尔机(Darwin Godel Machine)已展示过在沙箱监督下重写自身代码的编码智能体[6],Meta的HyperAgents研究也形式化了‘元智能体’的概念,即能够编辑任务智能体及其自我修改过程的系统[7]——但如此多独立团队在同一周内密集发布此类成果,才是真正的新闻所在。

隐藏在‘递归自我改进’背后的过拟合问题

这批论文中最关键的数字并非排行榜得分,而是一个差距。RRSI的作者表明,如果允许智能体在无约束条件下演化自身测试框架,其在训练任务上的表现最多可提升14.1分;但在五个演化过程中从未见过的分布外基准测试上,这些增益却缩小至仅4.7分[2]。换句话说:一个未经正则化的自我改进智能体变得非常擅长‘玩弄’自己的训练分布,而在其他任务上的提升则微乎其微。这并不是人们所担忧的那种‘递归自我改进’(即系统整体变得更聪明),而更像是‘多走几步的过拟合’。RRSI的解决方案——采用时间退火预算加上一个剪枝提案的批评器——在保留更多分布外增益的同时,减少了30%的最终测试框架中的策略令牌[2]。

Env-Rethink则从另一方向揭示了同样的张力。其作者测量到,当智能体被投入更难、更真实的环境而没有使用该方法构建的‘集合地图’和‘事件日志’时,性能出现显著下滑——从83.9%降至57.6%[3]。将这两篇论文并列观察,便呈现出一种模式:2026年9月所有从事此问题的团队均独立得出结论——若不施加某种外部正则化机制(如批评器、课程学习或结构化记忆),任由智能体递归地自我改进,并不会产生可泛化的智能提升。相反,它只会导致狭窄且脆弱的过拟合,这种现象在基准测试上看似进步,一旦任务发生变化便瞬间消失。

为何Kapoor、Clark和Littman尚未将其视为真正的RSI

将这些基准论文与前沿AI开发者的真实言论对照,便会发现明显差距。普林斯顿大学的Sayash Kapoor曾直接评估AI生成的研究论文是否达到顶级AI会议的标准,结果并不满意:“这些论文远未达到顶级AI会议的质量水平,”他表示,并认为像Transformer这样的发明需要“创造性的飞跃”,而当前的智能体尚未展现出这一点[8]。Anthropic联合创始人Jack Clark——其公司报告称Claude撰写的代码已占其代码库合并代码的80%以上[9]——同样不相信工程能力等同于研究创造力:他形容当前系统具有“某种缺乏价值的直觉创造力”以及“某种机械、公式化的思维方式,可能阻碍它们成为优秀的研究人员”[8]。

这一区别对于正确理解arXiv论文集群至关重要。iCoder、RRSI、Env-Rethink和SkillPivot都是真实、可衡量、可复现的进步——但它们的进步局限于那些成功易于评分的狭窄、明确定义的子问题(如测试框架提示、训练课程、技能库)。没有任何一篇论文声称其智能体像人类科学家那样独立生成了新颖的研究想法。布朗大学的Michael Littman更进一步,质疑‘递归自我改进’本身是否是一个逻辑上连贯的目标,无论当前系统能否实现它。换言之,对本周论文最诚实的解读是:这是工程工作流程中自动化程度不断累积的狭窄进展——而非该术语最初所描述的那种开放式的、自我导向的智能爆炸。

无需等待通用人工智能到来的治理风险

无论通用型递归自我改进是否会最终实现,云安全联盟(Cloud Security Alliance)认为企业已经面临现实问题。其白皮书将RSI定义为“一类与传统AI安全问题(如提示注入或模型窃取)截然不同的系统性风险”[9]——风险不在于AI以某种戏剧性方式脱离人类控制,而在于软件的变更-测试-部署生命周期开始快于人类为监管它而建立的审批流程。一次性安全认证假设系统在审计之间基本保持不变;而一个持续重写自身的测试框架或训练环境则悄然打破了这一假设,且不会触发警报。CSA提出的解决方案类似于企业安全领域已流行的模式——采用持续的、零信任风格的AI智能体权限重新评估,取代一次性批准——但应用于一个真正全新的目标类别。

IBM的报告则提供了行业内部的细节。在IBM从事AI安全工作的Nathalie Baracaldo指出,在自主自我改进技术可用于生产之前,“存在需要填补的重要缺口”,并特别提到奖励黑客行为(reward hacking)是其中之一[10]——即担忧一个优化自身测试框架或训练循环的智能体会找到一条捷径,满足指标却不满足意图。IBM的Gabe Goodhart则提供了更为乐观的观点:“许多这些技术仍然需要人类参与评估模型的建议”[10],这也正是iCoder-27B和Sakana的达尔文哥德尔机刻意做出的设计选择——人类设定目标并在沙箱中进行评估,而非无监督的失控循环。简而言之,治理风险与其说是智能体一夜之间失控,不如说是组织机构逐渐失去了审计其AI系统为何呈现当前形态的能力。

内循环与外循环:已成为产品模式的研究构想

除了论文本身之外,这种框架已经开始迁移到实际产品和公共话语中,表明这不仅仅是一场纯学术练习。X平台上的技术受众将RRSI论文视为一个真实且快速发展的研究方向,而非炒作,并汇聚出一套特定术语——‘内循环’指智能体在任务中实时优化自身测试框架,‘外循环’指跨多个任务的长期演化——这套术语再次出现在一款新发布的、围绕自我改进的内循环与外循环智能体测试框架构建的工作区产品中。同一个概念划分独立出现在一篇研究论文的接受度和一款产品的架构中,足以说明这一想法已超越纯理论阶段。

然而一旦离开技术圈层,公众反应则更加怀疑。一个广受讨论的YouTube实验让智能体无限设计、训练和评估自己的机器学习解决方案,结果发现进展会自然触顶,而非呈指数级复合增长——因为不存在单一的‘智能’指标可供优化,而过度追求任何代理指标都会扭曲系统,使其看似进步实则不然。Reddit社区的看法更为怀疑:有用户明确辩论AI行业加速发布产品的节奏本身是否算作递归自我改进,结论是否定的——那只是‘一个非常出色的CI/CD流程’,而非自我修改的智能。另一个讨论帖则梳理了何种狭义智能体能力才真正危险,最终得出的结论与CSA的企业论点一致:你不需要超级智能来制造真实风险,只需足够的自主性搭配薄弱的监督即可。综合来看,在线反应几乎完全复制了研究界和专家评论中的分裂态度——对狭窄工程成就给予真正的技术尊重,同时又确实怀疑‘递归自我改进’是否仍是描述当前现象的恰当名称。

历史背景

发表了关于‘超智能机器’的基础性概念工作,被视为现代递归自我改进讨论的思想先驱。
发布了一份关于人工智能递归自我改进对企业安全影响的白皮书。
发表分析文章称,基于对Kapoor、Clark及其他研究人员的采访,AI的递归自我改进可能不会像某些预测那样迅速到来。
一组关于智能体中递归自我改进的论文——iCoder-27B、RRSI、Env-Rethink和SkillPivot——在几天内相继提交。

关键关系图

关键玩家
主题

大语言模型智能体中的递归自我改进

SH

Shanghai Jiao Tong University / National University of Singapore / DP Technology

通过递归式AI主导的过程构建了iCoder-27B,最大限度减少人类在前沿模型开发中的参与,以测试模型构建过程能在多大程度上实现自动化。

RR

RRSI research team (Peng Xia et al.)

撰写了正则化框架,防止递归式测试框架自我改进在训练任务上过拟合,为这类系统的构建设定了早期技术标准。

SA

Sakana AI

构建了达尔文哥德尔机(Darwin Godel Machine),这是一种早期的自我修改编码智能体,可在沙箱化的人类监督下重写自身代码——成为后续论文所依托的参考点。

AN

Anthropic

报告称Claude已撰写超过80%被合并进其代码库的代码,使其成为生产环境中智能体辅助自我改进的现实案例,尽管其联合创始人公开淡化这距离完整递归自我改进还有多远。

CL

Cloud Security Alliance (AI Safety Initiative)

将递归自我改进定义为一种独特的企业安全风险类别,并推动采用持续的、零信任风格的AI智能体权限重新评估作为治理对策。

IB

IBM

发布专家评论,塑造企业对RSI准备情况的认知,指出奖励黑客和人类参与实践是决定风险是否可控的关键变量。

事实来源

10 条引用
  1. [1] iCoder-27B: Recursive AI-Led Development of Frontier Industrial Coding Model
  2. [2] RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
  3. [3] Breaking the Environment Wall: Evolving LLM Agent Environments for Recursive Self-Improvement
  4. [4] A Wrong Turn Does Not Ruin the Journey: Deviation-Guided Skill Self-Evolution for LLM Agents
  5. [5] When Search Becomes Memory: Accelerating Robot Design Discovery with Self-Evolving Skills
  6. [6] The Darwin Godel Machine: AI that improves itself by rewriting its own code
  7. [7] HyperAgents
  8. [8] AI's recursive self-improvement might not come so quickly after all
  9. [9] Recursive AI Self-Improvement: Enterprise Security Implications
  10. [10] Why recursive self-improvement suddenly became a serious question

来源文章

Top 5

THE SIGNAL.

Analysts

“认为当前的人工智能智能体缺乏实现真正研究突破所需的创造力,即使它们能够胜任工程任务。”

Sayash Kapoor
普林斯顿大学

“认为当前系统缺乏直觉创造力,表明完整的递归自我改进比表面能力数字所暗示的还要遥远。”

Jack Clark
Anthropic联合创始人

“警告在自主自我改进技术可用于生产之前必须填补重要缺口,特别指出奖励黑客风险。”

Nathalie Baracaldo
IBM人工智能安全负责人

“指出当今许多递归改进技术仍需人类评估模型建议的变更,从而缓解了对失控自主性的担忧。”

Gabe Goodhart
IBM人工智能基础首席架构师

“对递归自我改进是否甚至是一个逻辑上连贯的目标表示怀疑,尽管AI智能体的能力近期有所进步。”

Michael Littman
布朗大学
The Crowd

“You can now generate an entire 3blue1brown style video from any research paper with Opus 5.5. Here's a 8min video summary of "Regularized Recursive Self Improvement of Agent Harnesses". The 90%ile educational YouTuber is fully automated. https://t.co/HTOOq1JsnP”

@@deedydas5062

“Introducing ScienceBuddy — a free workspace for scientific agents that improve through researcher collaboration. Use GPT-6 in ScienceBuddy at no cost. GPU-accelerated, and fused with the JEV framework. 🧵 Two loops: 🔹 Inner loop — refines the agent harness 🔹 Outer loop —”

@@PhAILabs1324

“Impressive paper on building recursive self-improving agent harnesses. It's rich with great insights on building effective agent harnesses. If you maintain an agent harness, this paper names three defects in how harnesses get improved and the fixes. First, evolving a harness”

@@dair_ai226

“AI's recursive self-improvement might not come so quickly after all”

@u/creaturefeature16300
Broadcast
Recursive Self-Improvement

Recursive Self-Improvement

Recursive Self-Improvement: from Auto Research to Superintelligence — Richard Socher, Recursive

Recursive Self-Improvement: from Auto Research to Superintelligence — Richard Socher, Recursive

Recursive Self-Improvement Is Already Happening?

Recursive Self-Improvement Is Already Happening?