四篇论文,一个模式:智能体现在能自行演化测试框架、环境与技能
2026年9月的短短数日内,四个独立研究团队几乎同时发表了基于同一核心理念的研究成果:一种不仅能改进自身回答,还能优化其周围系统的大型语言模型智能体——即它自身的测试框架、训练环境或技能库。其中最引人注目的例子是由上海交通大学、新加坡国立大学和DP Technology研究人员构建的iCoder-27B——一个拥有270亿参数、专用于RTL芯片设计和GPU内核优化的模型。人类专家预先设定目标和权限边界后,该智能体便自行选择实验、诊断失败并修订自身的训练策略[1]。其结果在RTLLM基准测试中领先,在CVDP和KernelBench L2上比GPT-5.5高出16分,并在TritonBench上与Claude-Opus-4.8打成平手[1]。
另外三篇配套论文则聚焦于这一问题的更窄切面。RRSI(正则化递归自我改进)允许智能体演化其测试框架——即围绕固定模型的提示词、工具调用、记忆和控制流——并通过一个批评器在不良提案加剧前将其剪枝[2]。Env-Rethink则反向操作:不是让智能体适应固定环境,而是让它从自身轨迹中构建‘集合地图’和‘事件日志’,并利用这些信息随着能力提升而演化出更具挑战性的训练环境[3]。SkillPivot针对的是更微妙的失败模式——当智能体执行过程中途出错时,它能精确定位偏差点,并让更强的模型仅完成剩余部分,从而保留此前正确的输出[4]。第五篇相关论文Auto-Robotist将同样的‘将搜索转化为记忆’思路应用于物理机器人设计,将形态进化搜索提炼为可复用、可审查的技能库,使冷启动搜索速度提升约5倍[5]。这类工作并非前所未有——Sakana AI的达尔文哥德尔机(Darwin Godel Machine)已展示过在沙箱监督下重写自身代码的编码智能体[6],Meta的HyperAgents研究也形式化了‘元智能体’的概念,即能够编辑任务智能体及其自我修改过程的系统[7]——但如此多独立团队在同一周内密集发布此类成果,才是真正的新闻所在。


