循环环形变换器(Recurrent Looped Transformer,RLT)架构
TECH

循环环形变换器(Recurrent Looped Transformer,RLT)架构

21+
Signals

战略概览

  • 01.
    Yifan Zhang于2026年9月12日以技术报告和GitHub项目的形式发布了循环环形变换器(RLT),该架构将一个48层因果编码器与一个48层循环解码器配对,后者在每个提示和响应token之间持续传递其隐藏状态和注意力缓存。
  • 02.
    该配置使每个token产生96个逻辑计算块,且由于解码器状态是累积而非重置的,经过t个token后,时间维度上的计算路径增长至48*t个解码器块——这正是RLT所谓“无限深度”主张的基础。
  • 03.
    该提案明确未经验证:未发布任何代码、训练好的检查点或基准对比数据,作者自身的材料也指出,推理能力提升、硬件效率和强化学习扩展性“仍有待证实”。
  • 04.
    RLT围绕三个协同设计目标构建——无界的时间推理深度、面向硬件的执行机制,以及在预训练、微调、采样和强化学习回放过程中保持一致的状态转换。

深度分析

状态如何跨越提示-响应边界

RLT的核心机制变化发生在提示与模型响应之间的衔接处。因果编码器首先从输入中构建全局的键值记忆。随后,循环解码器将该记忆与滑动窗口注意力结合,并关键地引入其自身前一最终隐藏状态的反馈——而当模型从读取提示过渡到生成响应时,该状态永远不会被重置[1]。这种相同的循环状态转换旨在统一应用于预训练、监督微调、采样以及当前策略的强化学习回放过程,设计者认为这可以消除通常因训练方式与服务方式不一致而产生的偏差[2]。这种统一是论文明确提出的目标;但它在真实训练运行中是否真正成立,尚未经过检验。

‘无限深度’是一个精确但容易误解的说法

参考配置采用48层编码器与48层解码器并行运行,每个token执行96个逻辑计算块,且由于解码器状态在整个序列中累积而非按token重置,经过t个token后,所经历的时间计算路径增长至48*t个解码器块[3]。这正是称RLT深度为‘无限’的数学依据——但这一说法的实际范围比字面含义更窄。它描述的是随着对话延长而不断延伸的计算路径,而非单个token内部发生无限量的计算[4]。同日一篇中文技术解析文章也提出了相同警示,指出根本性的效率问题——即额外的串行计算和非重置的服务状态是否真的物有所值——仍需实证检验,仅靠架构描述无法回答。

框架表述与证据之间的可信度差距

外界对RLT的反应明显分裂为‘表述’与‘证据’两派。Yifan Zhang本人在发布声明中使用了极端措辞,宣称迎来了‘超级智能的黎明’,而底层报告却承认此次发布不含任何代码、训练检查点或基准结果[1]。进一步传播该消息的报道及讨论帖中出现了持续质疑:一位Hacker News评论者批评这种表述方式是将未经验证的想法‘当作已实现的突破来呈现’,其他人则直接发问是否存在任何基准测试,或该架构是否真能超越此前的变换器-RNN混合模型[5]。类似的怀疑也在其他平台针对该论文的评论中独立出现,其中得票最高的回复直截了当地指出,该提案未报告任何实际实验、结果或基准数据,其他回复则称之为‘目前只是一幅漂亮的架构草图’。在这些场合中,没有任何评论者主张该架构按当前设计可能优于标准的仅解码器变换器。

RLT在环形变换器谱系中的位置

RLT并非孤立出现。每token多次重复使用变换器权重的想法可追溯至2018年的Universal Transformers,并在2025年因Huginn风格的循环深度模型扩展至35亿参数,以及字节跳动开源的Ouro模型而重新获得动力,后者将48个变换器块各循环四次,共完成192次块应用[6]。RLT在此脉络上的新增贡献在于在整个token序列上进行循环,使状态穿越提示-响应边界,而非仅在单个token的前向传播中反复循环。这一区别确实存在,但它出现在一场活跃且有争议的辩论背景下——即深度究竟对前沿能力有多大影响。OpenAI的Jakub Pachocki曾指出,当今前沿模型的计算图深度并未显著超过GPT-4,提醒人们架构深度的主张仍需以实际能力为衡量标准,而非仅看设计意图[7]

历史背景

提出了基础性概念:通过自适应的逐token停止机制,递归地多次应用同一个共享的变换器块,后来的环形与循环深度架构(包括RLT)均建立在此基础上。
探索了潜在的、非token级别的推理方法,是推动环形变换器设计的研究脉络之一。
展示了循环深度模型扩展至35亿参数,在8000亿token上训练,通过增加循环次数实现了显著的基准提升,例如ARC-E在32次迭代下从34.89升至69.91,远高于单次迭代。
发布了14亿和26亿参数的开源环形模型,每个48个变换器块循环四次,共192次块应用——这是RLT所延续的权重共享与循环趋势的早期实例。
发布了循环环形变换器的项目页面和GitHub仓库,即本文所讨论的具体提案,将环形变换器理念扩展至在整个token序列上循环,而非局限于单个token内。

关键关系图

关键玩家
主题

循环环形变换器(Recurrent Looped Transformer,RLT)架构

YI

Yifan Zhang

RLT的唯一作者与提出者;普林斯顿大学博士生、AI实验室研究员,此前曾在NVIDIA、字节跳动Seed及清华交叉信息研究院(IIIS)工作。他以个人技术报告和GitHub项目形式发布该架构,而非通过公司或同行评审渠道。

事实来源

7 条引用
  1. [1] Recurrent Looped Transformer - Yifan Zhang's project page
  2. [2] Recurrent Looped Transformer (alphaXiv abstract)
  3. [3] Recurrent Looped Transformer - GitHub repository
  4. [4] Recurrent Looped Transformer: Infinite Reasoning Depth
  5. [5] Recurrent Looped Transformer (RLT) | Hacker News discussion
  6. [6] The Looped Transformer and Recurrent-Depth Guide
  7. [7] Looped Transformer, Recurrent Depth, and Astra

来源文章

Top 3

THE SIGNAL.

Analysts

针对RLT所属的环形与循环深度变换器的更广泛争论,Pachocki认为当前前沿模型的计算深度与GPT-4相比并无根本差异,反驳了仅靠深度就能解锁跃迁式推理能力的说法。他说:‘我们当前前沿模型(包括Astra)的计算图深度,与GPT-4相比在两倍以内。’

Jakub Pachocki
OpenAI首席科学家
The Crowd

We are at the dawn of Superintelligence. Introducing the Recurrent Looped Transformer (RLT), We now have Transformers with Infinite Reasoning depth. From now on, we should pace progress at the Open Frontier of Superintelligence, Until Safe Superintelligence is achieved.

@@yifanzhang_6528

“Recurrent Looped Transformer” This paper makes the decoder recurrent across every prompt and response token, while a causal encoder provides reusable global KV memory. Longer sequences then create deeper latent computation paths without adding more physical layers, while...

@@askalphaxiv1415

Chinese researcher just reinvented the transformer encoder and RNN decoder for the Nth time. since 2017, every major AI, ChatGPT, Claude, Gemini, has been built on the exact same architecture: The Transformer. but Transformers have a fatal flaw. it can only "think" as far as...

@@HowToPrompt__478

A Princeton Researcher Proposes Recurrent Looped Transformer (RLT) that Carries Decoder State across Every Token, Fixing 96 Blocks per Token with Unbounded Temporal Depth

@u/ai-lover42
Broadcast
RLT把状态传过回复边界,算力真的省了吗?

RLT把状态传过回复边界,算力真的省了吗?

循环环形变换器(Recurrent Looped Transformer,RLT)架构 — AI 新闻 | Agentic Brew