循环环形变换器(Recurrent Looped Transformer,RLT)架构
TECH

循环环形变换器(Recurrent Looped Transformer,RLT)架构

36+
Signals

战略概览

  • 01.
    RLT 配备了一个因果编码器,用于构建全局键值(KV)记忆,并搭配一个循环解码器,该解码器将其最终隐藏状态和逐层滑动窗口注意力缓存贯穿每个提示和响应令牌。参考配置堆叠了48层编码器和48层解码器,每个令牌执行96个逻辑块。
  • 02.
    由于解码器是循环的,位置 t 处的令牌位于一条长度为 t 乘以解码器深度的循环路径末端,作者称之为无界时间深度——并非每个令牌的计算量无界,因为每个令牌的计算成本保持固定。
  • 03.
    相同的状态转移规则被重复用于预训练、监督微调、采样以及强化学习回放和 rollout 过程中,在提示到响应的边界处不进行重置,这与普通的仅解码器变换器在预填充和解码路径之间切换的做法不同。
  • 04.
    题为《循环环形变换器:具有无限时间深度的潜在推理》的技术报告由普林斯顿大学研究员Yifan Zhang于2026年9月12日发布,托管在 alphaXiv 和作者自己的项目页面上,而非正式的 arXiv 平台。
  • 05.
    代码、论文和项目页面均在 Apache 许可证 2.0 下发布。
  • 06.
    该论文未报告任何大规模的推理质量、效率或强化学习扩展结果;它仅定义了架构、执行调度和强化学习回放合约,将性能提升描述为研究目标而非实测成果。
  • 07.
    仓库中唯一的实证证据是一个小型合成状态跟踪测试(约79,000个参数,3个随机种子),明确标注为初步结果:在训练长度延长至4倍的情况下,RLT 在奇偶任务上优于标准变换器,但在五状态转移任务上表现大致相当甚至更差。
  • 08.
    另有独立测试报告指出,在相同79K参数的状态跟踪设置下,普通GRU在4倍训练长度下优于RLT;此外,在发布后几天内出现了两个非官方的开源重新实现(lucidrains发布的可pip安装的rlt-pytorch,以及开发者awdemos的第二个移植版本)。

机制:将循环机制附加到变换器上

RLT 分为两部分。一个因果编码器一次性读取整个序列并构建全局键值(KV)记忆——即模型通常在每个提示中只计算一次的注意力键和值缓存,以避免在每个生成步骤中重复计算。随后,一个循环解码器逐个处理令牌,但它不会在每一步重新开始,而是将其自身的隐藏状态和逐层滑动窗口注意力缓存(一个固定大小的近期上下文滚动窗口,而非关注所有已见内容)贯穿每个提示和响应令牌传递下去。参考构建将48层编码器堆叠在48层解码器之上,因此单个令牌会触发96个逻辑计算块 [1]。对该报告的报道将其描述为融合了两个通常分离的传统:变换器的可并行化、一次性上下文处理方式,以及RNN的逐步推进、状态携带方式 [2]

“无限推理深度”与实际数据之间的差距

核心主张是推理深度随序列长度增长而增长,同时每个令牌的计算成本保持固定——位置 t 的令牌实际上处于一条长度为解码器深度 t 倍的循环链之后,作者将其称为无界时间深度而非无界计算量 [3]。但所提供的唯一测量数据来自一个约79,000参数的合成模型。在训练长度延长至4倍的奇偶任务中,RLT 得分为60.8%,而普通变换器基线约为48%——差距确实存在,但远未达到此类玩具任务本应展示的接近完美准确率。在相同4倍长度的五状态转移任务中,RLT 得分为20.7%,而基线约为21%,意味着该架构所宣称的深度优势在另一类任务中完全消失 [1]。另有独立测试报告指出,一个更简单、历史悠久的GRU单元在相同状态跟踪设置中直接击败了RLT [4],削弱了该架构复杂性带来实际收益的说法。

统一训练、采样和强化学习的状态转移规则——代价几何?

该设计的另一卖点是统一性:预训练、监督微调、采样和强化学习 rollout 均复用相同的状态转移规则,在提示到响应的边界处不进行重置,而普通仅解码器变换器在预填充和解码阶段之间会重置 [2]。这在架构上具有美感,但在超出合成实验的任何规模上尚未得到验证,且报告本身也将所承诺的推理能力和硬件效率提升视为未来工作的目标,而非已实现的结果 [2]

病毒式炒作、快速重新实现与审慎接受

作者自身的公告以极端方式宣传RLT,并获得了关于该主题的最高互动量——这与人们查看报告后反应形成鲜明对比。两个非官方开源移植版本在几天内出现:lucidrains发布了一个可pip安装的实现,涵盖训练、滑动窗口解码以及可选的截断式时间反向传播(TBPTT)模式 [5][6],随后另一个独立移植版本也迅速跟进 [7]。其他地方的反响则冷淡得多:技术评论者更关注可监控性问题,而非循环-变换器混合架构是否合理——担忧在于循环机制将模型的部分推理过程推入不可读的数值潜在状态,而非可检查的文本 [8],这呼应了更广泛的质疑:一篇吸引快速重新实现的论文,却完全没有提供任何基准测试结果。

历史背景

早期工作,结合跨层权重共享与自适应计算时间以实现输入依赖的停机机制——这是RLT被比较的原始‘循环变换器’概念,区别在于RLT在序列位置上组织循环,而非重复深度迭代。
Yifan Zhang早前的论文,提出一种循环变换器的扩展规则,解耦深度与参数数量,是RLT设计谱系的直接前身。
发布RLT技术报告、项目页面、代码以及采用Apache-2.0许可证的权重和论文。
主流科技媒体报道RLT,指出该报告仅为设计规范,缺乏大规模实证验证。

关键关系图

关键玩家
主题

循环环形变换器(Recurrent Looped Transformer,RLT)架构

YI

Yifan Zhang

普林斯顿大学博士生,RLT作者;也是此前关于循环变换器深度扩展的论文DeepLoop的作者

LU

lucidrains

独立开源开发者,在RLT发布后几天内发布了非官方PyTorch实现

MA

MarkTechPost

报道RLT技术报告的科技媒体

AL

AlphaSignal

AI新闻媒体,报道了RLT架构及GRU与RLT的测试结果对比

EX

explainx.ai (Yash Thakker)

发布批判性分析,将RLT与Universal Transformers和ACT进行比较,指出可解释性和证据上的缺口

事实来源

8 条引用
  1. [1] Recurrent Looped Transformer (GitHub repository)
  2. [2] Recurrent Looped Transformer: Infinite Reasoning Depth? - explainx.ai
  3. [3] Yifan Zhang's RLT Grows Transformer Depth With Every Token Generated - AlphaSignal
  4. [4] A Princeton Researcher Proposes Recurrent Looped Transformer (RLT) - MarkTechPost
  5. [5] lucidrains/RLT - unofficial PyTorch implementation
  6. [6] RLT-pytorch on PyPI
  7. [7] awdemos/recurrent-looped-transformer - independent implementation
  8. [8] Recurrent Looped Transformer discussion - Hacker News

来源文章

Top 4

THE SIGNAL.

Analysts

指出未发布任何基准测试结果、训练好的检查点或可证伪的性能声明,并提出可解释性担忧,因为在此方案下,潜在推理从未以外部文本形式呈现。结论认为病毒式宣传超出了实际研究贡献。

explainx.ai (Yash Thakker)
批判性 / 怀疑性分析

最实质性的反对意见并非关于循环/循环变换器变体在原则上是否可行,而是关于可监控性和终止问题——循环机制将模型的部分推理过程转移到不可读的数值潜在状态,而非可读的思维链文本。

Hacker News 技术评论者(汇总,匿名)
混合——认为架构原则上可行但证据不足
The Crowd

We are at the dawn of Superintelligence. Introducing the Recurrent Looped Transformer (RLT), We now have Transformers with Infinite Reasoning depth. From now on, we should pace progress at the Open Frontier of Superintelligence, Until Safe Superintelligence is achieved.

@@yifanzhang_7302

I put together a mega write-up on GPT-6 Astra & looped transformers. How looped transformers / recurrent depth works, cost-tradeoffs, whether it hides reasoning traces, with lots of figures and a tour of recent looped transformer research.

@@rasbt2290

"Recurrent Looped Transformer" This paper makes the decoder recurrent across every prompt and response token, while a causal encoder provides reusable global KV memory. Longer sequences then create deeper latent computation paths without adding more physical layers, while...

@@askalphaxiv1790

A Princeton Researcher Proposes Recurrent Looped Transformer (RLT) that Carries Decoder State across Every Token, Fixing 96 Blocks per Token with Unbounded Temporal Depth

@u/ai-lover72
Broadcast
Recurrent Looped Transformer Explained: New Benchmarks Put "Infinite Reasoning Depth" to the Test

Recurrent Looped Transformer Explained: New Benchmarks Put "Infinite Reasoning Depth" to the Test

Recurrent Looped Transformer: Infinite Depth Through Hardware Co-Design

Recurrent Looped Transformer: Infinite Depth Through Hardware Co-Design

Recurrent Looped Transformer

Recurrent Looped Transformer