大语言模型的在线策略蒸馏方法
TECH

大语言模型的在线策略蒸馏方法

32+
Signals

战略概览

  • 01.
    在线策略蒸馏(OPD)是一种后训练技术,其中学生模型生成自己的轨迹,而更强的教师模型通过反向KL散度等方法,对这些轨迹中的每个token进行密集的、逐token级别的监督评分。
  • 02.
    由于学生模型是在其实际访问的状态上被评分,OPD规避了静态离线策略蒸馏所面临的暴露偏差问题——在该问题中,仅在教师编写文本上训练的模型一旦开始自主生成,往往会累积错误。
  • 03.
    这一方法由Thinking Machines Lab在2025年10月的博客文章中推广开来,报道称OPD仅用1,800 GPU小时就在AIME'24上达到了74.4%的成绩,相比之下,纯强化学习在17,920 GPU小时下达到67.6%,而基于40万样本训练的离线策略蒸馏仅达到60%。
  • 04.
    2026年9月下旬,arXiv上涌现了一波密集的学术论文——包括IPD、Interactive-Policy Distillation、SIPO、SAKI和B-OPSD——它们各自针对原始方法中的特定缺陷进行了改进,从训练初期教师与学生不一致,到token级信用分配和提示效率问题。

为何在线策略优于强化学习和离线策略蒸馏

在线策略蒸馏不同于经典知识蒸馏之处在于,它不是基于教师预先写好的固定文本对学生进行评分,而是对学生自己生成的轨迹进行评分。一个更强的教师模型会对学生自身 rollout 中的每一个token进行评分,通常使用反向KL散度,从而提供一种类似于强化学习但计算成本低得多的密集逐token奖励信号[1]。由于监督发生在学生实际访问的状态上,在线策略蒸馏避免了损害纯离线方法的暴露偏差问题——即仅在教师编写文本上训练的模型一旦开始自主生成,就容易偏离并累积错误[2]。在Thinking Machines Lab的原始基准测试中,这种组合使学生模型仅用1,800 GPU小时就在AIME'24上达到了74.4%的准确率,而纯强化学习在17,920 GPU小时下达到67.6%,离线策略蒸馏在40万样本上训练后达到60%——据称比强化学习快7到10倍,并将累计计算量减少了50到100倍[1]。

2026年9月浪潮:一种配方,五种不同改进

在原始博客发布一年后,2026年9月下旬出现了一组密集的学术论文,每篇都针对基础配方中的某个具体缺陷,而非提出彻底替代方案。插值策略蒸馏(IPD)将离线/在线策略的划分转化为可调节的连续体,通过推测性解码逐token混合学生与教师的token分布,以控制额外计算开销[3]。交互式策略蒸馏解决了研究人员所称的“教师失锚”问题——在训练初期,较弱的学生会进入教师从未见过的前缀区域——通过让学生与教师轮流担任提议与验证角色,仅用标准在线策略蒸馏约四分之一的训练样本就报告了显著的准确率提升[4]。SIPO将强化学习与自蒸馏融合进一个对比式自教师框架,将正确参考答案与学生自身的错误配对,实现无需外部教师的密集token级信用分配[5]。SAKI由美团与KTH皇家理工学院合作开发,根据学生rollout与教师的偏离程度,在反向KL与直接token修正之间动态切换监督方式,并通过推测性验证器报告了大幅提高的rollout吞吐量[6]。B-OPSD以不同方式应对锚定问题,先暂时将策略训练超前以创建“未来教师”,再重置并用该教师监督原始学生[7]。同期其他论文则针对正交弱点:有研究显示,在“思考模式”下蒸馏的小型学生模型未能继承教师的停止行为,即使已学会解题,仍会在正确答案后继续生成[8];另一项研究发现,提示在蒸馏中的效用高度不均,且依赖于特定教师而非提示本身的固有属性——少数提示即可匹敌数千提示的效果,但刻意筛选提示并不比随机选择更可靠[9];第三项研究引入了基于双层优化的逐token加权机制,使更小的学生模型在数学基准上实际超越了更大的教师模型[10]。

计算、内存与分词器的代价

这一切并非没有代价。在线策略蒸馏要求教师模型在整个训练过程中驻留在内存中,并与学生并行执行推理,这是一种离线策略方法所不具备的结构性开销。这也正是为何有实践者认为,只有当离线数据确实无法覆盖学生将实际访问的状态时,在线策略蒸馏才真正值得采用,且在学生与教师能力相近、任务无需极长生成时效果最佳[11]。大多数已发表的变体,包括原始配方,也主要局限于来自同一模型家族的师生对,以确保token级监督能清晰对齐——这一限制促使社区另辟蹊径,致力于将该技术扩展至不同分词器之间,因为在实际部署中,很少能免费获得同家族的教师模型。

是知识迁移,还是仅抑制错误token?

效率数字并未解决在线策略蒸馏究竟在教学生什么这一根本问题。一些观察者认为该机制是直接的知识迁移:教师的逐token判断将真正的推理能力注入学生权重中。另一些人则指出,反向KL式奖励项在实践中更像是一种对不良token的抑制——一种有限的、主要是负面的纠正——而非向学生注入新的正向知识。另一条研究路径为“抑制说”提供了支持:有论文发现,无需对每个token评分,仅集中监督轨迹中低至1%甚至更低比例的token,即可达到与全token评分相当的效果,这表明只有少数token实际承载了纠正信号。这一区别对技术的可扩展性至关重要:如果真实机制更接近于修剪不良行为而非能力迁移,那么引人注目的高效数字可能无法外推至更难的任务或师生间更大的能力差距。这场争论也未局限于论文与论坛——在原始公告发布一年内,该话题已延伸至独立的讲解视频和面向更广泛技术受众的播客专题,表明这一理念已超越狭窄的研究领域。

历史背景

发布了《在线策略蒸馏》博客文章,推广了该技术用于大语言模型后训练,并报告了相比强化学习显著的计算效率提升。
发表了《大语言模型在线策略蒸馏综述》,在三个设计轴上形式化了分类体系:优化目标、信号来源以及训练稳定性方法。
五篇或更多独立论文——IPD、Interactive-Policy Distillation、SIPO、SAKI和B-OPSD——在极短时间内集中发布于arXiv,各自针对原始配方的不同弱点。

关键关系图

关键玩家
主题

大语言模型的在线策略蒸馏方法

TH

Thinking Machines Lab

发布了广受引用的2025年10月博客文章《在线策略蒸馏》,推广了该技术用于大语言模型后训练,应用于数学推理与内部聊天助手,并报告了至今仍主导领域认知的计算效率数据。

QW

Qwen团队(阿里巴巴)

被列为Thinking Machines研究的灵感来源;据称Qwen3在生产级后训练中使用了在线策略或强弱蒸馏。

20

2026年9月arXiv论文浪潮的学术作者(包括SAKI的美团与KTH皇家理工学院)

多个独立研究团队在数日内相继发布了对在线策略蒸馏的改进,包括IPD、Interactive-Policy Distillation、SIPO和SAKI。

MI

Mingyang Song 和 Mao Zheng

《大语言模型在线策略蒸馏综述》的作者,在2026年9月论文集群出现前数月,形式化了三个设计轴上的分类体系——优化目标、信号来源以及训练稳定性方法。

事实来源

11 条引用
  1. [1] On-Policy Distillation (Thinking Machines Lab blog)
  2. [2] On-Policy Distillation (EmergentMind)
  3. [3] Interpolated Policy Distillation: A Controllable Continuum Between Off-Policy and On-Policy Distillation
  4. [4] Interactive-Policy Distillation with Bidirectional Propose-and-Verify
  5. [5] SIPO: Unifying Reinforcement Learning with On-Policy Self-Distillation
  6. [6] SAKI: Maximal-Coupling-Routed Teacher Supervision for On-Policy Distillation
  7. [7] Train Ahead, Distill Back: Bootstrapping On-Policy Self-Distillation for Large Language Models
  8. [8] Solving Without Stopping: On-Policy Distillation at Small Scale
  9. [9] Beyond Prompt Count: How Data Shapes Transfer in On-Policy Distillation
  10. [10] Dr. OPD: Learning What to Follow for Optimal On-Policy Distillation of Large Language Models
  11. [11] On-Policy Distillation: A Reflection

来源文章

Top 5

THE SIGNAL.

Analysts

“将在线策略蒸馏描述为在机制上类似于机器人学与模仿学习中的DAGGER方法,关键区别在于,大语言模型的在线策略蒸馏通常使用反向KL(或Jeffreys散度,即前向与反向各半)效果最佳,而非机器人学与强化学习中典型的前向KL或行为克隆损失。”

Rishabh Agarwal
机器学习研究员

“曾公开批评在线策略蒸馏,认为在该过程中教师模型处于他所谓的“结构性极差的位置”。”

Omar Khattab
DSPy创建者,麻省理工学院
The Crowd

“Our latest post explores on-policy distillation, a training approach that unites the error-correcting relevance of RL with the reward density of SFT. When training it for math reasoning and as an internal chat assistant, we find that on-policy distillation can outperform other https://t.co/ltPsdNjajD”

@@thinkymachines2775

“colab notebook for on-policy distillation 👇🔗 (for those without @thinkymachines tinker access) train qwen-0.6b with OPD to get from 38% -> 60% on GSM8K works for models without the same tokenizer!”

@@itsandrewgao292

“Can supervising just 1% of tokens match full OPD? Our new paper shows it can, and sometimes, 0.1% is enough! 1% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation”

@@HuanxinShe525483

“On-policy distillation: one of the hottest terms on PapersWithCode [R]”

@u/NielsRogge105
Broadcast
How Small Models Learn to Think Like Giants | On-Policy Distillation

How Small Models Learn to Think Like Giants | On-Policy Distillation

How On Policy Self Distillation Works - Sasha Rush

How On Policy Self Distillation Works - Sasha Rush

On Policy Distillation - How the big AI labs actually train their LLMs

On Policy Distillation - How the big AI labs actually train their LLMs