为何在线策略优于强化学习和离线策略蒸馏
在线策略蒸馏不同于经典知识蒸馏之处在于,它不是基于教师预先写好的固定文本对学生进行评分,而是对学生自己生成的轨迹进行评分。一个更强的教师模型会对学生自身 rollout 中的每一个token进行评分,通常使用反向KL散度,从而提供一种类似于强化学习但计算成本低得多的密集逐token奖励信号[1]。由于监督发生在学生实际访问的状态上,在线策略蒸馏避免了损害纯离线方法的暴露偏差问题——即仅在教师编写文本上训练的模型一旦开始自主生成,就容易偏离并累积错误[2]。在Thinking Machines Lab的原始基准测试中,这种组合使学生模型仅用1,800 GPU小时就在AIME'24上达到了74.4%的准确率,而纯强化学习在17,920 GPU小时下达到67.6%,离线策略蒸馏在40万样本上训练后达到60%——据称比强化学习快7到10倍,并将累计计算量减少了50到100倍[1]。


