自改进循环的实际运作机制
DeepReinforce围绕所谓的自改进强化学习循环构建了Ornith-1.5:模型不再仅基于静态人工整理的数据集进行训练,而是生成候选解决方案、自行评分,并将质量最高的样本反馈到下一轮训练中[1]。这比DeepReinforce此前为其前代模型使用的“自搭建(self-scaffolding)”标签迈出了一大步——在自搭建模式下,模型虽能编写和修改自身的工具调用代码,但奖励信号仍来自固定的人工定义评分标准[2]。这一区别对判断未来能力提升的瓶颈至关重要:在自搭建模式下,实验室的能力受限于人类标注奖励数据的速度;而在自改进模式下,模型自身的评分成为训练循环的一部分,理论上使能力提升不再依赖人类标注的节奏。
该系列包含三种规模——9B、35B专家混合和旗舰级397B专家混合——均采用MIT许可证,这一点尤为引人注目,因为此前接近前沿水平的开源权重模型更多采用研究专用或定制商业条款,限制生产用途[3]。在一个声称可与闭源前沿模型竞争的397B模型上使用MIT许可证本身就是一个重要信号:它使得DeepReinforce的所有基准声明都面临独立复现的检验,而这正是发布后几天内发生的情况。


