仅靠后训练,未更换基座模型
GLM-5.3运行在与GLM-5.2完全相同的7430亿参数混合专家基座模型之上[1]——Z.ai并未进行任何新模型的预训练。相反,所有能力跃升均来自后训练的扩展:更多任务环境、更多环境类型以及在现有基座上进行更长时间的训练。最明显的信号来自Terminal-Bench 3.0,这是一项长视野代码任务基准测试,其得分从GLM-5.2的4.6跃升至GLM-5.3的28.3[2],这是目前所有代码基准测试中单次提升幅度最大的一次。Z.ai的后训练架构基于两个开源技术——slime和SAO,并使用模拟真实开发者工作站的沙箱环境[3]。Interconnects.ai的Nathan Lambert对此方法直言不讳:此次发布中,Z.ai所做的全部工作就是扩大后训练[4]。一个前沿级别的智能体编码能力跃升,仅通过后训练计算实现,而基座权重完全冻结,这一事实凸显了在真实任务环境中使用类强化学习训练方式,能够将现有模型能力拓展到何种程度。


