纯后训练策略:Z.ai如何在不更换基础模型的情况下缩小差距
GLM-5.3运行在与GLM-5.2完全相同的753B总参数、约40B激活参数的基础模型之上[1]。Z.ai并未从头重新训练网络,而是扩大了后训练规模——更多任务环境、更多环境类型,以及在不变的基础架构上进行更长时间的强化学习训练[1]。这种投入体现在奖励持续、多步骤推理而非原始知识的基准测试中:GDPval-AA v2代理工作Elo从1524跃升至1770,增长246分,使GLM-5.3在所有模型中排名第二,仅次于Claude Opus 5的1855分[3]。Z.ai内部的Code Bench比GLM-5.2提升了50%,Terminal-Bench 3.0从4.6升至28.3,DeepSWE v1.1从46.2升至66.9[4]。Interconnects.ai的Nathan Lambert将此视为中国实验室能够跟上资源远超自身的美国前沿实验室的核心原因:以天为单位的更快发布周期(而非数月)、更窄的纯文本专业化方向,以及日益成熟的国内RL环境数据市场,使得实验室可以从已训练好的模型中榨取出接近前沿水平的性能[9]。他对这一方法的总结非常直接——后训练扩展本身被视为一种完整战略,而非下一次预训练前的临时措施[9]。代价是GLM-5.3仍受限于其2026年款基础模型架构的上限,Reddit的技术社区也独立指出了这一点,用不太客气的说法指出:同一个700B级别的基础模型只是通过强化学习被推向了前沿性能水平,而高输出冗长性正是这种方法的成本。


