后训练的天花板刚刚被打破
智谱表示,GLM-5.3运行在与GLM-5.2完全相同的7430亿参数基座模型上——所有报告的性能提升都来自规模化的后训练,而不是更大或重新训练的基座模型[1]。Terminal-Bench 3.0从4.6跃升至28.3,DeepSWE v1.1则从46.2上升至66.9[1][2]。智谱称,此次后训练已超越孤立的编程题目,进入完整的工程工作流——识别、分析、实施、验证并交付修复方案——使用真实的计算集群、存储系统和内部代码库,部分任务类似于资深工程师持续数天的工作负载[2]。在智谱内部的一项Z.ai基准测试中,GLM-5.3还以31.4%的成绩优于对比结果(29.5%),而每项任务仅使用约5万个输出token,远低于参考运行的约12万个token,表明该模型不仅能力更强,效率也更高[1]。


