架构与基准测试
GLM-5.3-Flash是一款3200亿参数的专家混合模型,每token激活180亿参数,是GLM-5系列中首个原生多模态成员[1]。它结合了稀疏注意力设计(NoPE MLA)与线性注意力(KDA),共45层,每次推理路由至288个专家中的8个;Z.ai称其IndexPool组件相比完整版GLM-5.3,将注意力计算量减少约3倍,KV缓存缩小约4.4倍[1]。独立基准测试机构Artificial Analysis将其Flash变体在智能指数上评为57分,仅比完整版GLM-5.3的60分低3分,平均每次任务成本约0.09美元,使其处于智能与成本的帕累托前沿[7]。同一测试指出该模型在实际使用中明显较慢且略显啰嗦[7]。在r/LocalLLaMA社区,开发者将其与Claude Sonnet 5和Opus 4.8进行并排比较,反应在惊叹与怀疑之间分歧明显,具体取决于任务类型。


