GLM-5.3-Flash的真实面貌
抛开秘密测试的神秘色彩,GLM-5.3-Flash在纸面上其实是一种将稀疏性推向极致的常规前沿级混合专家架构:总参数3200亿,但每个token仅激活180亿参数[1]。这种稀疏性正是该模型的经济核心——每次请求仅需调动远低于完整3200亿参数系统的算力,这正是其激进定价得以实现的根本原因。它也是GLM-5系列中首款原生多模态模型,能够在单一的1,048,576个token上下文窗口内处理文本、图像、视频和视觉文档[2]。
智谱AI为该架构设定的定价策略明显低于市场水平:每百万输入token 0.15美元,缓存输入0.03美元,每百万输出token 0.50美元,并提供持续至2026年9月9日的50%发布折扣[2]。发布后流传的技术解析指出,正是这种效率逻辑——3200亿总参数中仅激活180亿——直接解释了为何智谱AI能在不依赖同等质量稠密模型所需算力的情况下,以如此低廉的价格提供前沿规模的模型服务。


