Z.ai的GLM-5.3-Flash发布,从其‘Ox Alpha’隐身代号中揭开面纱
TECH

Z.ai的GLM-5.3-Flash发布,从其‘Ox Alpha’隐身代号中揭开面纱

38+
Signals

战略概览

  • 01.
    智谱AI(Z.ai)在OpenRouter和OpenCode上以代号“Ox Alpha”(又称“Niu Lai”)匿名测试一款新模型近一周时间,随后于2026年8月26日宣布该模型实为GLM-5.3-Flash:一款拥有3200亿参数的专家混合模型,每次激活180亿参数,上下文窗口达100万token,并采用MIT许可证开源权重。
  • 02.
    Z.ai表示,该模型完全运行在由10万个国产中国AI芯片组成的集群上,定价约为前代产品的十分之一,定位为在价格上远低于Claude Opus等西方竞品的近前沿替代方案,同时在基准测试中表现具有竞争力。它已迅速成为OpenRouter上排名第一的编程模型。
  • 03.
    包括CNBC在内的独立报道尚未能证实10万芯片的说法,也无法确认芯片供应商,而Z.ai也拒绝透露供应商名称。

架构与基准测试

GLM-5.3-Flash是一款3200亿参数的专家混合模型,每token激活180亿参数,是GLM-5系列中首个原生多模态成员[1]。它结合了稀疏注意力设计(NoPE MLA)与线性注意力(KDA),共45层,每次推理路由至288个专家中的8个;Z.ai称其IndexPool组件相比完整版GLM-5.3,将注意力计算量减少约3倍,KV缓存缩小约4.4倍[1]。独立基准测试机构Artificial Analysis将其Flash变体在智能指数上评为57分,仅比完整版GLM-5.3的60分低3分,平均每次任务成本约0.09美元,使其处于智能与成本的帕累托前沿[7]。同一测试指出该模型在实际使用中明显较慢且略显啰嗦[7]。在r/LocalLLaMA社区,开发者将其与Claude Sonnet 5和Opus 4.8进行并排比较,反应在惊叹与怀疑之间分歧明显,具体取决于任务类型。

从‘Ox Alpha’到正式发布

在Z.ai正式冠名之前,一个自称“Ox Alpha”(又称“Niu Lai”)的匿名条目出现在OpenRouter和OpenCode上,引发社区对其背后开发者的广泛猜测[2]。在此隐身测试期间,该神秘模型处理了62万亿token,成为OpenRouter上使用最多的模型[3]。当Z.ai于2026年8月26日宣布Ox Alpha实为GLM-5.3-Flash后,使用量继续攀升:发布后前三天处理了11万亿token,该模型跃居平台编程模型榜首,占据OpenRouter周流量约31%[3]

国产芯片声明存疑

Z.ai声称GLM-5.3-Flash完全在由10万个国产中国AI芯片组成的集群上训练和部署[3]。该说法尚未获得独立验证:CNBC报道称无法确认细节,Z.ai也拒绝透露芯片供应商[4]。其他媒体推测华为、寒武纪或摩尔线程可能是潜在供应商,但均未获证实[9]。类似模式——一项令人印象深刻的基础设施声明超出独立验证能力——也出现在其他方面:一位独立YouTube博主在隐身测试期间指出,模型宣称的每日100万亿token处理目标在实践中未达预期,存在上游容量问题,而非完全实现。在r/LocalLLaMA这一最大的爱好者社区中,关于芯片声明的讨论迅速演变为更广泛的推测:国产芯片推理能力的提升是否长期来看会削弱英伟达的算力护城河——这一问题研究尚未解答,但社区显然认为其开放可议。

安全调优适得其反

r/SillyTavernAI上的用户报告称,GLM-5.3的安全护栏明显比5.1和5.2版本更严格,有时模型会将自己识别为“Claude”而非GLM模型。一位评论者推测,这可能源于对Claude生成输出的大量蒸馏,导致安全调优和自我识别特征渗入模型,但这只是单个人的理论,并非确认机制,研究也未进一步证实。社区对这种过度谨慎的反应迅速而具体:发布后约一天内,一个去除了拒绝机制的“无审查”微调版本便出现,随后一篇广泛传播的帖子也宣传了相同的原生FP8无审查变体——这表明开源权重生态的一部分迅速选择剥离新增的安全护栏,而非争论其合理性。

定价机制受质疑

Z.ai将GLM-5.3-Flash定价为每百万输入token 0.15美元,每百万输出token 0.50美元,缓存输入为每百万0.03美元——约为GLM-5.2价格的十分之一[5]。这一大幅降价引发了一些质疑:在r/DeepSeek上,用户质疑在考虑实际缓存命中率后,其经济性是否成立,认为实际成本可能不如标价所示那样具有优势,相较于DeepSeek V4 Flash等竞品,至少有一位用户表示该模型并未感觉比V4 Flash有明显提升。使用llama.cpp进行高度量化构建的本地托管测试也发现,在高端消费级硬件上首token时间过长,不切实际,提醒人们云服务定价优势并不必然转化为廉价的自托管。

更广泛的架构趋同

MarkTechPost对GLM-5.3-Flash和Qwen3.8-Flash-Next的对比指出,两家实验室在五个月内独立采用了相同的稀疏加线性混合注意力架构[8],表明这一设计正成为中国实验室为降低推理成本而共享的通用方案,而非任一团队的独创发明。

母模型因安全审查推迟发布

Z.ai在GLM-5.3完整模型于CyberGym测试中取得84.5%得分后,推迟约两周发布其权重[6],值得注意的是,该模型在测试中还发现Cursor代码编辑器存在真实漏洞[10]。在一次更广泛的安全扫描中,该模型报告了269个项目中的2436个漏洞,其中1097个被评定为严重或高危[6],Z.ai以此作为在发布完整权重前进行额外网络安全审查的理由。

历史背景

一个自称‘Ox Alpha’(又称‘Niu Lai’)的匿名模型出现在OpenRouter和OpenCode上;在接下来的一周内处理了62万亿token,成为OpenRouter上使用最多的模型,引发关于其开发者身份的猜测。
Z.ai正式宣布该模型为GLM-5.3-Flash:一款3200亿总参数/180亿激活参数的专家混合模型,是GLM-5系列首个原生多模态版本,支持100万token上下文窗口,并以MIT许可证开源权重。
Z.ai称该模型完全运行在由10万个国产中国AI芯片组成的集群上;CNBC报道称无法独立验证该说法,Z.ai也拒绝透露供应商。智谱AI在港上市股票上涨约12%。
完整版GLM-5.3模型的权重因网络安全审查被推迟约两周发布,此前其在CyberGym测试中取得84.5%得分,并在测试中发现Cursor存在真实漏洞。

关键关系图

关键玩家
主题

Z.ai的GLM-5.3-Flash发布,从其‘Ox Alpha’隐身代号中揭开面纱

Z.

Z.ai (Zhipu AI)

GLM-5.3-Flash及其母模型GLM-5.3的开发者与发布方;将其定位为运行于国产芯片上的低成本、近前沿替代方案,但在被问及芯片供应商时拒绝透露。

OP

OpenRouter

托管平台,在匿名‘Ox Alpha’模型隐身测试期间成为平台使用最多的模型,发布后GLM-5.3-Flash成为排名第一的编程模型,占周流量约31%。

AR

Artificial Analysis

独立基准测试机构,评定该模型在智能指数与成本效率前沿具有竞争力,同时指出其在实践中明显较慢且略显啰嗦。

开源

开源大模型社区(Reddit、X平台微调者)

用户与下游构建者,对规格与价格表示兴奋,但对更严格的安全护栏提出反对——在发布后约一天内即发布无审查微调版本——并对定价优势在考虑缓存命中率后是否成立表示怀疑。

R/

r/LocalLLaMA社区

最大的开源大模型爱好者社区,独立确认了Ox Alpha的身份与架构细节,并主导了GLM-5.3-Flash与Claude Sonnet 5及Opus 4.8的公开对比,以及关于更便宜的中国替代方案对英伟达算力护城河影响的推测。

事实来源

10 条引用
  1. [1] Z.ai releases GLM-5.3-Flash, a 320B-A18B natively multimodal MoE with a 1M-token context
  2. [2] Who is behind Ox Alpha, the mysterious model?
  3. [3] Zhipu AI shares jump on viral 'Ox Alpha' model revealed as GLM-5.3 Flash, Chinese chips
  4. [4] Z.ai shares surge on new AI model using Chinese chips
  5. [5] Z.ai launches GLM-5.3-Flash under MIT license
  6. [6] Z.ai delays GLM-5.3 weights two weeks after cyber score beats Mythos 5
  7. [7] GLM-5.3-Flash - Artificial Analysis
  8. [8] GLM-5.3-Flash vs Qwen3.8-Flash-Next: Two Chinese AI labs independently converge on the same model architecture
  9. [9] Zhipu launches GLM-5.3-Flash model on 100,000 domestic chips, competing with Nvidia
  10. [10] GLM-5.3 is here with advanced cyber capabilities and reportedly already found a serious vulnerability in Cursor

来源文章

Top 5

THE SIGNAL.

Analysts

在智能指数上将GLM-5.3-Flash评为57分(完整版为60分),每次任务成本约0.09美元,处于智能与成本的帕累托前沿,同时指出该模型明显较慢且略显啰嗦。

Artificial Analysis
独立AI基准测试机构

观察到GLM-5.3-Flash与Qwen3.8-Flash-Next在五个月内独立采用了相同的稀疏加线性混合注意力架构。

MarkTechPost
技术AI媒体

证实了Ox Alpha的隐身机制与国产芯片叙事,但指出承诺的隐身期‘每日100万亿token’处理目标在实践中未完全实现,存在上游容量问题。

Mehul Mohan
独立YouTube AI创作者

推测GLM-5.3更严格的安全护栏及偶尔自称为‘Claude’可能源于对Claude生成输出的大量蒸馏——仅为个人理论,非确认机制,且研究中无其他佐证。

PorchettaM
Reddit评论者,r/SillyTavernAI
The Crowd

GLM-5.3 is now open-weight. Our most capable model for agentic coding and cyber defense is now available to download, run, and customize. Weights: https://huggingface.co/zai-org/GLM-5.3 Tech blog: https://z.ai/blog/glm-5.3

@@Zai_org8416

GLM Flash. Uncensored. Native FP8. We just released OrcaRouter's uncensored weights for GLM Flash — 320B parameters / 18B active, directly at the original block-FP8 precision. No LoRA. No jailbreak prompt. Refusal removal is baked directly into the weights.

@@OrcaRouter4354

GLM 5.3 Flash performs at GLM 5.3 level in Blender for 17x cheaper! We gave both models a live Blender over MCP and one prompt: a 2,800 sq ft duplex penthouse, double-height living room, mezzanine, floating stair, curtain wall, terrace, furnished, real PBR materials

@@atomic_chat_hq728

GLM-5.3-Flash: Frontier Intelligence, Flash Cost

@u/BriguePalhaco1300
Broadcast
GLM 5.3 Flash (Fully Tested): What do you need to RUN THIS LOCALLY?

GLM 5.3 Flash (Fully Tested): What do you need to RUN THIS LOCALLY?

NEW GLM-5.3 Flash CRUSHES Anthropic

NEW GLM-5.3 Flash CRUSHES Anthropic

GLM 5.3 Flash Is INSANE — 320B MoE + Multimodal AI (= Ox Alpha)

GLM 5.3 Flash Is INSANE — 320B MoE + Multimodal AI (= Ox Alpha)