智谱AI(Zhipu AI)透露,此前匿名秘密测试的热门模型“Ox Alpha”实为其全新GLM-5.3-Flash,一款参数规模达3200亿的多模态模型,据称完全运行于10万个国产中国芯片之上。
TECH

智谱AI(Zhipu AI)透露,此前匿名秘密测试的热门模型“Ox Alpha”实为其全新GLM-5.3-Flash,一款参数规模达3200亿的多模态模型,据称完全运行于10万个国产中国芯片之上。

22+
Signals

战略概览

  • 01.
    智谱AI(Z.ai)确认,在OpenRouter和OpenCode上匿名秘密测试并排名领先的“Ox Alpha”模型正是其全新的GLM-5.3-Flash模型,并已将模型权重以MIT许可证形式发布。
  • 02.
    GLM-5.3-Flash是一款拥有3200亿总参数、每次仅激活180亿参数的混合专家模型,是GLM-5系列中首款原生多模态模型,支持高达1,048,576个token的上下文窗口,输出上限为131,072个token。
  • 03.
    智谱AI表示,该模型在秘密预览期间的所有推理流量均由一个由10万个国产中国芯片组成的集群提供服务,但未披露芯片供应商。
  • 04.
    API访问已以极具竞争力的价格推出——每百万输入token收费0.15美元,每百万输出token收费0.50美元,并提供50%的折扣,优惠持续至2026年9月9日。

GLM-5.3-Flash的真实面貌

抛开秘密测试的神秘色彩,GLM-5.3-Flash在纸面上其实是一种将稀疏性推向极致的常规前沿级混合专家架构:总参数3200亿,但每个token仅激活180亿参数[1]。这种稀疏性正是该模型的经济核心——每次请求仅需调动远低于完整3200亿参数系统的算力,这正是其激进定价得以实现的根本原因。它也是GLM-5系列中首款原生多模态模型,能够在单一的1,048,576个token上下文窗口内处理文本、图像、视频和视觉文档[2]

智谱AI为该架构设定的定价策略明显低于市场水平:每百万输入token 0.15美元,缓存输入0.03美元,每百万输出token 0.50美元,并提供持续至2026年9月9日的50%发布折扣[2]。发布后流传的技术解析指出,正是这种效率逻辑——3200亿总参数中仅激活180亿——直接解释了为何智谱AI能在不依赖同等质量稠密模型所需算力的情况下,以如此低廉的价格提供前沿规模的模型服务。

从匿名秘密测试到公开亮相

2026年8月20日,一款名为“Ox Alpha”的无品牌模型在OpenRouter和OpenCode上免费上线,未标注任何公司信息[3]。它并未保持低调:迅速成为OpenRouter有史以来最成功的发布,在正式发布前已处理了62万亿个token,仅前三天就处理了超过11万亿个token[4]。由于无人知晓其开发者,猜测四起——包括Gemini社区流传的一种理论,认为它是谷歌的秘密模型,但这一猜测在智谱AI现身时即告破灭。

2026年8月26日,Z.ai终结了猜测,确认Ox Alpha即为GLM-5.3-Flash,并在Hugging Face上以MIT许可证发布了模型权重[1]。然而,此次发布并非毫无瑕疵:至少一位Fireworks AI的基础设施工程师表示,曾故意将公开发布推迟一天,以追查一项基准差异——开源权重版本在AIME和GPQA等推理评估中的思维链长度约为API版本的两倍。这一细节为原本胜利式的发布增添了一丝真实的技术审视。

国产芯片主张及其不可验证性

将此次模型发布转变为地缘政治事件的关键细节,是智谱AI声称Ox Alpha在秘密测试期间处理的每一项请求——在全球范围内、在真实流量下——均由一个由10万个国产中国芯片组成的集群完成[4]。这与在国产硅片上训练模型有本质区别:它声称的是在完全不使用NVIDIA硬件的情况下,为前沿级模型提供实时推理服务。

问题在于,智谱AI并未说明这些芯片的制造商。CNBC报道称其无法独立验证该主张,智谱AI也未提供任何基准测试或硬件细节来佐证[5]。分析师只能猜测:Counterpoint的Ivan Lam推测该集群可能主要由华为昇腾(Ascend)处理器——此前曾用于训练GLM-5系列——与其他厂商组件混合构成[6]。开发者社区中另有一则相互竞争的传言指向海光DCU芯片,但双方均未确认。在智谱AI明确公布供应商名称前,整个国产硬件叙事完全依赖于公司自身的说法。

市场欢呼,社区对基准有效性存分歧

市场反应迅速且明确:在发布后的几天内,智谱AI在港交所上市的股票收盘价上涨超过12%,达到1,160港元[4],CNBC另将此次股价飙升直接归因于新模型与国产芯片推理故事的结合[7]。火上浇油的是,Artificial Analysis将GLM-5.3-Flash列入其“智能-成本”帕累托前沿,其智能指数得分为57,与Claude Opus 4.8持平,并优于DeepSeek V4 Pro的53分,而成本仅为后者的一小部分[8]

但基准持平的说法并未被全盘接受。围绕Artificial Analysis图表形成的讨论帖对指数的实际有效性提出质疑,指出同一排名系统还将另一款Opus模型排在Opus 4.8之上,而许多实践者根据实际使用经验对此表示异议;一些开发者进一步表示,尽管得分相同,GLM-5.3-Flash在实际的智能体和编码工作流中明显弱于竞品模型。最终结果是,这一故事呈现出两极分化的受众:投资者和基准观察者将数据解读为真正的飞跃,而一线用户则对相同数据持公开怀疑态度。

历史背景

Ox Alpha以匿名形式在OpenRouter和OpenCode上免费发布,支持100万个token的多模态上下文窗口,迅速成为该平台使用量最大的发布。
Z.ai正式将秘密模型命名为GLM-5.3-Flash(3200亿-激活180亿参数,MIT许可证,100万token多模态上下文),并以每百万token 0.15/0.50美元的API价格推出。
在GLM-5.3-Flash发布及国产芯片推理主张公布后,智谱AI在港交所上市的股票上涨超过8-12%。

关键关系图

关键玩家
主题

智谱AI(Zhipu AI)透露,此前匿名秘密测试的热门模型“Ox Alpha”实为其全新GLM-5.3-Flash,一款参数规模达3200亿的多模态模型,据称完全运行于10万个国产中国芯片之上。

ZH

Zhipu AI / Z.ai

总部位于北京的实验室,开发了GLM-5.3-Flash并进行了匿名的Ox Alpha秘密测试;此次发布及国产芯片主张直接推动了股价上涨,为其在中国AI硬件领域的自主性提供了证明点。

OP

OpenRouter

第三方模型路由平台,Ox Alpha曾以假名在此免费提供,成为该平台迄今为止按token量计算的最大发布,为智谱AI的公开亮相创造了条件。

NV

Nvidia

美国GPU市场主导者,因出口管制无法向中国销售其最先进的芯片;GLM-5.3-Flash完全依赖国产芯片进行推理的部署被视为对其在AI推理硬件领域主导地位的直接挑战。

HU

Huawei (Ascend chips)

分析师猜测但未获证实的推理集群部分供应商,基于其此前曾训练GLM-5系列的角色——若国产芯片主张成立,其可能成为主要受益者。

事实来源

8 条引用
  1. [1] Zhipu identifies Ox Alpha as GLM-5.3-Flash and releases model weights
  2. [2] Z.ai Releases GLM-5.3-Flash: A 320B-A18B Natively Multimodal MoE With a 1M Token Context
  3. [3] OpenRouter Ox Alpha Stealth Model - August 2026
  4. [4] Zhipu AI shares jump as viral Ox Alpha model revealed as GLM-5.3-Flash, running on Chinese chips
  5. [5] Ox Alpha Was GLM-5.3-Flash: China Inference Chip Claim Stands Unverified
  6. [6] Z.ai's Use of Chinese Chips in New Model Is About Optimization
  7. [7] Z.ai shares surge on new AI model using Chinese chips
  8. [8] Zhipu's GLM-5.3-Flash Matches Claude Opus 4.8 in AI Benchmark, Drives 9% Stock Surge

来源文章

Top 5

THE SIGNAL.

Analysts

认为智谱AI未披露的国产芯片集群可能由华为昇腾处理器与其他厂商硬件混合构成,因智谱AI未公布其供应商。

Ivan Lam
高级研究分析师,Counterpoint Research
The Crowd

Introducing GLM-5.3-Flash - Leading capabilities at a highly competitive price - Natively multimodal with a 1M-token context window - A 320B-A18B model released under the MIT License - Previously previewed as Ox Alpha, running entirely on Chinese AI chips Blog: https://t.co/KOCG4dkay3

@@Zai_org23808

GLM-5.3-Flash scores 57 on the Artificial Analysis Intelligence Index. At $0.09 Cost per Task, it sits comfortably on the Intelligence vs. Cost per Task Pareto frontier @Zai_org has released GLM-5.3-Flash, a smaller and cheaper sibling to GLM-5.3 at 320B total parameters and https://t.co/YJRMoU02oK

@@ArtificialAnlys1963

GLM-5.3-Flash is live on Fireworks on day… 2 Why? Because we take quality very seriously. We found a benchmark discrepancy we couldn't explain, so we delayed the launch to investigate. Day 0 (Wed): we saw 2x longer thinking on reasoning-heavy benchmarks (AIME & GPQA) for open https://t.co/6MuHYV2XHn

@@dzhulgakov447

[Megathread] GLM-5.3-Flash - former ox-alpha

@u/No_Afternoon_4260297
Broadcast
GLM 5.3 Flash (Fully Tested): What do you need to RUN THIS LOCALLY?

GLM 5.3 Flash (Fully Tested): What do you need to RUN THIS LOCALLY?

I Tested NEW GLM-5.3-Flash (ex Ox Alpha) on 21 Coding Prompts

I Tested NEW GLM-5.3-Flash (ex Ox Alpha) on 21 Coding Prompts

GLM 5.3 Flash Is INSANE — 320B MoE + Multimodal AI (= Ox Alpha)

GLM 5.3 Flash Is INSANE — 320B MoE + Multimodal AI (= Ox Alpha)