智谱GLM-5.3-Flash的“牛阿尔法”秘密发布及其国产芯片推理声明
TECH

智谱GLM-5.3-Flash的“牛阿尔法”秘密发布及其国产芯片推理声明

41+
Signals

战略概览

  • 01.
    智谱AI(Z.ai)确认其此前匿名预览、引发热议的模型“牛阿尔法”即为GLM-5.3-Flash,并于同日发布该开源权重模型,此前已历经约一周的第三方测试。
  • 02.
    该模型是一个总参数量达3200亿、激活参数180亿的专家混合系统,是GLM-5系列中首个原生多模态模型,上下文窗口高达1,048,576个token。
  • 03.
    智谱表示,该模型整个秘密测试期间的流量均运行在约10万个国产中国芯片组成的集群上,硬件效率和每token成本与英伟达GPU相当。
  • 04.
    该模型以MIT许可证发布,目前已可在OpenRouter(12家提供商)、Cloudflare Workers AI以及GLM编码计划中使用。

秘密战术:一款免费“神秘模型”如何成为62万亿token的惊人一击

2026年8月20日,一款名为“牛阿尔法”的匿名、可免费使用的模型悄然出现在OpenRouter、OpenCode、Cline和Nous Research的平台上,提供100万token的上下文窗口,并支持文本、图像和视频输入[1]。没有任何实验室宣称拥有它。大约一周时间里,它作为一次秘密测试运行,吸收真实世界流量而非内部基准测试——据报道,在任何公司公开认领之前,它每天以免费形式处理超过100万亿token,总计处理了62万亿token[2]。这是一种非典型的前沿模型发布方式:跳过发布会,让市场先发现你。

2026年8月27日,智谱AI(Z.ai)确认“牛阿尔法”实为GLM-5.3-Flash,一个3200亿参数的专家混合模型,并于同日以MIT许可证发布其权重[3]。此次揭晓验证了秘密测试期间已显现的事实:GLM-5.3-Flash成为OpenRouter迄今为止最成功的发布,在揭晓后的前三天内处理了超过11万亿token,并占据平台每周编码模型使用量近31%——位居榜首[1]。智谱在港交所上市的股票在公告当日收盘上涨逾12%[1]。这段秘密期并非偶然营销;它是模型自身采用曲线的真实体现,而这一切发生时人们尚不知其归属。

无需英伟达却媲美英伟达:一个行业正在验证的声明

最受关注的细节并非GLM-5.3-Flash的参数数量,而是它的运行位置。智谱表示,整个秘密测试——所有每日高达100万亿token的流量——均由约10万个国产中国AI芯片组成的集群承载,其硬件效率和每token成本据称与英伟达GPU相当[2]。Z.ai将部分效率归功于其基于SGLang定制的推理引擎,称其在国产硬件上使端到端服务吞吐量提升三倍[4]

分析机构SemiAnalysis认为这一声明比模型本身更具新闻价值,指出其紧随OpenAI宣布自研推理芯片之后,并认为英伟达CUDA软件护城河“再次受到质疑”[2]。The New Stack的表述更为直白:GLM-5.3-Flash“便宜、优秀,且运行于中国芯片之上”[9]。需要强调的是,这些效率和成本持平的数据由智谱自行报告,并未经独立审计——但由于权重现已开源并在多个第三方平台运行,这些声明足够具体,外部开发者已可开始直接测试[4]。考虑到美国持续对中国实施先进芯片出口管制,若能在国产硅片上实现与英伟达相媲美的大规模推理,这一现实主张的意义远超基准测试图表。

名不副实的‘Flash’:命名错位引发定价争议

‘Flash’品牌通常意味着小巧且廉价,但GLM-5.3-Flash的3200亿总参数(180亿激活)使其远超此类范畴——部署需超过320GB内存,规模更接近智谱旗舰产品,而非此前轻量级的Flash和Air系列。这种错位引发了最早一批自托管社区的批评,他们更愿意称其为‘Gigaflash’,而非真正的小型变体。

在托管平台上,其定价看似明确低廉:OpenRouter列出的GLM-5.3-Flash价格为每百万输入token 0.075美元,每百万输出token 0.25美元,由包括Z.ai、Together、Cloudflare和Reka AI在内的12家提供商提供服务[5],智谱将其定价定为旗舰产品GLM-5.3的大约十分之一[6]。但一旦引入缓存机制,情况变得复杂——早期社区定价讨论表明,尽管GLM-5.3-Flash完成任务所需的输出token更少,但其缓存token费率明显高于竞品DeepSeek V4 Flash,使得任何简单的每任务成本判断都变得模糊。另一种怀疑观点认为,该模型某些最强的基准表现奖励的是华丽、常见演练的演示提示,而非稳健的通用工程能力——在将任一单一基准数据视为决定性结论前,这一警示值得牢记。

架构揭秘:百万token上下文下的混合注意力、原生多模态架构

GLM-5.3-Flash是GLM-5系列中首个原生多模态模型,设计用于在一个模型中处理文本、图像、视频、视觉文档及交错多模态输入,而非事后附加视觉功能[3]。架构上,其45层语言主干交替使用KDA线性注意力层与NoPE稀疏多头潜在注意力层,每个token通过288个专家中的8个,并附带原生FP8权重及一个多token预测草稿层以加速解码[7]。正是这种稀疏加线性的混合设计,使模型能够维持1,048,576 token的上下文窗口和131,072 token的最大输出,训练数据来自一个30万亿token的多模态语料库[7]

在公开基准测试中,智谱报告其人工分析智能指数得分为57,与Claude Opus 4.8持平,优于DeepSeek V4 Pro[1],Terminal-Bench 2.1得分为84.3,略低于Opus 4.8的85.0,DeepSWE v1.1得分为63.4,相比GLM-5.2的46.2大幅提升[6]。这些数据,结合模型的规模和开放的MIT许可证,使其更像一个真正的前沿邻近发布,而非简化版便利模型——即使其命名仍在低估实际运行所需的算力。

历史背景

GLM-5作为智谱GLM模型家族的最新一代主要版本发布。
发布GLM-5.2,是GLM-5.3-Flash直接的架构前身,后者在其基础上构建并超越之。
正式发布更大的旗舰模型GLM-5.3,旨在与Anthropic和OpenAI在编码领域竞争,区别于5.3-Flash。
一款名为‘Ox Alpha’的匿名、可免费使用的模型悄然出现在OpenRouter、OpenCode、Cline和Nous Research的门户上,后被揭示为GLM-5.3-Flash。
Z.ai向彭博社确认Ox Alpha是GLM系列的新迭代,并宣布当晚将发布权重。
智谱正式确认Ox Alpha为GLM-5.3-Flash,并发布MIT许可的开源权重,其港股股价当日上涨逾12%。

关键关系图

关键玩家
主题

智谱GLM-5.3-Flash的“牛阿尔法”秘密发布及其国产芯片推理声明

ZH

Zhipu AI (Z.ai)

GLM-5.3-Flash的开发者;运行了匿名‘Ox Alpha’秘密测试,确认模型身份并发布开源权重,因发布获得港股股价上涨逾12%及巨大市场关注。

OP

OpenRouter

在发布前托管了匿名‘Ox Alpha’列表,发布后成为GLM-5.3-Flash最大的分发渠道,三天内处理超11万亿token,约占平台每周编码模型使用量的31%。

CL

Cloudflare

在官方发布当天于Workers AI(@cf/zai-org/glm-5.3-flash)部署GLM-5.3-Flash,将其分发扩展至其开发者和AI网关客户群。

OP

OpenCode, Nous Research, and Cline

在发布前托管了免费、匿名的‘Ox Alpha’预览,助力模型有机病毒式传播及大规模压力测试。

DO

Domestic Chinese AI chipmakers (unnamed cluster)

提供了约10万个芯片的集群,智谱称其承载了全部推理流量,是出口管制背景下减少对英伟达依赖叙事的核心。

事实来源

9 条引用
  1. [1] Zhipu AI shares jump on viral Ox Alpha model revealed as GLM-5.3-Flash on Chinese chips
  2. [2] Zhipu (Z.ai) Unmasks the Mystery Ox Alpha Model as GLM-5.3-Flash, Revealing It Was Run Entirely on Chinese GPUs While Serving 100 Trillion Tokens/Day
  3. [3] Zhipu identifies Ox Alpha as GLM-5.3-Flash and releases model weights
  4. [4] The Chinese AI model GLM-5.3-Flash runs without Nvidia and costs a fraction of what the competition does
  5. [5] GLM 5.3 Flash - OpenRouter
  6. [6] Z.ai launches GLM-5.3-Flash under MIT license
  7. [7] Z.ai Releases GLM-5.3-Flash: A 320B-A18B Natively Multimodal MoE With a 1M-Token Context
  8. [8] GLM-5.3-Flash now available on Workers AI
  9. [9] Z.ai's GLM-5.3-Flash is Cheap, Good, and Served on Chinese Chips

来源文章

Top 5

THE SIGNAL.

Analysts

将智谱声称所有GLM-5.3-Flash流量均在国产芯片上以媲美英伟达每token成本运行的说法,视为英伟达CUDA软件护城河正面临新一轮审视的证据,并将其与OpenAI自身的推理芯片公告联系起来。

SemiAnalysis
半导体与AI基础设施分析机构

将GLM-5.3-Flash描述为廉价、能力强,且特别因其完全运行于中国芯片上而引人注目。

Frederic Lardinois
记者,《The New Stack》

认为像智谱这样的中国实验室并非通过简单蒸馏,而是通过更快的发布节奏、基准聚焦和后训练优化来追赶美国前沿实验室,同时指出该模型增强的漏洞分析能力引发了双重用途安全担忧。

interconnects.ai (Nathan Lambert's publication)
AI研究与行业分析博客
The Crowd

Introducing GLM-5.3-Flash - Leading capabilities at a highly competitive price - Natively multimodal with a 1M-token context window - A 320B-A18B model released under the MIT License - Previously previewed as Ox Alpha, running entirely on Chinese AI chips Blog: [link]

@@Zai_org23121

Ox Alpha was an early version of GLM-5.3-Flash. The official release delivers stronger performance and significantly better stability. Huge thanks to @opencode and @OpenRouter for making it available to the community. And thank you to everyone who tried it, pushed it to its limits.

@@ZixuanLi_4472

Ox Alpha has been unveiled as GLM-5.3-Flash, but what's shocking is that the 100T tokens per day is served on Chinese chip. (1/...)

@@SemiAnalysis_2770

GLM-5.3-Flash: Frontier Intelligence, Flash Cost

@u/BriguePalhaco1200
Broadcast
Ox Alpha is GLM 5.3 Flash!!!

Ox Alpha is GLM 5.3 Flash!!!

GLM 5.3 Flash Might Be The New Mystery Model & NEW DeepSeek Model!

GLM 5.3 Flash Might Be The New Mystery Model & NEW DeepSeek Model!

GLM 5.3 Flash JUST DROPPED... And It's Almost As Good As MAX?!

GLM 5.3 Flash JUST DROPPED... And It's Almost As Good As MAX?!