Z.ai的GLM-5.3通过后训练缩小与前沿AI的差距,无需重新训练
TECH

Z.ai的GLM-5.3通过后训练缩小与前沿AI的差距,无需重新训练

26+
Signals

战略概览

  • 01.
    Z.ai于2026年8月14日发布了GLM-5.3,在保持与GLM-5.2相同的基础模型(总参数753B/743B,约40B激活)的前提下,所有能力提升均来自扩展的后训练,而非重新训练。
  • 02.
    该模型在Artificial Analysis Intelligence Index上得分为60,与Moonshot AI的Kimi K3持平,落后于Claude Opus 5的63分三个百分点。
  • 03.
    GLM-5.3现已通过Z.ai的API、GLM Coding Plan和ZCode提供;MIT许可的开源权重预计在发布后约两周内公开,前提是完成安全审查。
  • 04.
    该模型保留了GLM-5.2的100万token上下文窗口,最大输出扩展至128K token,仍为纯文本模型,不支持多模态输入,并支持三种推理努力级别(低、高、最大)。

纯后训练策略:Z.ai如何在不更换基础模型的情况下缩小差距

GLM-5.3运行在与GLM-5.2完全相同的753B总参数、约40B激活参数的基础模型之上[1]。Z.ai并未从头重新训练网络,而是扩大了后训练规模——更多任务环境、更多环境类型,以及在不变的基础架构上进行更长时间的强化学习训练[1]。这种投入体现在奖励持续、多步骤推理而非原始知识的基准测试中:GDPval-AA v2代理工作Elo从1524跃升至1770,增长246分,使GLM-5.3在所有模型中排名第二,仅次于Claude Opus 5的1855分[3]。Z.ai内部的Code Bench比GLM-5.2提升了50%,Terminal-Bench 3.0从4.6升至28.3,DeepSWE v1.1从46.2升至66.9[4]。Interconnects.ai的Nathan Lambert将此视为中国实验室能够跟上资源远超自身的美国前沿实验室的核心原因:以天为单位的更快发布周期(而非数月)、更窄的纯文本专业化方向,以及日益成熟的国内RL环境数据市场,使得实验室可以从已训练好的模型中榨取出接近前沿水平的性能[9]。他对这一方法的总结非常直接——后训练扩展本身被视为一种完整战略,而非下一次预训练前的临时措施[9]。代价是GLM-5.3仍受限于其2026年款基础模型架构的上限,Reddit的技术社区也独立指出了这一点,用不太客气的说法指出:同一个700B级别的基础模型只是通过强化学习被推向了前沿性能水平,而高输出冗长性正是这种方法的成本。

一项未计划的能力:GLM-5.3的网络安全意外

此次发布中最关键的数字并非智能指数得分,而是当GLM-5.3面对真实代码时的表现。Z.ai表示他们预期后训练会略微提升漏洞推理能力,但对这种能力迅速复合式增长感到惊讶——模型形成了连贯的多阶段攻击链,而不仅仅是孤立地发现漏洞[5]。实际上,GLM-5.3在CyberGym上的得分为84.5%,高于GLM-5.2的77.2%,并在269个开源项目中识别出2,436个漏洞,其中1,097个被评定为中高危等级;这些发现的大部分仍处于保密状态,尚未公开披露[4][5]。这不仅仅是一个厂商自测声明,三位独立的YouTube评测者——WorldofAI、AICodeKing和Mehul Mohan——都指出网络安全能力的跃升是本次发布的突出亮点;AICodeKing和Mehul Mohan通过自己长达数小时的编码与安全压力测试得出结论,而WorldofAI则通过复现Z.ai公布的CyberGym和漏洞数量数据予以验证。AICodeKing的基准测试套件在一个三维网页开发任务中给GLM-5.3打出8分(满分10分),而仅仅两个月前,GLM-5.2在同一提示下仅得3分,并认为安全专精实际上提升了通用编码能力,因为审计代码比编写代码需要对结构有更深层次的理解。Mehul Mohan在进行了十小时、约1.55亿token的压力测试后,独立描述这一网络安全能力跃升为一次显著飞跃,达到甚至超过了Claude级别模型的表现。Z.ai将这些进步视为对防御方的净收益,使其能更早发现并修补弱点[4],但相关报道也将其视为经济范围内强进攻性网络能力广泛扩散的一步[4]——值得注意的是,正是单次后训练(而非新模型架构)促成了这一跃升。

开放权重,封闭疑虑:价格颠覆遭遇信任难题

从纯经济学角度看,GLM-5.3极具侵略性:每百万输入token收费1.40美元,每百万输出token收费4.40美元,折合每次Intelligence Index任务0.68美元,比Kimi K3便宜19%,比GPT-5.6 Sol便宜45%[7]。X平台上的独立评论将此视为头条新闻,认为当一个绑定开源权重的竞争对手在顶级五名模型中仅差一分时,闭源模型的定价再也无法维持。但在这股热情之下,社区反应比价格叙事更为分裂。Reddit上有评论者批评Artificial Analysis的对比图表忽略了GLM-5.2作为直接基线,有人指出每当Qwen等模型逼近GPT或Claude时,Artificial Analysis就会调整评分标准——这一中立性质疑即使在总体印象积极的讨论串中也反复出现。另一个更尖锐的争议出现在r/SillyTavernAI板块,一名用户声称从API中提取到了包含内容限制指令的服务器端系统提示;其他尝试相同提取的用户却得到不一致或矛盾的结果,导致社区对该隐藏审查层是否真实存在还是提取误差产生分歧。实际使用报告同样褒贬不一:一位在r/ZaiGLM运行自主编码工作流的用户称该模型在迭代任务完成方面与SOTA系统相当,而另一位用户则报告其性价比不如GPT-5.6 Sol,引发同一讨论串内的反驳。这些并未否定基准数据本身,但破坏了“GLM-5.3更便宜且一样好”的简洁叙事——评估者与厂商防护机制的可信度正被实际使用者主动质疑。

三家实验室,同一终点:中国的前沿集群同步抵达

GLM-5.3的发布并非孤立事件。对该发布的报道将Z.ai与Moonshot AI的Kimi K3并列,后者在Intelligence Index上与其同得60分,以及DeepSeek一道,三者发布时间表高度重叠,紧随Claude Opus 5的63分前沿得分之后[3]。三方收敛的意义大于任何单一分数:这表明Nathan Lambert所描述的后训练技术、面向基准的迭代以及融资压力的组合,不再是Z.ai独有,而已成为中国AI行业的可复制模板[9]。GLM-5.3并非在所有维度上领先该集群——Kimi K3在AA-Omniscience事实可靠性上得分更高,尽管GLM-5.3的14分本身已是巨大跃升(GLM-5.2仅为4分)[3]。这一事实准确性提升伴随着一个值得注意的副作用:GLM-5.3的幻觉率略有上升,从26%升至30%,因为模型尝试回答的问题总数增加了(尝试率从46%升至55%,准确率从24%升至34%)[3]。换句话说,模型变得更博学、更愿意作答,但在判断自身错误时略显不够谨慎——这一权衡必须由投资者和用户共同衡量,尤其考虑到即便技术指标改善,公司股价在发布当天仍下跌近4%[8]

历史背景

完成香港IPO,估值约70亿美元,随后在2026年6月GLM-5.2发布后一度飙升至近1280亿美元,后回落至约750亿美元。
发布GLM-5,开启GLM-5系列模型。
率先向GLM Coding Plan用户推出GLM-5.2,随后于2026年6月16日向API、聊天机器人和开源权重全面开放;它成为Intelligence Index上排名最高的开源权重模型。
通过API、GLM Coding Plan和ZCode发布GLM-5.3,并承诺在安全评估完成后约两周内以MIT许可证发布开源权重。

关键关系图

关键玩家
主题

Z.ai的GLM-5.3通过后训练缩小与前沿AI的差距,无需重新训练

Z.

Z.ai (Zhipu AI)

总部位于北京的GLM-5.3开发者,从清华大学孵化,于2026年1月在港交所上市;掌控模型的后训练策略及分阶段开源权重发布节奏。

AR

Artificial Analysis

独立评估机构,其 Intelligence Index 评分以及 GDPval-AA v2 / AA-Omniscience 基准测试是几乎所有媒体用来衡量 GLM-5.3 表现的参考标准。

MO

Moonshot AI (Kimi K3)

中国竞争对手实验室,其 Kimi K3 在 Intelligence Index 上与 GLM-5.3 并列60分,且在事实可靠性方面超越 GLM-5.3,直接影响了外界对 GLM-5.3 发布的竞争力解读。

AN

Anthropic (Claude Opus 5)

美国领先实验室,其 Claude Opus 5 在 Intelligence Index 和 GDPval-AA v2 Elo 排行榜上均位居榜首,成为衡量 GLM-5.3 的标杆。

DE

DeepSeek

第三家中国实验室,与 Z.ai 和 Moonshot 几乎同期发布模型,同属紧随美国领先水平之后的激烈竞争阵营。

事实来源

9 条引用
  1. [1] Z.ai Ships GLM-5.3 Without Retraining the Base Model: Better at Complex Coding and Long-Horizon Tasks
  2. [2] GLM-5.3 Scores 60 on Artificial Analysis Intelligence Index, Matching Kimi K3
  3. [3] GLM-5.3 Scores 60 on AA Intelligence Index, Three Chinese Labs Now Right Behind US Frontier
  4. [4] Z.ai Launches GLM-5.3 With Frontier Coding and a Cyber Capability That Outgrew Its Training
  5. [5] GLM-5.3 Major Enhancements
  6. [6] GLM-5.3 Documentation
  7. [7] GLM-5.3 Model Page - Artificial Analysis
  8. [8] China's Z.ai Unveils GLM-5.3, Claims Chart-Leading Scores
  9. [9] GLM-5.3: How Chinese Labs Keep Stride

来源文章

Top 5

THE SIGNAL.

Analysts

认为像Z.ai这样的中国实验室通过扩展后训练而非预训练来追赶美国前沿实验室,以更快的速度(以天计 vs 美国实验室的以月计)、更窄的纯文本专业化方向,以及日益成熟的国内RL环境数据市场实现赶超。

Nathan Lambert
作者,Interconnects.ai

怀疑GLM-5.3的技术进展能否转化为商业健康,警告称代理型AI使用的增加将推高Z.ai的推理成本和亏损。

Robert Lea
情报分析师,引述自彭博社
The Crowd

GLM-5.3 API is now live. - Built for coding, defensive cybersecurity, and long-horizon agentic tasks - Priced the same as GLM-5.2 - Available via the official API and partner model gateways Get started: https://docs.z.ai/guides/llm/glm-5.3

@@Zai_org3342

GLM-5.3 achieves 60 on the Artificial Analysis Intelligence Index, on par with Kimi K3 and up 7 points from GLM-5.2. Once the weights are released it will be tied as the leading open weights model @Zai_org has just launched GLM-5.3, which ties Kimi K3 (60) for the most...

@@ArtificialAnlys1742

GLM-5.3 just ranked 5th best AI model on the intelligence index, only one point behind GPT-5.6 Sol. 6.8x cheaper on output. OpenAI charges $30 per million output. GLM-5.3 charges $4.40 and it is open weights. Closed pricing is officially cooked 😭

@@shiri_shh40

GLM5.3 Artificial Analysis Benchmarks

@u/anderspitman259
Broadcast
GLM 5.3 Is INSANE! The BEST Open Source Model EVER? BEATS MYTHOS? (Fully Tested)

GLM 5.3 Is INSANE! The BEST Open Source Model EVER? BEATS MYTHOS? (Fully Tested)

GLM-5.3 (Fully Tested): I GOT EARLY ACCESS & IT'S #1 ON MY BENCH!

GLM-5.3 (Fully Tested): I GOT EARLY ACCESS & IT'S #1 ON MY BENCH!

GLM-5.3 Review (I Used 200 Million Tokens In 10 Hours)

GLM-5.3 Review (I Used 200 Million Tokens In 10 Hours)

Z.ai的GLM-5.3通过后训练缩小与前沿AI的差距,无需重新训练 — AI 新闻 | Agentic Brew