智谱AI(Z.ai)发布GLM-5.3,以及超越训练预期的网络攻防能力
TECH

智谱AI(Z.ai)发布GLM-5.3,以及超越训练预期的网络攻防能力

46+
Signals

战略概览

  • 01.
    Z.ai(智谱AI)于2026年8月14日发布了GLM-5.3,这是一款基于与GLM-5.2完全相同的基座模型构建的开源权重模型,所有能力提升均来自扩大的后训练,而非新的预训练过程。
  • 02.
    GLM-5.3是一款7430亿参数的混合专家模型(mixture-of-experts),其基础架构与GLM-5.2完全一致。
  • 03.
    该模型已立即通过GLM编程计划(GLM Coding Plan)和Z.ai的ZCode编程环境提供,API访问和开源权重将在完成安全评估后分阶段推出。
  • 04.
    该模型在Terminal-Bench 3.0——一项长视野代码生成基准测试中表现最为突出,得分从GLM-5.2的4.6跃升至28.3。

仅靠后训练,未更换基座模型

GLM-5.3运行在与GLM-5.2完全相同的7430亿参数混合专家基座模型之上[1]——Z.ai并未进行任何新模型的预训练。相反,所有能力跃升均来自后训练的扩展:更多任务环境、更多环境类型以及在现有基座上进行更长时间的训练。最明显的信号来自Terminal-Bench 3.0,这是一项长视野代码任务基准测试,其得分从GLM-5.2的4.6跃升至GLM-5.3的28.3[2],这是目前所有代码基准测试中单次提升幅度最大的一次。Z.ai的后训练架构基于两个开源技术——slime和SAO,并使用模拟真实开发者工作站的沙箱环境[3]。Interconnects.ai的Nathan Lambert对此方法直言不讳:此次发布中,Z.ai所做的全部工作就是扩大后训练[4]。一个前沿级别的智能体编码能力跃升,仅通过后训练计算实现,而基座权重完全冻结,这一事实凸显了在真实任务环境中使用类强化学习训练方式,能够将现有模型能力拓展到何种程度。

一项超越训练目标的网络攻防能力

此次发布中最关键的细节并非某项基准分数,而是一个设计上的意外。Z.ai添加了漏洞发现训练环境,本意是增强模型识别单个漏洞的能力。然而,模型却开始推理多阶段攻击流程,将多个独立弱点串联成连贯、完整的攻击计划,而非仅标记孤立缺陷[5]——这一能力据称并非公司有意构建。排行榜数据反映了这种“过冲”:CyberGym得分升至84.5%,领先于Claude Mythos 5和GPT-5.6 Sol;ExploitBench得分则从24.4%翻倍至54.4%[6]。在与中国安全团队合作中,该模型在269个项目中发现了2,436个漏洞,其中一些漏洞已存在数十年,1,097个被评定为严重或高危级别;目前已有53个漏洞被公开披露,其余仍处于保密状态[6]。据报道,该模型还发现了AI代码编辑器Cursor中的一个严重漏洞,该漏洞由安全研究员Joshua Saxe指出[7]。Z.ai将开源权重和完整API访问延迟约两周发布,直接归因于对这一进攻性能力的安全评估[8]——这是实验室因后训练产生超出预期能力而主动放缓发布的罕见明确案例。

中国实验室的快速迭代策略 vs. 西方的严格发布机制

Z.ai明确将GLM-5.3定位为缩小与Anthropic和OpenAI在代码生成与智能体能力方面差距的产品[9]。Nathan Lambert分析中国实验室为何能在整体计算预算较小的情况下保持竞争力,指出这源于结构性因素而非单一突破:更快的发布节奏、对公开基准的高度优化、更窄且常为纯文本的模型范围、中国强化学习数据环境产业的发展,以及清华大学等人才输送渠道[4]。经济因素进一步强化了这一趋势——据报道,GLM-5.3与GLM-5.2的每token运行成本约为某些美国前沿模型的十分之一,即使在最困难评估中原始基准表现仍落后于封闭的美国系统,也带来了显著的定价压力[11]。这种竞争压力并非新现象:美国国家标准与技术研究院(NIST)人工智能标准与创新中心此前已判定,GLM-5.2在其发布时可能是当时最强大的开源权重模型[10],表明GLM-5.3并非一次性意外突破,而是Z.ai发布节奏持续快于西方实验室缓慢、安全审查更严的发布周期的延续。

分歧反应:零日漏洞兴奋与安全担忧并存

外界对GLM-5.3的反应正如同该模型本身一样分裂。在以编程为核心的社区中,情绪偏向兴奋——实际测试者形容该模型速度快,能从单一提示生成完整可运行软件,尤其在代码审计方面表现出色,同时注意到其价格在能力跃升后仍保持不变。相比之下,以聊天和角色扮演为主的用户则认为此次发布对他们影响不大,因为Z.ai的改进完全集中在代码与安全领域,部分用户还指出模型的内容审核机制已收紧。更尖锐的矛盾出现在漏洞发现能力本身:一场活跃讨论正在权衡,通用型零日漏洞发现工具究竟是通过加速补丁修复提升了软件安全性,还是因将相同工具交到攻击者手中而增加了风险,参与者指出,世界此前从未有过通用型零日漏洞发现工具在现实中运行。这场辩论与另一侧对代码能力提升的直接兴奋并行,比任何单一解读都更准确地揭示了此次发布所蕴含的双重用途张力。

历史背景

GLM-5.2(MIT许可证,100万token上下文)作为开源权重模型发布,并通过GLM编程计划提供,早于更广泛的API和平台支持。
美国人工智能标准与创新中心完成对GLM-5.2的评估,认定其在发布时可能是当时最强大的开源权重AI模型。
GLM-5.3通过GLM编程计划和ZCode发布,基于与GLM-5.2相同的7430亿参数基座,开源权重和完整API访问将在安全审查后约两周推出。

关键关系图

关键玩家
主题

智谱AI(Z.ai)发布GLM-5.3,以及超越训练预期的网络攻防能力

Z.

Z.ai (Zhipu AI)

开发并发布GLM-5.3的中国AI初创公司;将其定位为缩小与美国前沿实验室在代码与智能体能力上的差距,同时因模型涌现出的网络攻防能力而推迟完整开源权重发布以进行安全审查。

AN

Anthropic

基准竞争对手;GLM-5.3在代码与网络安全基准测试中直接与Claude Opus 4.8、Claude Fable 5和Claude Mythos 5对比,部分领先,部分落后。

OP

OpenAI

基准竞争对手;GLM-5.3在CyberGym和代码基准测试中与GPT-5.6 Sol对比,在部分最难评估中落后。

CU

Cursor

AI驱动的代码编辑器,GLM-5.3在发布后不久据报发现其存在严重安全漏洞。

ZC

ZCode

Z.ai官方编程环境,GLM-5.3与GLM编程计划一同在此首发,现有订阅用户配额已重置。

JO

Joshua Saxe

安全研究员,因指出GLM-5.3在Cursor中发现的漏洞而被认可。

事实来源

11 条引用
  1. [1] GLM-5.3 Documentation
  2. [2] Z.ai Ships GLM-5.3 Without Retraining the Base Model, Better at Complex Coding and Long-Horizon Tasks
  3. [3] Z.ai Debuts GLM-5.3 With Long-Horizon Coding, Cybersecurity Upgrades
  4. [4] GLM-5.3: How Chinese Labs Keep Stride
  5. [5] Z.ai Launches GLM-5.3 With Frontier Coding and a Cyber Capability That Outgrew Its Training
  6. [6] GLM-5.3 Post-Training Produced Exploit Chains Z.ai Never Planned, Finds 1,097 Critical Bugs
  7. [7] GLM-5.3 Is Here With Advanced Cyber Capabilities - and Reportedly Already Found a Serious Vulnerability in Cursor
  8. [8] China's Open-Source AI Push: GLM-5.3
  9. [9] Z.ai Aims to Catch Anthropic, OpenAI in Coding With New AI Model
  10. [10] CAISI Assessment of Z.ai's GLM-5.2
  11. [11] China's Z.ai GLM-5.3 Claims Top Open-Weight Coding Model Spot

来源文章

Top 5

THE SIGNAL.

Analysts

将中国实验室能够跟上前沿西方模型的能力归因于更快的发布速度、高度针对基准的优化、更窄的纯文本模型范围、中国强化学习数据环境产业的增长,以及清华大学等人才输送渠道。

Nathan Lambert
AI分析师,Interconnects.ai

强调GLM-5.3已发现Cursor中一个潜在严重漏洞,并指出一个前沿级基座模型仅通过后训练即可实现多大性能提升,而无需重新预训练。

Rohan Paul
AI评论员(X/Twitter)
The Crowd

Introducing GLM-5.3: Built to Code. Ready for Cyber Defense. - Top-tier coding and agentic capabilities, achieved through post-training on the 743B base model - A major leap in cybersecurity, setting a new standard among open models Tech Blog: z.ai/blog/glm-5.3

@@Zai_org18895

A 743B GLM-5.3 model now Beats Anthropic 6 Trillion model Claude Opus 4.8 on Terminal Bench

@@0x0SojalSec126

GLM 5.3 vs GLM 5.2 tested both with the same prompt > GLM 5.3 consumed $0.3 to finish everything in 4 mins > meanwhile GLM 5.2 consumed $0.85 to finish everything in 6 mins glm 5.3 is way better at creating videos while consuming way fewer credits which one do you think won?

@@0x_sakata52

GLM 5.3 finds 2436 unpatched open source vulnerabilities likely missed by Mythos (Project Glasswing)

@u/1a1b620
Broadcast
GLM 5.3 Is INSANE! The BEST Open Source Model EVER? BEATS MYTHOS? (Fully Tested)

GLM 5.3 Is INSANE! The BEST Open Source Model EVER? BEATS MYTHOS? (Fully Tested)

GLM-5.3 (Fully Tested): I GOT EARLY ACCESS & IT'S #1 ON MY BENCH!

GLM-5.3 (Fully Tested): I GOT EARLY ACCESS & IT'S #1 ON MY BENCH!

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities