智谱AI发布GLM-5.3编程与网络安全模型
TECH

智谱AI发布GLM-5.3编程与网络安全模型

29+
Signals

战略概览

  • 01.
    智谱AI于2026年8月14日发布了GLM-5.3,这是对与GLM-5.2相同的7430亿参数基座模型进行后训练的更新版本,所有报告的能力提升均来自扩展的后训练,而非新的或重新训练的基座模型[1]
  • 02.
    GLM-5.3现已通过GLM Coding Plan提供,并集成到包括ZCode、Claude Code和OpenCode在内的编码代理中,但开放模型权重将在发布后约两周才公开,需等待安全评估和加固。
  • 03.
    GLM-5.3在多项基准测试中大幅超越GLM-5.2,包括Terminal-Bench 3.0(从4.6提升至28.3)和DeepSWE v1.1(从46.2提升至66.9),同时在网络安全基准CyberGym和ExploitBench上也取得进步。
  • 04.
    智谱与中国安全团队合作,GLM-5.3帮助在269个开源项目中发现了2,436个漏洞,其中约一半被评为中等或更高严重程度,包括一段大约40年前编写的代码中的缺陷。

后训练的天花板刚刚被打破

智谱表示,GLM-5.3运行在与GLM-5.2完全相同的7430亿参数基座模型上——所有报告的性能提升都来自规模化的后训练,而不是更大或重新训练的基座模型[1]。Terminal-Bench 3.0从4.6跃升至28.3,DeepSWE v1.1则从46.2上升至66.9[1][2]。智谱称,此次后训练已超越孤立的编程题目,进入完整的工程工作流——识别、分析、实施、验证并交付修复方案——使用真实的计算集群、存储系统和内部代码库,部分任务类似于资深工程师持续数天的工作负载[2]。在智谱内部的一项Z.ai基准测试中,GLM-5.3还以31.4%的成绩优于对比结果(29.5%),而每项任务仅使用约5万个输出token,远低于参考运行的约12万个token,表明该模型不仅能力更强,效率也更高[1]

一种未计划的能力:智谱未曾设想的漏洞链

更关键的细节并非某项基准分数——而是GLM-5.3本未被训练执行此任务。在网络安全训练过程中,该模型开始自主推理多个攻击阶段,形成完整漏洞链的连贯计划,这种行为被智谱自身描述为一种涌现能力[4]。这也正是开放权重被推迟约两周发布的原因——公司表示需要时间进行安全评估和加固,而非立即发布[1][3]。该模型与中国安全团队合作,在真实开源代码库中发现了2,436个漏洞,涉及269个项目,其中约一半被评定为中等及以上严重程度,并已登记至公共漏洞库[3][5]。其中一个漏洞存在于大约40年前编写的代码中[3]。智谱将这种双重用途的张力视为特性而非缺陷,明确以协作方式定位此次发布:“人工智能的发展不应是一个国家的独奏,而应是全球合作的交响乐。”[5]

“最强开放权重编程模型”——谁说的?

智谱称GLM-5.3是目前最强的开放权重编程模型,其网络安全数据在某些方面支持这一说法:在CyberGym上,它以84.5%略微领先于Anthropic的Mythos 5模型(83.8%)和GPT-5.6 Sol(83.6%)[2][3]。但在ExploitBench上差距重新拉开,GLM-5.3从24.4%提升至54.4%,而Mythos 5和GPT-5.6 Sol均得分在70%中高段[1][2]——这一差距足以动摇其在进攻性安全领域“最强”的定位。社区评测者也对编程能力提出质疑,指出在智谱自己发布的基准表中,另一款已可下载的开放权重模型在四个独立项目上的得分高于GLM-5.3,而官方公告并未提及这一点。定价也引发类似怀疑:GLM Coding Plan的相关讨论帖认为其价格偏高,相比其他开放模型,每次GLM版本升级似乎都在悄悄增加“思考token”的使用量,从而推高实际成本,尽管基准分数在提升。专注于角色扮演的用户则完全无感,指出这些提升集中在编程领域,并未延伸至通用对话质量。

延迟开放权重,市场不安:安全审查还是公关遮掩?

市场也未完全接受其“安全优先”的说辞:Z.ai在港股上市的股票在发布当日收盘前下跌近4%[6]。彭博社引用的情报分析师Robert Lea称该公司财务状况不可持续,警告“日益增长的智能体AI将推高Z.ai的推理成本和亏损”[6]。这种怀疑与智谱自身对延迟的解释并存——由于模型新发现的漏洞链能力,需约两周时间进行安全评估和加固[3][4]。这也不是首次中国开放编程模型引发此类警报:早在GLM-5.3发布前数月,已有报道称GLM-5.2已成为黑客的强大新工具[7],表明开放权重能力超前于安全审查的模式早在此前就已存在。

THE SIGNAL.

Analysts

尽管GLM-5.3在技术上有宣称优势,但仍对Z.ai的商业可持续性表示怀疑,警告称智能体AI工作负载带来的推理成本上升将持续压迫公司财务状况。

Robert Lea
情报分析师(被彭博社引用)
The Crowd

Introducing GLM-5.3: Built to Code. Ready for Cyber Defense. - Top-tier coding and agentic capabilities, achieved through post-training on the 743B base model - A major leap in cybersecurity, setting a new standard among open models Tech Blog: https://z.ai/blog/glm-5.3

@@Zai_org17850

GLM-5.3 isn't Fable or Sol level. But it's 743B and it lands 0.1 off Sol on Agents' Last Exam. I had a number in my head for where the open ones would stall out. I've moved it three times this year. The part I didn't expect is that they're pitching it as a security model.

@@ziwenxu_46

just launched GLM-5.3. And the most interesting part isn't that it's another 743B model. It's basically the same base model. They just kept pushing post-training. >Terminal-Bench 3.0: 4.6 -> 28.3 >DeepSWE: 46.2 -> 66.9 >ExploitBench: 24.4 -> 54.4

@@fanofaliens13

GLM 5.3 Released

@u/jmorant5551600
Broadcast
GLM 5.3 Is INSANE! The BEST Open Source Model EVER? BEATS MYTHOS? (Fully Tested)

GLM 5.3 Is INSANE! The BEST Open Source Model EVER? BEATS MYTHOS? (Fully Tested)

GLM-5.3 (Fully Tested): I GOT EARLY ACCESS & IT'S #1 ON MY BENCH!

GLM-5.3 (Fully Tested): I GOT EARLY ACCESS & IT'S #1 ON MY BENCH!

GLM-5.3 Released : Everything You Need to Know About Z.ai's New Coding Model (Benchmarks, Price )

GLM-5.3 Released : Everything You Need to Know About Z.ai's New Coding Model (Benchmarks, Price )

智谱AI发布GLM-5.3编程与网络安全模型 — AI 新闻 | Agentic Brew