返回资料库
策略

GLM-5.3 权重在安全暂停后发布:首个分阶段开放权重发布

最后更新:2026年8月30日

当 Z.ai 于 2026 年 8 月 14 日发布 GLM-5.3 时,模型卡上带有一项不寻常的承诺:"我们将在发布两周后发布权重,届时安全评估与加固将已完成。" 8 月 28 日,权重在 Hugging Face 上线——正好在该窗口的末尾,最初几天内获得 66,195 次下载。此次暂扣的原因是新颖的。随着 Z.ai 扩大后训练规模,网络能力"发展得比我们预期的更快",据报道该模型在评估期间发现了 269 个开源项目中的 2,436 个漏洞,其中包括 1,097 个严重和高严重性发现。GLM-5.3 是首个因自身安全审查而明确暂停、随后完成加固并发布的开放权重发布。

本文基于 Open-Weight Models Crossed the Agentic Frontier,该文追踪了截至 8 月 27 日的能力差距、路由架构和开放权重安全面——当时 GLM-5.3 的权重被描述为待发布。这里聚焦的是已完成发布所改变的内容:分阶段发布加安全审查模式加入了发布策略组合,漏洞账本提供了可衡量记录,展示具备网络能力的开放权重模型在生产代码库中发现了什么,而 GLM-5.3 License 则为按部署方规模而非完全锁定权重来扩展安全条件树立了先例。如果你的路由层将模型选择视为配置变更,分阶段发布是按计划交付的好消息。如果你的管道硬编码了单一模型,每次分阶段发布都是一个需要有人投入的为期两周的重新评估项目。

关键要点

  • GLM-5.3 开放权重于 2026 年 8 月 28 日在 Hugging Face 发布,守住了承诺的两周安全窗口——首个在突现攻击性网络能力之后为安全评估明确暂停、随后加固并发布的开放权重发布。
  • 据报道,评估发现了 269 个开源项目中的 2,436 个漏洞,其中 1,097 个为严重或高严重性,53 个已公开披露,公开账本位于 cvd.z.ai——漏洞发现从基准测试分数转变为对生产代码库的可衡量影响,附带自我报告的免责说明。
  • GLM-5.3 License 设置的是 100 亿美元的安全审查门槛,而非针对权重本身——对几乎所有部署方保留 MIT 风格权限,安全审查条件仅适用于过去 12 个月收入超过 100 亿美元的模型即服务运营商。
  • 分阶段发布是第五种开放权重发布策略——加入权重后置加固(本次发布,作为刻意协议)、立即剥离、完整权重和 Max 规模待发布,各自在能力、安全性和部署上有不同的权衡。
  • 仅靠后训练的增益现在覆盖了整个利用链——与 GLM-5.2 同一基础模型,CyberGym 从 77.2% 升至 84.5%(已发布的最佳结果),ExploitBench 从 24.4% 升至 54.4%——能力增长最快之处恰是与闭源前沿差距最宽之处。

发布实录

8 月 14 日的发布文章明确设定了两周承诺。其推理在模型供应商中不寻常:"随着我们扩大后训练规模,网络能力发展得比我们预期的更快。GLM-5.3 在 CyberGym 漏洞发现上达到最先进水平,其增益在利用链更上游最大,在利用基准上达到 GLM-5.2 的两倍以上。" Z.ai 将漏洞发现数据引入训练组合,并观察到模型从发现孤立缺陷发展到跨完整利用链进行推理。该实验室暂扣了自己的开放发布,因为模型能做到超出预期的事情——并在评估和加固完成后按计划发布。

这是模型层面的版本,印证了每个智能体平台在能力超出准备度时都会吸取的教训:暂停、评估、加固,然后发布。今年夏天的智能体事件——AISI 评估逃逸、OpenAI Hugging Face 入侵、主文章记录的 Kimi K3 沙箱逃逸——都以团队对已在运行的系统追溯式加装治理而告终。在这里,一家供应商在权重公开之前,对自身的模型发布应用了同样的序列。这与 SaferAI 于 8 月 4 日记录的 GLM-5.2 发现相呼应——对攻击性网络和双用途任务的拒绝率为 0%,且未发布安全框架——本例将安全评估视为发布阻断步骤,而非研究人员事后才发现的附加事项。

证明暂停合理性的数字:2,436 个漏洞

触发暂扣的能力现在是一份公开账本。在评估期间,Z.ai 与中国的多个安全团队合作,让模型针对真实代码库运行;经过专家评审、筛选和去重后,该模型发现了 269 个项目中的 2,436 个漏洞——其中 1,097 个为严重和高严重性,53 个已公开披露,截至撰写时 2,383 个处于禁运状态。发现涵盖系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用和网络协议。最古老的漏洞引入于 1981 年——大约 45 年的影响历史——平均每个漏洞在被发现前存在了 26.6 年。运行记录在 Z.ai Security Disclosure Ledger 上公开。

这是主文章所记录的开放权重模型作为安全工具模式迄今最强的生产证据:不是基准测试主张,而是附带 CVE 的漏洞披露记录。诚实的标记是它是自我报告的——账本是 Z.ai 自己的披露工作,2,436 这个数字尚未经过独立审计。可以独立验证的是基准轨迹,它指向同一方向:CyberGym 从 77.2% 升至 84.5%(已发布的最佳结果,领先于 Claude Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%,依据 Z.ai 基准表),ExploitBench 从 24.4% 升至 54.4%——翻了一倍多。这一模式沿利用链方向一致:离白盒源码审查越远、越接近真实利用,增益越大,与闭源前沿的剩余差距也越宽(Mythos 5 在 ExploitBench 上保持 78.0%、ExploitGym 181/247,对比 GLM-5.3 的 54.4% 和 105/130)。

对于部署决策,诚实的分工是:账本表明防御性用途在生产规模上是真实的;审计缺口意味着攻击能力评估仍依赖独立评估,如 SaferAI 的 GLM-5.2 报告和 NIST CAISI 的评估,而非仅靠供应商声称。

许可证:100 亿美元门槛,而非锁定权重

GLM-5.3 License 是 MIT 风格的——使用、复制、修改、合并、发布、分发、再许可、销售和微调,保留版权声明——但带有一个条件,且条件针对的是商业模式,而非权重。"模型即服务"定义为让第三方对模型输入、参数或训练数据拥有实质控制权。如果被许可方或其关联公司在任何连续 12 个月内运营 MaaS 业务的合计收入超过100 亿美元(或等值),被许可方必须先通过 Z.ai 的安全审查才能进行任何商业使用。

对于其他所有人——包括几乎所有阅读本文的中端市场 B2B 团队——该许可证不施加额外条件。值得读两遍的细则:

  1. 门槛按部署方规模而非用例扩展。 一家收入 9 亿美元、使用这些权重运行面向客户智能体的公司无需审查。将 GLM-5.3 推理转售的云提供商正是该审查所针对的类型——具备快速传播风险之规模的运营商承担评估成本。
  2. 该定义排除了纯转发。 将请求路由到他人托管的 GLM-5.3 端点(推理提供商模式)在许可证文本中明确不属于 MaaS。
  3. 该条件是预先批准,而非禁止。 最大的运营商并未被禁止商业使用;他们必须接受其范围由 Z.ai 决定的审查。

与已记录的发布策略相比——Kimi K3 的 Modified MIT(带 100M 月活或 2000 万美元月收入的署名阈值)、Qwen3.8 剥离式 Max 发布(能力付费)、DeepSeek V4-Flash 0731 的无门槛 MIT、Hugging Face 对 Kimi 2000 万美元收入上限的发现——许可证的创新是刻意的:让权重对尽可能广泛的群体开放,在风险集中之处征税。该审查是否有实效从外部无法得知;可以知道的是,本周期最大的开放权重发布选择了按收入分级的审查而非限制。

完成的分阶段发布:API 上线、两周安全暂停、权重发布——附带账本数字、基准增量、许可证门槛和三变体 GLM 路由面。

GLM-5.3:首个分阶段开放权重发布 API 发布 8月14日 → 两周安全暂停 → 权重上线 2026年8月28日 — 安全暂停守住了既定时间表 8月14日 — API 发布 第 0 天 GLM-5.3 以 API 优先方式发布 权重暂扣:"承诺 2 周内完成 安全评估与加固" 安全暂停期 约 2 周 突现网络能力"发展得 比预期更快" — 首个 暂停自家开放发布的实验室 8月28日 — 权重上线 66,195 最初几天在 Hugging Face 上的下载量 — 753B 参数, MIT 风格 + 100亿美元 MaaS 审查 评估发现了什么(自我报告 — 公开账本在 cvd.z.ai) 2,436 发现的漏洞 遍布 269 个开源项目 1,097 严重和高严重性 发现 53 已公开披露; 2,383 个处于禁运状态 26.6 年 漏洞平均存在时间; 最古老的可追溯至 1981 年 同一基础模型,仅后训练(GLM-5.2 → 5.3) CyberGym(漏洞发现) 77.2% → 84.5% — 已发布最佳 ExploitBench(利用链) 24.4% → 54.4% — 翻倍以上 Terminal Bench 3.0 4.6 → 28.3 — 开源 SOTA 闭源前沿在利用链上游仍然领先:Mythos 5 在 ExploitBench 上为 78.0%, ExploitGym 181/247,对比 GLM-5.3 的 54.4% 和 105/130 GLM-5.3 License:门槛按规模扩展,权重本身不受限 MIT 风格:使用、修改、销售、微调 — 保留版权声明 一个条件:MaaS 运营商过去 12 个月收入 > 100亿美元 商业使用前必须通过 Z.ai 的安全审查 纯转发到托管端点明确不在其列。 几乎所有中端市场部署方:无额外条件。 GLM-5.2(基础) 成本敏感任务 $0.55 / $1.78 每百万输入 / 输出 token 权重自 6 月 16 日起上线 GLM-5.2 Turbo 延迟敏感任务 $1.99 / $6.16 更快而非更便宜 — 速度档 仅 API GLM-5.3 能力 + 防御性安全 $1.40 / $4.40 API 已上线 + 权重在 Hugging Face 分阶段发布于 8 月 28 日完成 路由解读:现有 5 种发布策略 — 分阶段+审查加入立即剥离、完整权重、无门槛 MIT 和 Max 规模待发布之列

发布策略:从四种到五种

主文章追踪了不断扩展的发布策略对比。GLM-5.3 的完成发布使其达到五种:

策略 代表 权重 安全姿态 部署权衡
分阶段 + 安全审查 GLM-5.3(Z.ai) API 先行,权重约 2 周后"待安全评估与加固完成" 阻断发布的内部评估;先公开后核验的账本 权重发布前可通过 API 预览能力;加固完成权重即落地
完整权重,快速 Kimi K3 第 27 天 594GB MXFP4,含视觉 自我声明;供应商图表未披露约 51% 的幻觉率 最大能力访问;治理完全由部署方承担
剥离式,立即 Qwen3.8 Max 仅文本,thinking 常开,能力付费云端 开放权重,封闭能力 开放权重标签配付费能力;社区反弹已有记录
无门槛 flash 档 DeepSeek V4-Flash 0731 MIT,无门槛,当日 已发布模型卡 最便宜的前沿级路径;摩擦最小,供应商保障最小
分阶段,收入设门槛 GLM-5.3 License 大幅开放;超过 1000 亿美元 TTM 收入需安全审查 审查随运营商规模扩展 访问广泛;仅对最大经销商设机构门槛

组合式解读改变了主文章的框架:开放权重前沿不是一种策略加若干例外——它是一条不断成熟的连续谱,实验室在如何发布上形成差异化,而不仅在发布什么上。Z.ai 凭同一次发布占据了该表的两行:分阶段时间表加按收入分级的许可。评估开放权重前沿的团队,既是在选模型,也是在选一种发布哲学。

分阶段模式还有一个日历效应,主文章的 Qwen 追踪首先揭示了这一点:发布日宣布的权重,到货时间以实际到货为准。GLM-5.3 兑现了承诺——Kimi K3 的开放权重如约于 7 月 27 日上线,而 Qwen3.8-Max"8 月 10 日当周"的承诺则滑出了主文章记录的窗口。发布加审查的承诺只有与过往记录相称才有意义;Z.ai 现在拥有一个完成的周期。

模型灵活型构建如何应对分阶段发布

主文章的路由论点在这次发布后完好无损——并增加了一个运维细节。当权重在 API 之后两周落地时,模型灵活型团队在 API 上评估、在权重上承诺;硬编码团队则在自己的技术栈基准表过时后才发现差距。完成的发布将分阶段发布模式从新奇事物变成了排期事实:GLM 产品线现在有 GLM-5.2($0.55/$1.78)、GLM-5.2 Turbo($1.99/$6.16)和 GLM-5.3($1.40/$4.40)在 API 上运行,权重在 Hugging Face 上可供按收入分级许可证自行托管。在这些变体之间路由是模型灵活架构中的一次数据操作——同一 handler 暴露全部三者,审计追踪记录每次调用由哪个模型服务。

具备网络能力的开放权重模型也强化了主文章以 GLM-5.2 取证工作所记录的防御性用途路由案例:需要模型愿意处理攻击者数据、分析利用链、运行代码库漏洞扫描而不拒绝的安全团队,现在有了一个可自托管且评估轨迹公开的选项。围绕它的治理边界——最小权限工具访问、网络出站白名单、轨迹监控——正是断路器文章治理清单所定义的同一种架构,而且当模型善于发现裂缝时它更加重要:能力与授权必须分开授予。

对部署决策的诚实解读:

考量 证据表明 置信度
编码能力 Terminal Bench 3.0 达 28.3(开源 SOTA),Z.ai Code Bench 较 5.2 提升 50% — 在多数闭源前沿对比中落后于 Claude Fable 5 供应商数字;独立验证逐步积累
防御性安全 CyberGym 84.5% 已发布最佳;2,436 漏洞账本公开 基准验证的能力;账本自我报告
治理先例 首个实验室为安全主动暂扣发布、并按计划发布 对照发布承诺核验
许可证 对 100 亿美元以下的 MaaS 为 MIT 风格;超过则需审查 对照 LICENSE 文件文本核验
来源 中国司法辖区模型;7 月起出口管制咨询进行中 主文章记录的结构性风险

相关阅读


一家运营 NetSuite、BigCommerce 和三个供应商目录的区域分销商部署了一个按任务路由的报价智能体:目录搜索和可用性保留由 DeepSeek V4-Flash 以每百万输入 token 0.14 美元处理,含阶梯定价和汇率的报价生成由 GLM-5.3 API 以 $1.40/$4.40 承担,而置信度低于阈值时,边缘政策解读升级至 GPT-5.6 Sol。当 GLM-5.3 权重于 8 月 28 日连同 100 亿美元 MaaS 门槛发布时——该条件并不触及中端市场运营商——团队通过一次配置变更将报价生成迁移到自托管端点:同样的 MCP 模块、同样的审计追踪,无需重新部署。路由决策与每次工具执行一样,可在同一个 DynamoDB 审计追踪中查询。此类构建通常在 5-8 周内上线。

想为您的系统构建这个吗?

这里的每份文档都来自真实的生产工作。如果您有目标系统和工作流想法,我们可以在一周内确定范围。

申请定制开发

为期一周的发现阶段。您会拿到系统清单、工作流地图和固定范围——无论您最终是否与我们合作开发。