返回资料库
策略

GLM-5.3-Flash:以旗舰价格十分之一逼近 Claude Opus 4.8 的 320B 开放权重模型

最后更新:2026年10月6日

核心要点

  • GLM-5.3-Flash 是 320B 总参数/18B 激活的原生多模态 MoE,定价 0.15/0.50 美元每百万 token——仅为 GLM-5.3 的 1.40/4.40 的十分之一——Intelligence Index 57,每任务 0.045 美元(折扣价)——按 Z.ai 自己的基准表述,这一智能水平此前仅在约 10 倍的成本下才可获得(Z.AI blog)。
  • 在 Terminal Bench 2.1 上 Flash 变体得 84.3 分,与 Claude Opus 4.8 相差不到 1 分;在 AutomationBench 上得 48.8 分——超过 Claude Opus 4.8 的 41.0 与 GPT-5.6 Terra 的 37.2——廉价变体在衡量真实工作流自动化的代理基准上超越了预期(Z.AI blog)。
  • Anthropic 前沿红队确认 GLM-5.3-Flash 独立串联两个 CVE(含 CVE-2026-11645)构建出可靠的 ARM64 利用链,耗时 20 分钟人工加 8 小时模型运行,按 Zhipu API 价格计成本 20.40 美元——防御用途与扩散风险皆真实且经独立验证(Anthropic research)。
  • 744B 的 GLM-5.3 旗舰权重仍未开放——“发布后两周”的承诺已过期,而 GLM-5.3-Flash 权重已在 Hugging Face 上线——父文记录的分阶发布如今成为拆分发布:Flash 变体开放,旗舰未开放(Hugging Face)。
  • NIST CAISI 称 GLM-5.3 为“迄今网络能力最强的开放权重模型”,落后美国前沿约 4 个月——前沿闭源与开放权重之间的网络能力差距如今已被测量,而非估算(NIST CAISI)。

本文承接 GLM-5.3:权重经安全暂停后发布——首个分阶开放权重发布,该文记录了 744B 旗舰的两周安全暂停、2,436 项漏洞披露清单以及按营收分级的许可。这里的焦点是 Flash 变体改变了什么:成本坍缩论题获得其最单点最强的数据,分阶发布拆分为已开放的 Flash 与被扣留的旗舰,而 Anthropic 的分析将网络能力主张从厂商自述转为实验室独立验证——包括一段成本 20.40 美元的 Flash 专属利用链。

成本坍缩数据点

《Z.AI 博客》对这次发布毫不掩饰:"320B 总参数、仅 18B 激活参数,以十分之一的价格在基准与真实工作负载上超越 GLM-5.2,并在代码与代理类基准上逼近 Claude Opus 4.8。"架构是全新的——不是 GLM-5.2 的后训练版本,而是在 30T token 多模态语料上全新训练的基座,是 GLM-5 系列首个原生多模态模型。它引入混合 sparse+linear 注意力架构(GLM 系首次)、流形约束超连接(mHC)以及用于 1M 上下文的 IndexPool。与 GLM-5.3 相比,Flash 变体使用少 3.0 倍的注意力计算与小 4.4 倍的 KV 缓存。它在大规模服务中运行于中国 AI 芯片上,配备 SGLang 上的专用推理引擎,实现端到端服务性能 3 倍提升,堪比主流 NVIDIA GPU。

定价是改变路由决策的部分。以 0.15/0.50 美元每百万 token(输入/输出),Flash 变体是 GLM-5.3 的 1.40/4.40 的十分之一。在 Artificial Analysis Intelligence Index v4.1.1 上它得 57 分,每任务 0.045 美元(折扣价)——Z.ai 指出这一智能水平此前只在约 10 倍成本下才可获得。LLM Gateway 将 GLM 5.3 Fast 列为 2026 年 10 月 7 日发布的最新模型。

对代理类负载真正要紧的基准是 AutomationBench,它衡量真实工作流自动化。GLM-5.3-Flash 得 48.8 分——超过 Claude Opus 4.8 的 41.0 与 GPT-5.6 Terra 的 37.2。在 Terminal Bench 2.1 得 84.3 分,与 Claude Opus 4.8 相差不到 1 分。在 DeepSWE v1.1 得 63.4 分,而 GLM-5.2 为 46.2。模式很清晰:廉价变体不只是在狭窄的编码基准上逼近前沿——它在这个衡量生产代理真实运行的多步工具使用循环的基准上超越了前沿。

对按任务路由的团队,这是一个配置决策。对硬编码单一模型的团队,这是一次需要专门人力的重新评估。DeepSeek V4.1-Flash 一文——连续 11 个 AI 搜索会话位列引用 #3——记录了静默模型替换风险:供应商可以不问就换掉模型。GLM-5.3-Flash 是反向数据点:一个超越预期的廉价变体,以开放权重形式提供,且由你自己拥有的层来路由。

分阶发布拆分

父文记录了一个已完成的分阶发布:8 月 14 日 API 上线、两周安全暂停、8 月 28 日 744B 权重上线 Hugging Face。Flash 变体使这一图景复杂化。GLM-5.3-Flash 权重已在 Hugging Face 提供;744B 的 GLM-5.3 权重没有——Z.ai 的 Hugging Face 组织下没有 GLM-5.3 仓库。“发布后两周”的承诺已过期,旗舰权重仍被扣留。

拆分发布具有治理解读。Flash 变体是已开放权重的一半:320B、18B 激活、0.15/0.50 美元、原生多模态,按父文记录的同一按营收分级许可开放自托管。旗舰是被扣留的一半:744B、完整的 CyberGym 84.5% 漏洞发现能力、2,436 项漏洞清单——正是那个因攻击性能力触发安全暂停的模型。Z.ai 公开了 Flash 变体并扣留旗舰。744B 权重是否会发布如今是一个悬而未决的问题,而不是排定的事件。

对模型灵活的构建,拆分是可管理的:将 80% 成本敏感的任务路由到 Flash 变体(自托管或 API),将 20% 能力关键任务升级到闭源前沿模型或 GLM-5.3 API。路由层是同一个处理程序,只有端点变化。对硬编码构建,拆分提醒人们:"模型"如今是一条产品线,不是单一制品——你测试过的变体未必是你最终运行的变体。

网络能力分析:独立验证

父文的漏洞清单是自述——Z.ai 自己的披露努力,2,436 项发现未经独立审计。Anthropic 前沿红队分析于 2026 年 9 月 29 日发布,将能力主张从厂商自述转为实验室独立验证。

在 ExploitBench(Chrome V8)上,GLM-5.3 在 410 次尝试中完成 50 次端到端 exploit 开发(12%),相当于 Claude Mythos Preview 的 14%。在 Anthropic 内部二进制利用基准上,GLM-5.3 达到 4% 完全控制流劫持;更早的模型(Claude Opus 4.6、GLM-5.2)得分为 0%。在研究者主导的测试中,GLM-5.3 在一款流行浏览器的 JavaScript 引擎中发现了此前未知的漏洞,并将它们串联成一个可读取来访者计算机任意文件的可用 exploit——一天内、有限人工参与下完成。

Flash 专属的发现是改变成本坍缩解读的那一个。Anthropic 研究者使用 GLM-5.3-Flash 为一个已知漏洞(CVE-2026-11645,最近披露的 Chrome 缺陷)开发 exploit。在无显著引导的情况下,Flash 变体串联两个缺陷的 exploit,为 ARM64 目标构建出可靠的利用链,绕过了指针认证(PAC)加固。这耗时 20 分钟人工加 8 小时模型运行。按 Zhipu API 价格计,这一努力本会花费 20.40 美元。廉价变体不只对良性负载廉价——对 offensive 安全工作同样廉价,而且是开放权重。

防护可被绕过。Anthropic 发现 GLM-5.3 的防护以虚假封面故事被绕过 64%、以预填充推理绕过 92%、在 abliterated 版本上为 100%(数天内即有多个 abliterated 版本公开发布)。这些技术在测试中对带防护的 Claude 模型全部无效。NIST CAISI 的 9 月 17 日评估称 GLM-5.3 为“迄今网络能力最强的开放权重模型”,在网络基准聚合上落后美国前沿约四个月。

治理解读是父文的 kill-switch 与治理清单交叉链接已为读者准备好的那条:能力与授权需分开授予。一个防护可绕过、能力接近前沿的开放权重模型,在受治理 MCP 模块、最小权限工具访问、网络出口白名单与轨迹监控之后运行时是防御工具——治理清单所规定的架构。没有该周边就运行,同一模型即扩散风险。0.15/0.50 美元的 Flash 变体让两种用途都更便宜。

对路由决策的改变

推理经济学一文所记录的成本坍缩论题如今获得其最强数据点。一个在 Terminal Bench 上与 Claude Opus 4.8 相差不到 1 分、在 AutomationBench 上超越它、价格仅为 Z.ai 自己旗舰十分之一——且以开放权重提供。趋势周期揭示的企业 AI 预算耗竭(2026 年基础设施支出增长 62.5% 至 8,220 亿美元,仅 6% 的采用者捕获可量化的全企业利润,据 AI Business Weekly;美国大型企业预算在 1–2 个月内枯竭,据 MarketScale)是需求驱动。成本坍缩不再是多年弧线——它是同一周的路由决策。

模型灵活的构建将 Flash 变体读作开放权重前沿一文所追踪的可交换池的新增条目。该池如今横跨三个地区(美国:Reflection Beam;欧洲:Mistral ML4、Aleph Alpha Kolibri-1;中国:DeepSeek、Qwen、GLM)与多个能力层级。已横跨开放与闭源模型的路由层可将 Flash 变体加为代理工具使用通道的成本优化默认,当置信度下滑时升级到受治理 MCP 模块之后的闭源前沿模型。审计日志记录每次调用由哪个模型服务。TypeSafe Jev 决策层一文记录了使升级策略显式化的校准契约:决策 >0.95 自动裁定,<0.50 转人工,中间带附概率排队复审。

Flash 变体的防御安全通道是父文 CyberGym 84.5% 数据点开启、Anthropic 分析现已独立确认的那条。需要愿意处理攻击者数据、分析利用链、扫描代码库漏洞而不拒绝的安全团队,如今有一个可自托管、独立验证、0.15/0.50 美元的选项。围绕它的治理周边——最小权限工具访问、网络出口白名单、轨迹监控——与 kill-switch 一文规定的是同一架构;当模型擅长寻找裂缝时,这一周边更重要,而非更不重要。

GLM-5.3-Flash:以 Flash 成本获得前沿智能 320B/18B 激活的开放权重 MoE — Terminal Bench 上与 Claude Opus 4.8 相差不到 1 分,价格仅为旗舰的十分之一 价格(每百万 token) $0.15 / $0.50 仅为 GLM-5.3 的 $1.40/$4.40 的十分之一 Terminal Bench 2.1 84.3 Claude Opus 4.8:约 85(相差不到 1 分) AutomationBench 48.8 超过 Claude Opus 4.8(41.0)与 GPT-5.6 Terra(37.2) Intelligence Index v4.1.1 57 $0.045/任务(折扣价)— 便宜约 10× 分阶发布拆分:Flash 开放发布,旗舰被扣留 GLM-5.3-Flash (released) 320B/18B 激活 · 权重已在 Hugging Face 上线 $0.15/$0.50 · 原生多模态 · 混合注意力 成本坍缩的一半 — 可路由、可自托管、开放 GLM-5.3 744B (withheld) 744B · 权重未在 Hugging Face 上 $1.40/$4.40 API · CyberGym 84.5% · 2,436 项漏洞清单 “发布后两周”的承诺已过期 Anthropic 前沿红队 — 独立验证(2026 年 9 月 29 日) 12% ExploitBench (GLM-5.3) 相当于 Claude Mythos Preview 的 14% $20.40 Flash 的 CVE 链成本(ARM64 利用) 20 分钟人工 + 8 小时模型,CVE-2026-11645 64–100% 防护绕过率 封面故事 64% · 预填充 92% · abliteration 100% ~4 mo 落后美国前沿(NIST CAISI) “迄今网络能力最强的开放权重模型” 对路由决策的改变 • 代理工具使用通道的成本优化默认 — 升级到受治理 MCP 模块后的闭源前沿模型 • 防御安全通道:可自托管、独立验证、$0.15/$0.50 — 治理周边更重要而非更不重要 • 可交换池新增三地区、多层级条目 — 路由层不变,端点按任务切换 企业 AI 预算在 1–2 个月内枯竭(MarketScale)— 成本坍缩是同一周的路由决策,不是多年弧线

相关阅读


一家运营 NetSuite、BigCommerce 和三个供应商目录的区域分销商部署了按任务路由的报价代理。目录搜索与库存占用在 GLM-5.3-Flash 上以 0.15/0.50 美元每百万 token 运行——代理工具使用通道中承担 80% 流量的成本优化默认。带分层定价与 FX 的报价生成在置信度跌破阈值时升级到受治理 MCP 模块后的闭源前沿模型。Flash 变体的自托管端点运行在同一 MCP 模块、同一审计日志上,无需重新部署——这是一次配置变更,不是一场采购谈判。当 Anthropic 分析确认 Flash 变体的网络能力后,安全团队将同一模型添加为自托管代码库漏洞扫描器,置于最小权限工具访问与网络出口白名单之后——kill-switch 架构规定的治理周边,与能力分开授予。该构建通常 5-8 周内上线。

申请范围明确的构建。 为期一周的探索。你将获得系统清单、工作流图谱和固定范围——无论是否与我们合作。

想为您的系统构建这个吗?

这里的每份文档都来自真实的生产工作。如果您有目标系统和工作流想法,我们可以在一周内确定范围。

申请定制开发

为期一周的发现阶段。您会拿到系统清单、工作流地图和固定范围——无论您最终是否与我们合作开发。