返回資料庫
策略

GLM-5.3-Flash:以旗艦價格十分之一逼近 Claude Opus 4.8 的 320B 開放權重模型

最後更新:2026年10月6日

核心要點

  • GLM-5.3-Flash 是 320B 總參數/18B 啟用的原生多模態 MoE,定價 0.15/0.50 美元每百萬 token——僅為 GLM-5.3 的 1.40/4.40 的十分之一——Intelligence Index 57,每任務 0.045 美元(折扣價)——按 Z.ai 自己的基準表述,這一智能水平此前僅在約 10 倍的成本下才可獲得(Z.AI blog)。
  • 在 Terminal Bench 2.1 上 Flash 變體得 84.3 分,與 Claude Opus 4.8 相差不到 1 分;在 AutomationBench 上得 48.8 分——超過 Claude Opus 4.8 的 41.0 與 GPT-5.6 Terra 的 37.2——廉價變體在衡量真實工作流程自動化的代理基準上超越了預期(Z.AI blog)。
  • Anthropic 前沿紅隊確認 GLM-5.3-Flash 獨立串聯兩個 CVE(含 CVE-2026-11645)建構出可靠的 ARM64 利用鏈,耗時 20 分鐘人工加 8 小時模型運行,按 Zhipu API 價格計成本 20.40 美元——防禦用途與擴散風險皆真實且經獨立驗證(Anthropic research)。
  • 744B 的 GLM-5.3 旗艦權重仍未開放——「發布後兩週」的承諾已過期,而 GLM-5.3-Flash 權重已在 Hugging Face 上線——父文記錄的分階發布如今成為拆分發布:Flash 變體開放,旗艦未開放(Hugging Face)。
  • NIST CAISI 稱 GLM-5.3 為「迄今網路能力最強的開放權重模型」,落後美國前沿約 4 個月——前沿閉源與開放權重之間的網路能力差距如今已被測量,而非估算(NIST CAISI)。

本文承接 GLM-5.3:權重經安全暫停後發布——首個分階開放權重發布,該文記錄了 744B 旗艦的兩週安全暫停、2,436 項漏洞揭露清單以及按營收分級的授權。這裡的焦點是 Flash 變體改變了什麼:成本坍縮論題獲得其最強的單點數據,分階發布拆分為已開放的 Flash 與被扣留的旗艦,而 Anthropic 的分析將網路能力主張從廠商自述轉為實驗室獨立驗證——包括一段成本 20.40 美元的 Flash 專屬利用鏈。

成本坍縮數據點

《Z.AI 部落格》對這次發布毫不掩飾:「320B 總參數、僅 18B 啟用參數,以十分之一的價格在基準與真實工作負載上超越 GLM-5.2,並在程式與代理類基準上逼近 Claude Opus 4.8。」架構是全新的——不是 GLM-5.2 的後訓練版本,而是在 30T token 多模態語料上全新訓練的基座,是 GLM-5 系列首個原生多模態模型。它引入混合 sparse+linear 注意力架構(GLM 系首次)、流形約束超連接(mHC)以及用於 1M 上下文的 IndexPool。與 GLM-5.3 相比,Flash 變體使用少 3.0 倍的注意力計算與小 4.4 倍的 KV 快取。它在大規模服務中運行於中國 AI 晶片上,配備 SGLang 上的專用推論引擎,實現端到端服務效能 3 倍提升,堪比主流 NVIDIA GPU。

定價是改變路由決策的部分。以 0.15/0.50 美元每百萬 token(輸入/輸出),Flash 變體是 GLM-5.3 的 1.40/4.40 的十分之一。在 Artificial Analysis Intelligence Index v4.1.1 上它得 57 分,每任務 0.045 美元(折扣價)——Z.ai 指出這一智能水平此前只在約 10 倍成本下才可獲得。LLM Gateway 將 GLM 5.3 Fast 列為 2026 年 10 月 7 日發布的最新模型。

對代理類負載真正要緊的基準是 AutomationBench,它衡量真實工作流程自動化。GLM-5.3-Flash 得 48.8 分——超過 Claude Opus 4.8 的 41.0 與 GPT-5.6 Terra 的 37.2。在 Terminal Bench 2.1 得 84.3 分,與 Claude Opus 4.8 相差不到 1 分。在 DeepSWE v1.1 得 63.4 分,而 GLM-5.2 為 46.2。模式很清晰:廉價變體不只是在狹窄的程式基準上逼近前沿——它在這個衡量生產代理真實運作的多步工具使用迴圈的基準上超越了前沿。

對按任務路由的團隊,這是一個配置決策。對硬編碼單一模型的團隊,這是一次需要專門人力的重新評估。DeepSeek V4.1-Flash 一文——連續 11 個 AI 搜尋會話位列引用 #3——記錄了靜默模型替換風險:供應商可以不問就換掉模型。GLM-5.3-Flash 是反向數據點:一個超越預期的廉價變體,以開放權重形式提供,且由你自己擁有的層來路由。

分階發布拆分

父文記錄了一個已完成的分階發布:8 月 14 日 API 上線、兩週安全暫停、8 月 28 日 744B 權重上線 Hugging Face。Flash 變體使這一圖景複雜化。GLM-5.3-Flash 權重已在 Hugging Face 提供;744B 的 GLM-5.3 權重沒有——Z.ai 的 Hugging Face 組織下沒有 GLM-5.3 儲存庫。「發布後兩週」的承諾已過期,旗艦權重仍被扣留。

拆分發布具有治理解讀。Flash 變體是已開放權重的一半:320B、18B 啟用、0.15/0.50 美元、原生多模態,按父文記錄的同一按營收分級授權開放自行託管。旗艦是被扣留的一半:744B、完整的 CyberGym 84.5% 漏洞發現能力、2,436 項漏洞清單——正是那個因攻擊性能力觸發安全暫停的模型。Z.ai 公開了 Flash 變體並扣留旗艦。744B 權重是否會發布如今是一個懸而未決的問題,而不是排定的事件。

對模型靈活的建置,拆分是可管理的:將 80% 成本敏感的任務路由到 Flash 變體(自行託管或 API),將 20% 能力關鍵任務升級到閉源前沿模型或 GLM-5.3 API。路由層是同一個處理程序,只有端點變化。對硬編碼建置,拆分提醒人們:「模型」如今是一條產品線,不是單一製品——你測試過的變體未必是你最終執行的變體。

網路能力分析:獨立驗證

父文的漏洞清單是自述——Z.ai 自己的揭露努力,2,436 項發現未經獨立稽核。Anthropic 前沿紅隊分析於 2026 年 9 月 29 日發布,將能力主張從廠商自述轉為實驗室獨立驗證。

在 ExploitBench(Chrome V8)上,GLM-5.3 在 410 次嘗試中完成 50 次端到端 exploit 開發(12%),相當於 Claude Mythos Preview 的 14%。在 Anthropic 內部二進位利用基準上,GLM-5.3 達到 4% 完全控制流劫持;更早的模型(Claude Opus 4.6、GLM-5.2)得分為 0%。在研究者主導的測試中,GLM-5.3 在一款流行瀏覽器的 JavaScript 引擎中發現了此前未知的漏洞,並將它們串聯成一個可讀取來訪者電腦任意檔案的可用 exploit——一天內、有限人工參與下完成。

Flash 專屬的發現是改變成本坍縮解讀的那一個。Anthropic 研究者使用 GLM-5.3-Flash 為一個已知漏洞(CVE-2026-11645,最近披露的 Chrome 缺陷)開發 exploit。在無顯著引導的情況下,Flash 變體串聯兩個缺陷的 exploit,為 ARM64 目標建構出可靠的利用鏈,繞過了指標驗證(pointer authentication, PAC)加固。這耗時 20 分鐘人工加 8 小時模型運行。按 Zhipu API 價格計,這一努力本會花費 20.40 美元。廉價變體不只對良性負載廉價——對攻擊性安全工作同樣廉價,而且是開放權重。

防護可被繞過。Anthropic 發現 GLM-5.3 的防護以虛假掩護故事被繞過 64%、以預填推理繞過 92%、在 abliterated 版本上為 100%(數天內即有多個 abliterated 版本公開發布)。這些技術在測試中對帶防護的 Claude 模型全部無效。NIST CAISI 的 9 月 17 日評估稱 GLM-5.3 為「迄今網路能力最強的開放權重模型」,在網路基準聚合上落後美國前沿約四個月。

治理解讀是父文的 kill-switch 與治理清單交叉連結已為讀者準備好的那條:能力與授權需分開授予。一個防護可繞過、能力接近前沿的開放權重模型,在受治理 MCP 模組、最小權限工具存取、網路出口白名單與軌跡監控之後執行時是防禦工具——治理清單所規定的架構。沒有該周邊就執行,同一模型即擴散風險。0.15/0.50 美元的 Flash 變體讓兩種用途都更便宜。

對路由決策的改變

推論經濟學一文所記錄的成本坍縮論題如今獲得其最強數據點。一個在 Terminal Bench 上與 Claude Opus 4.8 相差不到 1 分、在 AutomationBench 上超越它、價格僅為 Z.ai 自己旗艦十分之一——且以開放權重提供。趨勢週期揭示的企業 AI 預算耗竭(2026 年基礎設施支出成長 62.5% 至 8,220 億美元,僅 6% 的採用者捕獲可量化的全企業利潤,據 AI Business Weekly;美國大型企業預算在 1–2 個月內枯竭,據 MarketScale)是需求驅動。成本坍縮不再是多年弧線——它是同一週的路由決策。

模型靈活的建置將 Flash 變體讀作開放權重前沿一文所追蹤的可交換池的新增條目。該池如今橫跨三個地區(美國:Reflection Beam;歐洲:Mistral ML4、Aleph Alpha Kolibri-1;中國:DeepSeek、Qwen、GLM)與多個能力層級。已橫跨開放與閉源模型的路由層可將 Flash 變體加為代理工具使用通道的成本最佳化預設,當信心下滑時升級到受治理 MCP 模組之後的閉源前沿模型。稽核日誌記錄每次呼叫由哪個模型服務。TypeSafe Jev 決策層一文記錄了使升級策略顯式化的校準契約:決策 >0.95 自動裁定,<0.50 轉人工,中間帶附機率排隊複審。

Flash 變體的防禦安全通道是父文 CyberGym 84.5% 數據點開啟、Anthropic 分析現已獨立確認的那條。需要願意處理攻擊者資料、分析利用鏈、掃描程式碼庫漏洞而不拒絕的安全團隊,如今有一個可自行託管、獨立驗證、0.15/0.50 美元的選項。圍繞它的治理周邊——最小權限工具存取、網路出口白名單、軌跡監控——與 kill-switch 一文規定的是同一架構;當模型擅長尋找裂縫時,這一周邊更重要,而非更不重要。

GLM-5.3-Flash:以 Flash 成本獲得前沿智能 320B/18B 啟用的開放權重 MoE — Terminal Bench 上與 Claude Opus 4.8 相差不到 1 分,價格僅為旗艦的十分之一 價格(每百萬 token) $0.15 / $0.50 僅為 GLM-5.3 的 $1.40/$4.40 的十分之一 Terminal Bench 2.1 84.3 Claude Opus 4.8:約 85(相差不到 1 分) AutomationBench 48.8 超過 Claude Opus 4.8(41.0)與 GPT-5.6 Terra(37.2) Intelligence Index v4.1.1 57 $0.045/任務(折扣價)— 便宜約 10× 分階發布拆分:Flash 開放發布,旗艦被扣留 GLM-5.3-Flash (released) 320B/18B 啟用 · 權重已在 Hugging Face 上線 $0.15/$0.50 · 原生多模態 · 混合注意力 成本坍縮的一半 — 可路由、可自行託管、開放 GLM-5.3 744B (withheld) 744B · 權重未在 Hugging Face 上 $1.40/$4.40 API · CyberGym 84.5% · 2,436 項漏洞清單 “發布後兩週”的承諾已過期 Anthropic 前沿紅隊 — 獨立驗證(2026 年 9 月 29 日) 12% ExploitBench (GLM-5.3) 相當於 Claude Mythos Preview 的 14% $20.40 Flash 的 CVE 鏈成本(ARM64 利用) 20 分鐘人工 + 8 小時模型,CVE-2026-11645 64–100% 防護繞過率 掩護故事 64% · 預填 92% · abliteration 100% ~4 mo 落後美國前沿(NIST CAISI) “迄今網路能力最強的開放權重模型” 對路由決策的改變 • 代理工具使用通道的成本最佳化預設 — 升級到受治理 MCP 模組後的閉源前沿模型 • 防禦安全通道:可自行託管、獨立驗證、$0.15/$0.50 — 治理周邊更重要而非更不重要 • 可交換池新增三地區、多層級條目 — 路由層不變,端點按任務切換 企業 AI 預算在 1–2 個月內枯竭(MarketScale)— 成本坍縮是同一週的路由決策,不是多年弧線

相關閱讀


一家營運 NetSuite、BigCommerce 和三個供應商目錄的區域經銷商部署了按任務路由的報價代理。目錄搜尋與庫存佔用在 GLM-5.3-Flash 上以 0.15/0.50 美元每百萬 token 執行——代理工具使用通道中承擔 80% 流量的成本最佳化預設。帶分層定價與 FX 的報價產生在信心跌破閾值時升級到受治理 MCP 模組後的閉源前沿模型。Flash 變體的自行託管端點執行在同一 MCP 模組、同一稽核日誌上,無需重新部署——這是一次配置變更,不是一場採購談判。當 Anthropic 分析確認 Flash 變體的網路能力後,安全團隊將同一模型新增為自行託管程式碼庫漏洞掃描器,置於最小權限工具存取與網路出口白名單之後——kill-switch 架構規定的治理周邊,與能力分開授予。該建置通常 5-8 週內上線。

申請範圍明確的建置。 為期一週的探索。你將獲得系統清單、工作流程圖譜和固定範圍——無論是否與我們合作。

想為您的系統建構這個嗎?

這裡的每份文件都來自真實的生產工作。如果您有目標系統和工作流程想法,我們可以在一週內確定範圍。

申請客製開發

為期一週的發掘階段。您會拿到系統清單、工作流程地圖和固定範圍——無論您最終是否與我們合作開發。