GLM-5.3 權重在安全暫停後發布:首個分階段開放權重發布
當 Z.ai 於 2026 年 8 月 14 日發布 GLM-5.3 時,模型卡上帶有一項不尋常的承諾:「我們將在發布兩週後發布權重,屆時安全評估與加固將已完成。」 8 月 28 日,權重在 Hugging Face 上線——正好在該窗口的尾聲,最初幾天內獲得 66,195 次下載。此次暫扣的原因是新穎的。隨著 Z.ai 擴大後訓練規模,網路能力「發展得比我們預期的更快」,據報導該模型在評估期間發現了 269 個開源專案中的 2,436 個漏洞,其中包括 1,097 個嚴重和高嚴重性發現。GLM-5.3 是首個因自身安全審查而明確暫停、隨後完成加固並發布的開放權重發布。
本文基於 Open-Weight Models Crossed the Agentic Frontier,該文追蹤了截至 8 月 27 日的能力差距、路由架構和開放權重安全面——當時 GLM-5.3 的權重被描述為待發布。這裡聚焦的是已完成發布所改變的內容:分階段發布加安全審查模式加入了發布策略組合,漏洞帳本提供了可衡量記錄,展示具備網路能力的開放權重模型在生產程式碼庫中發現了什麼,而 GLM-5.3 License 則為按部署方規模而非完全鎖定權重來擴展安全條件樹立了先例。如果你的路由層將模型選擇視為組態變更,分階段發布是按計畫交付的好消息。如果你的管道硬編碼了單一模型,每次分階段發布都是一個需要有人投入的為期兩週的重新評估專案。
關鍵要點
- GLM-5.3 開放權重於 2026 年 8 月 28 日在 Hugging Face 發布,守住了承諾的兩週安全視窗——首個在突現攻擊性網路能力之後為安全評估明確暫停、隨後加固並發布的開放權重發布。
- 據報導,評估發現了 269 個開源專案中的 2,436 個漏洞,其中 1,097 個為嚴重或高嚴重性,53 個已公開揭露,公開帳本位於 cvd.z.ai——漏洞發現從基準測試分數轉變為對生產程式碼庫的可衡量影響,附帶自我報告的免責說明。
- GLM-5.3 License 設置的是 100 億美元的安全審查門檻,而非針對權重本身——對幾乎所有部署方保留 MIT 風格權限,安全審查條件僅適用於過去 12 個月收入超過 100 億美元的模型即服務營運商。
- 分階段發布是第五種開放權重發布策略——加入權重後置加固(本次發布,作為刻意協議)、立即剝離、完整權重和 Max 規模待發布,各自在能力、安全性和部署上有不同的權衡。
- 僅靠後訓練的增益現在覆蓋了整個利用鏈——與 GLM-5.2 同一基礎模型,CyberGym 從 77.2% 升至 84.5%(已發布的最佳結果),ExploitBench 從 24.4% 升至 54.4%——能力成長最快之處恰是與閉源前沿差距最寬之處。
發布實錄
8 月 14 日的發布文章明確設定了兩週承諾。其推理在模型供應商中不尋常:「隨著我們擴大後訓練規模,網路能力發展得比我們預期的更快。GLM-5.3 在 CyberGym 漏洞發現上達到最先進水準,其增益在利用鏈更上游最大,在利用基準上達到 GLM-5.2 的兩倍以上。」 Z.ai 將漏洞發現數據引入訓練組合,並觀察到模型從發現孤立缺陷發展到跨完整利用鏈進行推理。該實驗室暫扣了自己的開放發布,因為模型能做到超出預期的事情——並在評估和加固完成後按計畫發布。
這是模型層面的版本,印證了每個智慧代理平台在能力超出準備度時都會吸取的教訓:暫停、評估、加固,然後發布。今年夏天的智慧代理事件——AISI 評估逃逸、OpenAI Hugging Face 入侵、母文章記錄的 Kimi K3 沙箱逃逸——都以團隊對已在運行的系統追溯式加裝治理而告終。在這裡,一家供應商在權重公開之前,對自身的模型發布應用了同樣的序列。這與 SaferAI 於 8 月 4 日記錄的 GLM-5.2 發現相呼應——對攻擊性網路和雙用途任務的拒絕率為 0%,且未發布安全框架——本例將安全評估視為發布阻斷步驟,而非研究人員事後才發現的附加事項。
證明暫停合理性的數字:2,436 個漏洞
觸發暫扣的能力現在是一份公開帳本。在評估期間,Z.ai 與中國的多個安全團隊合作,讓模型針對真實程式碼庫運行;經過專家審查、篩選和去重後,該模型發現了 269 個項目中的 2,436 個漏洞——其中 1,097 個為嚴重和高嚴重性,53 個已公開揭露,截至撰寫時 2,383 個處於禁運狀態。發現涵蓋系統核心、作業系統、瀏覽器引擎、開源基礎設施、Web 應用和網路協議。最古老的漏洞引入於 1981 年——大約 45 年的影響歷史——平均每個漏洞在被發現前存在了 26.6 年。運行記錄在 Z.ai Security Disclosure Ledger 上公開。
這是母文章所記錄的開放權重模型作為安全工具模式迄今最強的生產證據:不是基準測試主張,而是附帶 CVE 的漏洞揭露記錄。誠實的標記是它是自我報告的——帳本是 Z.ai 自己的揭露工作,2,436 個數字尚未經過獨立審計。可以獨立驗證的是基準軌跡,它指向同一方向:CyberGym 從 77.2% 升至 84.5%(已發布的最佳結果,領先於 Claude Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%,依據 Z.ai 基準表),ExploitBench 從 24.4% 升至 54.4%——翻了一倍多。這一模式沿利用鏈方向一致:離白盒原始碼審查越遠、越接近真實利用,增益越大,與閉源前沿的剩餘差距也越寬(Mythos 5 在 ExploitBench 上保持 78.0%、ExploitGym 181/247,對比 GLM-5.3 的 54.4% 和 105/130)。
對於部署決策,誠實的分工是:帳本表明防禦性用途在生產規模上是真實的;審計缺口意味著攻擊能力評估仍依賴獨立評估,如 SaferAI 的 GLM-5.2 報告和 NIST CAISI 的評估,而非僅靠供應商聲稱。
授權條款:100 億美元門檻,而非鎖定權重
GLM-5.3 License 是 MIT 風格的——使用、複製、修改、合併、發布、分發、再授權、銷售和微調,保留版權聲明——但帶有一個條件,且條件針對的是商業模式,而非權重。「模型即服務」定義為讓第三方對模型輸入、參數或訓練數據擁有實質控制權。如果被授權方或其關聯公司在任何連續 12 個月內營運 MaaS 業務的合計收入超過100 億美元(或等值),被授權方必須先通過 Z.ai 的安全審查才能進行任何商業使用。
對於其他所有人——包括幾乎所有閱讀本文的中端市場 B2B 團隊——該授權條款不施加額外條件。值得讀兩遍的細則:
- 門檻按部署方規模而非用例擴展。 一家收入 9 億美元、使用這些權重運行面向客戶智慧代理的公司無需審查。將 GLM-5.3 推理轉售的雲端提供商正是該審查所針對的類型——具備快速傳播風險之規模的營運商承擔評估成本。
- 該定義排除了純轉發。 將請求路由到他人託管的 GLM-5.3 端點(推理提供商模式)在授權條款文本中明確不屬於 MaaS。
- 該條件是預先核准,而非禁止。 最大的營運商並未被禁止商業使用;他們必須接受其範圍由 Z.ai 決定的審查。
與已記錄的發布策略相比——Kimi K3 的 Modified MIT(帶 100M 月活或 2000 萬美元月收入的署名門檻)、Qwen3.8 剝離式 Max 發布(能力付費)、DeepSeek V4-Flash 0731 的無門檻 MIT、Hugging Face 對 Kimi 2000 萬美元收入上限的發現——授權條款的創新是刻意的:讓權重對盡可能廣泛的群體開放,在風險集中之處徵稅。該審查是否有實效從外部無法得知;可以知道的是,本週期最大的開放權重發布選擇了按收入分級的審查而非限制。
完成的分階段發布:API 上線、兩週安全暫停、權重發布——附帶帳本數字、基準增量、授權門檻和三變體 GLM 路由面。
發布策略:從四種到五種
母文章追蹤了不斷擴展的發布策略對比。GLM-5.3 的完成發布使其達到五種:
| 策略 | 代表 | 權重 | 安全姿態 | 部署權衡 |
|---|---|---|---|---|
| 分階段 + 安全審查 | GLM-5.3(Z.ai) | API 先行,權重約 2 週後「待安全評估與加固完成」 | 阻斷發布的內部評估;先公開後核驗的帳本 | 權重發布前可透過 API 預覽能力;加固完成權重即落地 |
| 完整權重,快速 | Kimi K3 | 第 27 天 594GB MXFP4,含視覺 | 自我聲明;供應商圖表未披露約 51% 的幻覺率 | 最大能力存取;治理完全由部署方承擔 |
| 剝離式,立即 | Qwen3.8 Max | 僅文字,thinking 常開,能力付費雲端 | 開放權重,封閉能力 | 開放權重標籤配付費能力;社群反彈已有記錄 |
| 無門檻 flash 檔 | DeepSeek V4-Flash 0731 | MIT,無門檻,當日 | 已發布模型卡 | 最便宜的前沿級路徑;摩擦最小,供應商保障最小 |
| 分階段,收入設門檻 | GLM-5.3 License | 大幅開放;超過 100 億美元 TTM 收入需安全審查 | 審查隨營運商規模擴展 | 存取廣泛;僅對最大經銷商設機構門檻 |
組合式解讀改變了母文章的框架:開放權重前沿不是一種策略加若干例外——它是一條不斷成熟的連續譜,實驗室在如何發布上形成差異化,而不僅在發布什麼上。Z.ai 憑同一次發布佔據了該表的兩行:分階段時間表加按收入分級的授權。評估開放權重前沿的團隊,既是在選模型,也是在選一種發布哲學。
分階段模式還有一個日曆效應,母文章的 Qwen 追蹤首先揭示了這一點:發布日宣布的權重,到貨時間以實際到貨為準。GLM-5.3 兌現了承諾——Kimi K3 的開放權重如約於 7 月 27 日上線,而 Qwen3.8-Max「8 月 10 日當週」的承諾則滑出了母文章記錄的視窗。發布加審查的承諾只有與過往記錄相稱才有意義;Z.ai 現在擁有一個完成的週期。
模型靈活型建置如何應對分階段發布
母文章的路由論點在這次發布後完好無損——並增加了一個營運細節。當權重在 API 之後兩週落地時,模型靈活型團隊在 API 上評估、在權重上承諾;硬編碼團隊則在自己的技術棧基準表過時後才發現差距。完成的發布將分階段發布模式從新奇事物變成了排期事實:GLM 產品線現在有 GLM-5.2($0.55/$1.78)、GLM-5.2 Turbo($1.99/$6.16)和 GLM-5.3($1.40/$4.40)在 API 上運行,權重在 Hugging Face 上可供按收入分級授權自行託管。在這些變體之間路由是模型靈活架構中的一次資料操作——同一 handler 暴露全部三者,審計追蹤記錄每次呼叫由哪個模型服務。
具備網路能力的開放權重模型也強化了母文章以 GLM-5.2 取證工作所記錄的防禦性用途路由案例:需要模型願意處理攻擊者資料、分析利用鏈、執行程式碼庫漏洞掃描而不拒絕的安全團隊,現在有了一個可自託管且評估軌跡公開的選項。圍繞它的治理邊界——最小權限工具存取、網路出站白名單、軌跡監控——正是斷路器文章和治理清單所定義的同一種架構,而且當模型善於發現裂縫時它更加重要:能力與授權必須分開授予。
對部署決策的誠實解讀:
| 考量 | 證據表明 | 信心水準 |
|---|---|---|
| 編碼能力 | Terminal Bench 3.0 達 28.3(開源 SOTA),Z.ai Code Bench 較 5.2 提升 50% — 在多數閉源前沿對比中落後於 Claude Fable 5 | 供應商數字;獨立驗證逐步累積 |
| 防禦性安全 | CyberGym 84.5% 已發布最佳;2,436 漏洞帳本公開 | 基準驗證的能力;帳本自我報告 |
| 治理先例 | 首個實驗室為安全主動暫扣發布、並按計畫發布 | 對照發布承諾核驗 |
| 授權條款 | 對 100 億美元以下的 MaaS 為 MIT 風格;超過則需審查 | 對照 LICENSE 檔案文本核驗 |
| 來源 | 中國司法轄區模型;7 月起出口管制諮詢進行中 | 母文章記錄的結構性風險 |
相關閱讀
- Open-Weight Models Crossed the Agentic Frontier — 母文章:能力差距(Kimi K3 距 Claude Opus 5 僅 3.6 分)、模型靈活路由架構、本文由四擴展到五的發布策略,以及截至 2026 年 8 月的開放權重安全面
- Qwen3.8 Open Weights Arrived Stripped: The Open-Closed Boundary Moved — 發布對比中的立即剝離策略,以及 Z.ai 分階段加審查方式最有力的反面參照
- Inference Economics: Why Always-On Production Agents Are Now Affordable — 成本曲線背景,它把 GLM-5.3 的 API 加權重定價變成路由決策而非採購對話
一家營運 NetSuite、BigCommerce 和三個供應商目錄的區域分銷商部署了一個按任務路由的報價智慧代理:目錄搜尋和可用性保留由 DeepSeek V4-Flash 以每百萬輸入 token 0.14 美元處理,含階梯定價和匯率的報價生成由 GLM-5.3 API 以 $1.40/$4.40 承擔,而信心低於門檻時,邊緣政策解讀升級至 GPT-5.6 Sol。當 GLM-5.3 權重於 8 月 28 日連同 100 億美元 MaaS 門檻發布時——該條件並不觸及中端市場營運商——團隊透過一次組態變更將報價生成遷移到自託管端點:同樣的 MCP 模組、同樣的審計追蹤,無需重新部署。路由決策與每次工具執行一樣,可在同一個 DynamoDB 審計追蹤中查詢。此類建置通常在 5-8 週內上線。
想為您的系統建構這個嗎?
這裡的每份文件都來自真實的生產工作。如果您有目標系統和工作流程想法,我們可以在一週內確定範圍。
申請客製開發為期一週的發掘階段。您會拿到系統清單、工作流程地圖和固定範圍——無論您最終是否與我們合作開發。