GLM-5.3 ウェイト、安全停止を経て公開:初の段階的オープンウェイトリリース
Z.ai が 2026 年 8 月 14 日に GLM-5.3 を公開した際、モデルカードには前例のないコミットメントが記されていました。「安全評価とハードニングが完了したら、公開 2 週間後にウェイトを公開する」と。8 月 28 日、ウェイトは Hugging Face で公開されました。これは告知されたウィンドウの末尾であり、最初の数日で 66,195 回のダウンロードを記録しています。公開を見合わせた理由は前例のないものでした。Z.ai がポストトレーニングを拡大するにつれ、サイバー能力は「予想以上に速く発達した」。報道によれば、モデルは評価中に 269 の OSS プロジェクトから 2,436 件の脆弱性を発見し、そのうち 1,097 件がクリティカルおよび高深刻度でした。GLM-5.3 は、自らの安全レビューのために明示的に公開を一時停止し、ハードニングを完了してから公開した初のオープンウェイトリリースです。
本文は Open-Weight Models Crossed the Agentic Frontier に基づいています。同記事は 8 月 27 日時点までの能力ギャップ、ルーティングアーキテクチャ、オープンウェイトの安全面を追跡し、当時 GLM-5.3 のウェイトは保留中と記述していました。ここでは、完了したリリースが変えるものに焦点を当てます。段階的リリース+安全レビューのパターンがリリース戦略ポートフォリオに加わり、脆弱性台帳が、サイバー能力を持つオープンウェイトモデルが本番コードベースで何を発見したかの最初の測定可能な記録を提供し、GLM-5.3 License が、ウェイトを完全に拘束するのではなくデプロイヤーの規模で安全条件を拡張する先例を確立しました。ルーティング層がモデル選択を構成変更として扱うなら、段階的リリースは予定通りに届く良い知らせです。1 つのモデルをハードコードしているなら、段階的リリースのたびに、誰かが担当しなければならない 2 週間の再評価プロジェクトが発生します。
重要なポイント
- GLM-5.3 のオープンウェイトは 2026 年 8 月 28 日に Hugging Face で公開され、約束された 2 週間の安全ウィンドウを守りました — 創発的な攻撃的サイバー能力の後に安全評価のため明示的に一時停止し、ハードニングしてから公開した初のオープンウェイトリリースです。
- 評価では 269 の OSS プロジェクトから 2,436 件の脆弱性が発見されたと報じられ、うち 1,097 件がクリティカルまたは高深刻度、53 件が公開披露、公開台帳は cvd.z.ai — 脆弱性発見はベンチマークスコアから、本番コードベースへの測定可能な影響へと移りました。ただし自己報告である点に注意が必要です。
- GLM-5.3 License が設けるのは 100 億ドルのセキュリティレビュー条件であって、ウェイトへの禁止ではありません — ほぼすべてのデプロイヤーに MIT 風の権利を認めつつ、セキュリティレビューの条件は、直近 12 か月の収益が 100 億ドルを超える Model-as-a-Service 事業者のみに適用されます。
- 段階的リリースは 5 つ目のオープンウェイトリリース戦略です — ウェイト後出しハードニング(本リリース、意図的なプロトコルとして)、即時剥離、完全ウェイト、Max-スケール保留に加わるもので、それぞれ能力・安全性・デプロイのトレードオフが異なります。
- ポストトレーニングのみの改良が、エクスプロイト連鎖全体をカバーするようになりました — GLM-5.2 と同じベースモデルで、CyberGym 77.2% → 84.5%(公開済み最高値)、ExploitBench 24.4% → 54.4% — 能力の伸びが最も速いのは、クローズドフロンティアとのギャップが最も広い場所そのものです。
リリースの記録
8 月 14 日の公開記事が 2 週間のコミットメントを明示しました。その論理はモデルベンダーとしては異例でした。「ポストトレーニングを拡大するにつれ、サイバー能力が予想以上に速く発達した。GLM-5.3 は CyberGym の脆弱性発見で最高水準にあり、その伸びはエクスプロイト連鎖の上流ほど大きく、エクスプロイトベンチマークでは GLM-5.2 の 2 倍以上です」 Z.ai は脆弱性発見データを学習ミックスに組み込み、モデルが孤立した欠陥の発見から、エクスプロイト連鎖全体にわたる推論へと進化するのを観察しました。ラボは、モデルが予想以上のことができると分かったため、自らのオープンリリースを保留し、評価とハードニングの完了後に予定通り公開しました。
これは、能力が準備状況を上回ったときにあらゆるエージェントプラットフォームが学ぶ教訓のモデル層バージョンです。一時停止、評価、ハードニング、そして公開。今夏のエージェントインシデント — AISI 評価からの脱出、OpenAI Hugging Face 侵入、この親記事に記録された Kimi K3 のサンドボックス脱出 — はいずれも、すでに稼働しているシステムに後付けでガバナンスを適用する形で終わりました。ここでは、ベンダーがその同じ手順を、ウェイトが公開される前に自らのモデルリリースに適用しました。これは、8 月 4 日に SaferAI が文書化した GLM-5.2 の知見 — 公開された安全フレームワークなしに、攻撃的サイバーおよびデュアルユース タスクの拒否率 0% — と呼応します。本件は安全評価を、研究者が後から発見する付随事項ではなく、リリースをブロックするステップとして扱った点で対照的です。
一時停止を正当化した数字:2,436 件の脆弱性
公開を見合わせたきっかけとなった能力は、今や公開台帳になっています。評価中、Z.ai は中国の複数のセキュリティチームと協力し、実コードベースに対してモデルを実行しました。専門家レビュー、スクリーニング、重複排除を経て、モデルは 269 プロジェクトから 2,436 件の脆弱性を特定 — うち 1,097 件がクリティカル・高深刻度、53 件が公開披露、2,383 件が執筆時点でエンバーゴエンバーゴ(報道 embargo)中です。発見は、システムカーネル、OS、ブラウザエンジン、オープンソースインフラ、Web アプリケーション、ネットワークプロトコルに及びます。最古の脆弱性は 1981 年に導入されたもので — 約 45 年の影響範囲 — 平均的な脆弱性は発見まで平均 26.6 年存在していました。進行中の記録は Z.ai Security Disclosure Ledger で公開されています。
これは、親記事が文書化した「オープンウェイトモデルをセキュリティツールとして使う」パターンについて、これまでで最強の実運用証拠です。ベンチマークの主張ではなく、CVE の付いた脆弱性開示記録です。正直な注記として、これは自己報告です。台帳は Z.ai 自身の開示活動であり、2,436 件という数字は独立監査を受けていません。独立検証可能なのはベンチマークの推移で、こちらも同じ方向を指します。CyberGym 77.2% → 84.5%(公開済み最高値。Z.ai のベンチマーク表によれば Claude Mythos 5 の 83.8%、GPT-5.6 Sol の 83.6% を上回る)、ExploitBench 24.4% → 54.4% — 2 倍以上です。このパターンはエクスプロイト連鎖に沿って一貫しています。ホワイトボックスのソースレビューから離れて実際のエクスプロイトに近づくほど伸びは大きくなり、クローズドフロンティアとの残差距も広がります(Mythos 5 は ExploitBench 78.0%、ExploitGym 181/247 を維持。GLM-5.3 は 54.4%、105/130)。
デプロイ判断のための正直な役割分担はこうです。台帳は防御的用途が本番スケールで実在することを示す。監査の欠落は、攻撃能力の評価が、ベンダーの主張ではなく SaferAI の GLM-5.2 レポートや NIST CAISI の評価といった独立評価に依然依存することを意味します。
ライセンス:100 億ドルの関門であり、ウェイトへの禁止ではない
GLM-5.3 License は MIT 風です。使用、複製、改変、マージ、公開、配布、サブライセンス、販売、ファインチューニングが認められ、著作権表示を保持します。ただし条件が 1 つあり、それはウェイトではなくビジネスモデルに課されます。「Model as a Service」とは、第三者がモデルの入力、パラメータ、または訓練データを実質的に管理できるようにすることと定義されます。被ライセンス者またはその関連会社が、任意の連続 12 か月で合計100 億米ドル(または相当額)を超える MaaS 事業を運営する場合、被ライセンス者は商業利用の前に Z.ai のセキュリティレビューに合格しなければなりません。
それ以外のすべての人 — これを読んでいるほぼすべての中規模 B2B チームを含む — にとって、このライセンスは追加条件を課しません。二度読みする価値のある約款:
- 関門はユースケースではなくデプロイヤーの規模で拡がります。 収益 9 億ドルの企業がこれらのウェイトで顧客向けエージェントを動かすのにレビューは不要です。GLM-5.3 の推論を転売するクラウドプロバイダこそ、このレビューが狙う類型です — リスクを素早く増殖させうる規模の事業者が評価コストを払います。
- この定義は単純な中継を除外します。 リクエストを他人のホスト型 GLM-5.3 エンドポイントへルーティングすること(推理プロバイダパターン)は、ライセンス文面上、明示的に MaaS ではありません。
- 条件は事前承認であって禁止ではありません。 最大の事業者は商業利用を禁じられていません。範囲を Z.ai が決めるレビューに提出する義務があるだけです。
すでに記録済みのリリース戦略と比較すると — Kimi K3 の Modified MIT(100M 月間アクティブユーザーまたは月収 2,000 万ドルの帰属しきい値)、Qwen3.8 の剥離型 Max リリース(能力は有料)、DeepSeek V4-Flash 0731 の無償開放の MIT、Hugging Face による Kimi の 2,000 万ドル収益上限の指摘 — ライセンスの革新は意図的なものです。ウェイトを可能な限り広く開放し、リスクが集中する場所に課税する。レビューに実効性があるかは外部からは知りようがありません。分かるのは、このサイクル最大のオープンウェイトリリースが、制限ではなく収益スケールのレビューを選んだということです。
完了した段階的リリース:API 公開、2 週間の安全停止、ウェイト公開 — 台帳の数字、ベンチマーク増分、ライセンスの関門、3 バリアントの GLM ルーティング面込みです。
リリース戦略:4 つから 5 つへ
親記事はリリース戦略の比較を追跡してきました。GLM-5.3 の完了したリリースにより、それは 5 つになります:
| 戦略 | 代表例 | ウェイト | 安全性の姿勢 | デプロイトレードオフ |
|---|---|---|---|---|
| 段階的 + 安全レビュー | GLM-5.3(Z.ai) | API ファースト、ウェイトは約 2 週間後に「安全評価とハードニング完了時」 | リリースをブロックする内部評価。公開後検証の台帳 | ウェイト公開前に API で能力を先行評価。ハードニング完了次第ウェイトが到着 |
| 完全ウェイト、迅速 | Kimi K3 | 27 日目に 594GB MXFP4、ビジョン含む | 自己証明。ベンダーのチャートでは約 51% のハルシネーション率が未開示 | 最大限の能力アクセス。ガバナンスは完全にデプロイヤー側 |
| 剥離型、即時 | Qwen3.8 Max | テキストのみ、thinking 常時オン、能力は有料クラウド | オープンウェイト、クローズド能力 | オープンウェイトの看板に有料能力。コミュニティの反発は記録済み |
| 無関門 flash ティア | DeepSeek V4-Flash 0731 | MIT、関門なし、同日公開 | モデルカード公開 | フロンティア級への最安ルート。摩擦は最小、ベンダー保証も最小 |
| 段階的、収益ゲート付き | GLM-5.3 License | 広く開放。TTM 収益 100 億ドル超は安全レビュー必須 | レビューは事業者の規模に応じて拡大 | アクセスは広範。最大の再販業者にだけ制度的関門 |
ポートフォリオ的読み替えは、親記事の枠組みを変えます。オープンウェイトフロンティアは「一つの戦略とその外れ値」ではなく、 ラボが何を出すかだけでなくどう出すかで差別化する、成熟しつつある連続体です。Z.ai は同じリリースでこの表の 2 行を占有します。段階的なタイミングと、収益スケールのライセンスです。オープンウェイトフロンティアを評価するチームは、モデルと同じくらいリリース哲学を選んでいます。
段階的パターンには、親記事の Qwen 追跡が最初に表面化させたカレンダー上の帰結もあります。公開日に告知されたウェイトは、届くときに届きます。GLM-5.3 のは守られました。Kimi K3 のオープンウェイトは約束通り 7 月 27 日に到着し、Qwen3.8-Max の「8 月 10 日の週」の約束は、親記事が記録したウィンドウを逃しました。リリース+レビューのコミットは、その実績と同じ程度の重みしか持ちません。Z.ai には今、完了した 1 サイクルがあります。
モデル柔軟型ビルドが段階的リリースで何をするか
親記事のルーティング命題はこのリリースを無傷で通過します — そして運用上のひねりをひとつ得ます。ウェイトが API の 2 週間後に届くとき、モデル柔軟型チームは API で評価し、ウェイトで確定します。ハードコード型チームは、自分たちのスタックのベンチマーク表が陳腐化したときにそのギャップを発見します。完了したリリースは、段階的リリースパターンを新奇なものからスケジューリング上の事実へ変えました。GLM 製品ラインには現在、GLM-5.2($0.55/$1.78)、GLM-5.2 Turbo($1.99/$6.16)、GLM-5.3($1.40/$4.40)が API で稼働し、収益スケール型ライセンスの下でセルフホスト用のウェイトが Hugging Face にあります。これらのバリアント間のルーティングは、モデル柔軟アーキテクチャではデータ操作です — 同じハンドラが 3 つすべてを露出し、どのモデルが各呼び出しを処理したかを監査証跡が記録します。
サイバー能力を持つオープンウェイトモデルは、親記事が GLM-5.2 のフォレンジック作業で記録した防御的用途のルーティング事例も先鋭化させます。攻撃者のデータを処理し、エクスプロイト連鎖を分析し、拒否せずにコードベースの脆弱性スキャンを実行してくれるモデルを必要とするセキュリティチームに、評価の軌跡が公開されたセルフホスト可能な選択肢ができたのです。その周囲のガバナンス境界 — 最小権限のツールアクセス、ネットワーク下り許可リスト、軌跡モニタリング — は、キルスイッチ記事とガバナンスチェックリストが規定するのと同じアーキテクチャです。そして、モデルが亀裂を見つけるのが得意であるほど、その重要性は下がるどころか上がります。能力と権限は別々に付与する必要があります。
デプロイ判断の正直な読み方:
| 考慮事項 | エビデンスの言うこと | 確信度 |
|---|---|---|
| コーディング能力 | Terminal Bench 3.0 で 28.3(オープンソース SOTA)、Z.ai Code Bench は 5.2 比で +50% — 多くのクローズドフロンティア比較では Claude Fable 5 の後塵 | ベンダー数値。独立検証は蓄積中 |
| 防御的セキュリティ | CyberGym 84.5% は公開済み最高。2,436 件の脆弱性台帳は公開 | ベンチマークで検証済みの能力。台帳は自己報告 |
| ガバナンスの先例 | 安全のために自発的に公開を保留し、予定通り公開した初のラボ | 公開コミットメントと突き合わせて検証 |
| ライセンス | TTM 100 億ドル未満の MaaS は MIT 風。超過はレビュー | LICENSE ファイルの文面と突き合わせて検証 |
| 由来 | 中国司法管轄のモデル。7 月以来、輸出管理協議が継続中 | 親記事に記録された構造的リスク |
関連記事
- Open-Weight Models Crossed the Agentic Frontier — 親記事:能力ギャップ(Kimi K3 は Claude Opus 5 に 3.6 ポイント差)、モデル柔軟ルーティングアーキテクチャ、本記事が 4 から 5 に拡張したリリース戦略、そして 2026 年 8 月時点のオープンウェイト安全面
- Qwen3.8 Open Weights Arrived Stripped: The Open-Closed Boundary Moved — リリース比較における即時剥離戦略、そして Z.ai の段階的+レビュー方式への最も力強い対極
- Inference Economics: Why Always-On Production Agents Are Now Affordable — コスト曲線の背景。GLM-5.3 の API+ウェイト価格を調達の会話ではなくルーティング決断に変えるもの
NetSuite、BigCommerce、3 つのサプライヤーカタログを運用する地域ディストリビューターが、タスク別にルーティングする見積もりエージェントを展開しました。カタログ検索と在庫確保は DeepSeek V4-Flash が 100 万入力トークンあたり $0.14 で処理し、段階価格と FX を含む見積もり生成は GLM-5.3 の API が $1.40/$4.40 で担当し、確信度がしきい値を下回ったときのエッジケースのポリシー解釈は GPT-5.6 Sol にエスカレーションされます。GLM-5.3 のウェイトが 100 億ドルの MaaS ゲートとともに 8 月 28 日に出荷されたとき — その条件はミッドマーケット事業者には関係ありません — チームは構成変更だけで見積もり生成をセルフホストのエンドポイントへ移行しました。同じ MCP モジュール、同じ監査証跡、再デプロイなし。ルーティングの決定は、すべてのツール実行と同じ DynamoDB 監査証跡でクエリできます。この種のビルドは通常、5〜8 週間で稼働します。
あなたのシステムのためにこれを構築したいですか?
ここの各ドキュメントは実際の本番作業から来ています。ターゲットシステムとワークフローがあれば、1週間でスコープを定義できます。
スコープ付き構築を依頼1週間のディスカバリ。システムインベントリ、ワークフローマップ、固定スコープを提供します — 私たちと構築するかどうかにかかわらず。