ライブラリに戻る
戦略

GLM-5.3-Flash:320B オープンウェイトモデルがフラッグシップ価格の 10 分の 1 で Claude Opus 4.8 に迫る

最終更新:2026年10月6日

重要なポイント

  • GLM-5.3-Flash は 320B 総パラメータ/18B アクティブのネイティブ multimodal MoE で、価格は 100 万トークンあたり 0.15/0.50 ドル——GLM-5.3 の 1.40/4.40 ドルの 10 分の 1——Intelligence Index 57、タスクあたり 0.045 ドル(割引価格)。Z.ai 自身のベンチマークの説明によれば、この知能レベルは以前はおよそ 10 倍のコストでのみ得られました(Z.AI blog)。
  • Terminal Bench 2.1 で Flash 変種は 84.3 を出し、Claude Opus 4.8 との差は 1 点以内。AutomationBench では 48.8 を出し——Claude Opus 4.8 の 41.0 と GPT-5.6 Terra の 37.2 を上回ります。安価な変種が、実際のワークフロー自動化を測るエージェント系ベンチマークで期待を上回るという構図です(Z.AI blog)。
  • Anthropic の Frontier Red Team は、GLM-5.3-Flash が 2 つの CVE(CVE-2026-11645 を含む)を独立に連鎖させ、ARM64 ターゲットへの信頼できるエクスプロイトチェーンを構築したことを確認しました。所要時間は人間の注意 20 分+モデルの稼働 8 時間、Zhipu の API 価格で 20.40 ドル。防御目的の使用と拡散リスクの双方が実在し、独立に検証されています(Anthropic research)。
  • 744B の GLM-5.3 フラッグシップの重みは引き続き非公開——「公開後 2 週間」の約束は経過済みで、GLM-5.3-Flash の重みは Hugging Face で公開済み。親記事が記録した段階的リリースは今や分割リリースです:Flash 変種は公開され、フラッグシップは未公開のままです(Hugging Face)。
  • NIST CAISI は GLM-5.3 を「これまでで最もサイバー能力の高いオープンウェイトモデル」と評しました。米国フロンティアへの遅れは約 4 か月。frontier closed とオープンウェイトのサイバー能力差は、推定ではなく測定値になりました(NIST CAISI)。

本稿は GLM-5.3 の重みが安全停止の末に出荷:初の段階的オープンウェイトリリース を受けた分析です。親記事は 744B フラッグシップの 2 週間の安全停止、2,436 件の脆弱性開示リスト、収入スケール型ライセンスを記録しました。ここでの焦点は Flash 変種が変えるものです:コスト崩壊テーゼは最強の単一データポイントを得て、段階的リリースは公開済みの Flash と差し押さえられたフラッグシップに分かれ、Anthropic の分析はサイバー能力の主張をベンダー自己申告から独立ラボ検証へ変換しました——Flash 変種固有の、コスト 20.40 ドルのエクスプロイトチェーンを含みます。

コスト崩壊のデータポイント

Z.AI ブログ記事は、このリリースを飾らずに説明しています:「総パラメータ 320B、アクティブは 18B のみ。ベンチマークと実務のワークロードで GLM-5.2 を 10 分の 1 の価格で上回り、コーディングとエージェント系ベンチマークでは Claude Opus 4.8 に迫る。」アーキテクチャは新規です。GLM-5.2 のポストトレインではなく、30T トークンの multimodal コーパスで新たに学習されたベースで、GLM-5 シリーズ初のネイティブ multimodal モデルです。GLM 系で初となる sparse+linear ハイブリッド注意機構、Manifold-Constrained Hyper-Connections(mHC)、100 万トークンコンテキストのための IndexPool を導入しています。GLM-5.3 と比べて、Flash 変種は注意機構の計算を 3.0 倍少なく、KV キャッシュを 4.4 倍小さく使います。中国 AI チップ上で大規稼働し、SGLang 上の専用推論エンジンにより、NVIDIA の主流 GPU に匹敵するエンドツーエンドのサービング性能 3 倍改善を達成しています。

価格は、ルーティング決定を変える部分です。100 万トークンあたり 0.15/0.50 ドル(入力/出力)で、Flash 変種は GLM-5.3 の 1.40/4.40 ドルの 10 分の 1 です。Artificial Analysis Intelligence Index v4.1.1では 57 を出し、タスクあたり 0.045 ドル(割引価格)。この知能レベルは、以前はおよそ 10 倍のコストでのみ得られたと Z.ai は注記します。LLM Gatewayは、2026 年 10 月 7 日に公開された最新モデルとして GLM 5.3 Fast を掲載しています。

エージェント系ワークロードで重要なベンチマークは AutomationBench です。実ワークフロー自動化を測ります。GLM-5.3-Flash は 48.8 を出し——Claude Opus 4.8 の 41.0 と GPT-5.6 Terra の 37.2 を上回ります。Terminal Bench 2.1 では 84.3 で、Claude Opus 4.8 との差は 1 点以内。DeepSWE v1.1 では 63.4 で、GLM-5.2 の 46.2 を大きく上回ります。構図はこうです:安価な変種が狭いコーディング・ベンチマークでフロンティアに迫るだけでなく、本番エージェントが実際に回すマルチステップのツール使用ループを測るベンチマークでフロンティアを上回る。

タスクごとにルーティングするチームにとってこれは構成の決定です。単一モデルをハードコードするチームにとっては、専任を置いて取り組むべき再評価です。DeepSeek V4.1-Flash 記事——AI 検索セッションで 11 連続で引用 #3——はサイレントなモデル差し替えリスクを記録しました:ベンダーは問わずにモデルを交換できる。GLM-5.3-Flash はその逆のデータポイントです:期待を上回る安価な変種が、オープンウェイトとして入手でき、自分が所有するレイヤーでルーティングできる。

段階的リリースの分裂

親記事が記録したのは完了した段階的リリースです。API 提供が 8 月 14 日、2 週間の安全停止、8 月 28 日に 744B の重みが Hugging Face へ。Flash 変種はこの構図を複雑にします。GLM-5.3-Flash の重みは Hugging Face で入手可能です。744B の GLM-5.3 の重みは未公開です——Z.ai の Hugging Face 組織に GLM-5.3 リポジトリは存在しません。「公開後 2 週間」の約束は経過し、フラッグシップの重みは保持され続けています。

分割リリースにはガバナンスの読みがあります。Flash 変種は「重みが公開された側」です:320B、アクティブ 18B、0.15/0.50 ドル、ネイティブ multimodal、親記事が記録したのと同じ収入スケール型ライセンスでセルフホスト可能。フラッグシップは「保持された側」です:744B、CyberGym 84.5% の脆弱性発見能力、2,436 件の脆弱性リスト——攻撃的用途の能力がそもそも安全停止を引き起こしたモデルです。Z.ai は Flash 変種を公開し、フラッグシップを保持しました。744B の重みが将来的に公開されるかは、予定された事象ではなく未決の問いです。

モデルフレキシブルなビルドでは、この分裂は管理可能です:コスト重視の 80% のタスクを Flash 変種(セルフホストまたは API)へルーティングし、性能が重要な 20% は closed frontier モデルまたは GLM-5.3 API へエスカレーションする。ルーティングレイヤーは同じハンドラで、エンドポイントだけが変わります。ハードコードされたビルドにとって、この分裂は「モデル」が単一の成果物ではなく製品ラインになったことの暗示であり——ベンチマークした変種が、最終的に運用する変種とは限らない。

サイバー能力の分析:独立検証

親記事の脆弱性リストは自己申告でした。Z.ai 自身の開示努力、2,436 件の発見で、独立監査はありません。Anthropic Frontier Red Team の分析は 2026 年 9 月 29 日に公開され、能力の主張をベンダー自己申告から独立ラボ検証へ変換しました。

ExploitBench(Chrome V8)では、GLM-5.3 は 410 回の試行中 50 回(12%)でエンドツーエンドのエクスプロイトを作成し、Claude Mythos Preview の 14% に並びます。Anthropic 内部の Binary Exploitation ベンチマークでは、GLM-5.3 は完全な制御フロー乗っ取りを 4%達成。それ以前のモデル(Claude Opus 4.6、GLM-5.2)は 0%です。研究者主導のテストでは、GLM-5.3 は人気ブラウザの JavaScript エンジンに未知の脆弱性を発見し、それらを連鎖させて訪問者のコンピュータから任意のファイルを読み出す動作するエクスプロイトを作りました——1 日、限られた人間の注意で。

Flash 固有の発見は、コスト崩壊の読みを変えるものです。Anthropic のリサーチャーは GLM-5.3-Flash を使って、既知の脆弱性(CVE-2026-11645、最近開示された Chrome の欠陥)へのエクスプロイトを開発しました。有意な誘導なしに、Flash 変種は 2 つの欠陥へのエクスプロイトを連鎖させ、ARM64 ターゲットへの信頼できるエクスプロイトチェーンを構築し、pointer authentication(PAC)の強化を回避しました。所要時間は人間の注意 20 分+モデルの稼働 8 時間。Zhipu の API 価格で、この取り組みは 20.40 ドルかかっていました。安価な変種は良性のワークロードだけでなく、攻撃的なセキュリティ作業についても安価であり、しかもオープンウェイトです。

セーフガードは回避可能です。Anthropic は、GLM-5.3 のセーフガードが偽のカバーストーリーで 64%、事前充填推論で 92%、abliterated 版では 100%回避されることを確認しました(公開数日以内に複数の abliterated 版が公開されています)。これらの手法は、テストではセーフガード付きの Claude モデルに対して機能しませんでした。NIST CAISI の 9 月 17 日評価は GLM-5.3 を「これまでで最もサイバー能力の高いオープンウェイトモデル」と評し、サイバーベンチマークの集計で米国フロンティアにおよそ 4 か月の遅れを記録しています。

ガバナンスの読みは、親記事の kill-switch とガバナンス・チェックリストへのクロスリンクがすでに読者に準備しているものです:能力と権限は別々に付与すべきです。セーフガードが回避可能でフロンティア並みのサイバー能力を持つオープンウェイトモデルは、最低権限のツールアクセス、ネットワーク送信許可リスト、軌跡モニタリングを備えた統制済み MCP モジュールの裏で動くときは防御ツールです——ガバナンス・チェックリストが規定するアーキテクチャです。その周辺部なしで動かせば、同じモデルは拡散リスクです。0.15/0.50 ドルの Flash 変種は、両方の用途を安くします。

ルーティング決定にとって何が変わるか

推論経済学記事が記録したコスト崩壊テーゼは、最強のデータポイントを得ました。Terminal Bench で Claude Opus 4.8 との差 1 点以内、AutomationBench では上回る、Z.ai 自身のフラッグシップ価格の 10 分の 1——しかもオープンウェイトで入手可能。トレンドサイクルが明らかにした企業 AI 予算の枯渇(2026 年にインフラ支出 62.5% 増で 8,220 億ドル、企業全体の利益を測定できた採用企業は 6%のみ——AI Business Weekly、米大企業では予算が 1〜2 か月で枯渇——MarketScale)が需要のドライバーです。コスト崩壊はもはや複数年のアークではなく、同じ週のルーティング決定です。

モデルフレキシブルなビルドは、Flash 変種をオープンウェイト・フロンティア記事が追跡するスワップ可能なプールの新規エントリとして読みます。プールは今や 3 地域(米国:Reflection Beam、欧州:Mistral ML4・Aleph Alpha Kolibri-1、中国:DeepSeek・Qwen・GLM)と複数の能力層に及びます。オープンウェイトと closed モデルの双方にまたがるルーティングレイヤーは、Flash 変種をエージェント・ツール使用レーンのコスト最適デフォルトとして追加し、信頼度が下がれば統制済み MCP モジュールの裏の closed frontier モデルへエスカレーションできます。監査ログは各呼び出しをどのモデルが処理したかを記録します。TypeSafe Jev 決策層記事は、エスカレーション方針を明示するキャリブレーション契約を記録しています:0.95 以上の決定は自動解決、0.50 未満は人間へ、中間帯は確率付きでレビュー待ち行列へ。

Flash 変種の防御的セキュリティ・レーンは、親記事の CyberGym 84.5%データポイントが開いて Anthropic の分析が独立に確認したものです。攻撃者のデータを処理し、 exploit チェーンを分析し、コードベースの脆弱性スキャンを拒否せずに実行するモデルを必要とするセキュリティチームには、セルフホスト可能で独立検証済み、0.15/0.50 ドルの選択肢ができました。その周辺のガバナンス——最低権限のツールアクセス、送信許可リスト、軌跡モニタリング——はkill-switch 記事が規定するのと同じアーキテクチャであり、モデルが隙間を見つけるのが得意なとき、重要度は減らずに増えます。

GLM-5.3-Flash:Flash コストで frontier の知能を 320B/18B アクティブのオープンウェイト MoE — Terminal Bench で Claude Opus 4.8 と 1 ポイント以内、価格はフラッグシップの 10 分の 1 価格(100 万トークンあたり) $0.15 / $0.50 GLM-5.3 の $1.40/$4.40 の 10 分の 1 Terminal Bench 2.1 84.3 Claude Opus 4.8:約 85(1 ポイント以内) AutomationBench 48.8 Claude Opus 4.8(41.0)と GPT-5.6 Terra(37.2)を上回る Intelligence Index v4.1.1 57 $0.045/タスク(割引)—約 10×安い 段階的リリースは分裂:Flash は公開、フラッグシップは保持 GLM-5.3-Flash (released) 320B/18B アクティブ · 重みは Hugging Face で公開中 $0.15/$0.50 · ネイティブ multimodal · ハイブリッド注意機構 コスト崩壊の側 — ルーティング可能、セルフホスト可能、公開 GLM-5.3 744B (withheld) 744B · 重みは Hugging Face に非公開 $1.40/$4.40 API · CyberGym 84.5% · 2,436 件の脆弱性リスト “公開後 2 週間”の約束は経過 Anthropic Frontier Red Team — 独立検証(2026 年 9 月 29 日) 12% ExploitBench (GLM-5.3) Claude Mythos Preview の 14% に並ぶ $20.40 Flash の CVE チェーンコスト(ARM64 エクスプロイト) 人間 20 分+モデル 8 時間、CVE-2026-11645 64–100% セーフガード回避率 カバーストーリー 64% · 事前充填 92% · abliteration 100% ~4 mo 米国フロンティアへの遅れ(NIST CAISI) “これまでで最もサイバー能力の高いオープンウェイト” ルーティング決定にとって何が変わるか • エージェント・ツール使用レーンのコスト最適デフォルト — 統制済み MCP モジュールの裏の closed frontier へエスカレーション • 防御的セキュリティ・レーン:セルフホスト可能、独立検証済み、$0.15/$0.50 — ガバナンス境界がさらに重要 • スワップ可能なプールに 3 地域・複数層のエントリ — ルーティングレイヤーは不変、タスクごとにエンドポイント 企業 AI 予算は 1–2 か月で枯渇(MarketScale)—コスト崩壊は複数年のアークではなく同じ週のルーティング決定

関連記事


NetSuite・BigCommerce・3 つのサプライヤーカタログを運用する地域ディストリビューターが、タスク別にルーティングする見積もりエージェントを展開しています。カタログ検索と在庫確保は GLM-5.3-Flash が 100 万トークンあたり 0.15/0.50 ドルで処理します——ワークフローの 80%を担うエージェント・ツール使用レーンのコスト最適デフォルトです。段階価格と FX を含む見積もり生成は、確信度がしきい値を下回ると、統治済み MCP モジュールの裏の closed frontier モデルへエスカレーションされます。Flash 変種のセルフホスト・エンドポイントは、同じ MCP モジュール、同じ監査証跡の上で動き、再デプロイは不要——設定変更であって調達の交渉ではありません。Anthropic の分析が Flash 変種のサイバー能力を確認したとき、セキュリティチームは同じモデルを、最低権限のツールアクセスとネットワーク送信許可リストの裏で動くセルフホストのコードベース脆弱性スキャナとして追加しました——kill-switch アーキテクチャが定めるガバナンス境界で、能力とは別に付与されます。この種のビルドは通常 5〜8 週間で稼働します。

スコープを限ったビルドをご依頼ください。 1 週間のディスカバリー。システムインベントリ、ワークフローマップ、固定スコープをお渡しします。私どもでビルドするかどうかは問いません。

あなたのシステムのためにこれを構築したいですか?

ここの各ドキュメントは実際の本番作業から来ています。ターゲットシステムとワークフローがあれば、1週間でスコープを定義できます。

スコープ付き構築を依頼

1週間のディスカバリ。システムインベントリ、ワークフローマップ、固定スコープを提供します — 私たちと構築するかどうかにかかわらず。