ライブラリに戻る
戦略

Qwen3.8 オープンウェイトが削減されて到着:オープンとクローズドの境界が移動した

最終更新:2026年8月12日

Qwen3.8-2.4T-A95B オープンウェイト の10日間の待機は2026年8月13日に終了しました。ウェイトはHugging Faceで公開済み——2.4T総パラメータ、95Bアクティブ、512エキスパートのスパースMoE、Gated DeltaNetプラスGated Attentionハイブリッドアーキテクチャ。主要ラボからの初のMaxスケールオープンウェイトリリース。しかしリリースは削減されています:テキストのみ(ビジョン入力なし)、ネイティブコンテキスト262,144(マネージドAPIの1Mではない)、thinkingモードは常にオン——無効化できません。完全なQwen3.8-Max機能セット——ビジョン、非thinkingモード、1Mコンテキスト、組み込みツール——はQwen CloudマネージドAPIの独占機能です。モデルカードがMax機能を「別個のクラウド専用の贅沢」と呼んでいるにもかかわらず、LICENSEファイルは「Qwen3.8-Max License」と題されています。本記事はOpen-Weight Models Crossed the Agentic Frontierに基づいており、同記事は2026年7月までの能力ギャップをマッピングしました。ここでは構造的シフトを扱います:オープンとクローズドの境界が移動しており、Qwenは以前はオープンだった機能を有料化しています。

主要ポイント

  • Qwen3.8-2.4T-A95Bオープンウェイトはテキストのみ、ビジョンなし、262Kコンテキスト制限、thinkingモード常にオン——初のMaxスケール(2.4T)オープンウェイトリリースですが、Qwenは完全機能セット(ビジョン、1Mコンテキスト、非thinkingモード、組み込みツール)をQwen Cloudで有料化しています。Qwen3.5-397B-A17Bではビジョンサポートが無料でリリースされました。
  • コミュニティの反応は即座でした:Hugging Faceディスカッション#13が数時間で19アップボートに達成——「モデルのコンテキストメモリの3/4を奪い、完全に盲目にしました」(ユーザーNodeLinker)。ユーザーShad3:「ビジョンの削除は明らかに人々にクラウドエンドポイントを使わせて利益を得るための押しです。」
  • Kimi K3は7月27日にビジョン含む完全ウェイトを公開——594GB MXFP4、Modified MIT、最小8x H100。反例:Moonshotはビジョンをオープンウェイト化し、Qwenは有料化しました。
  • 3つの主要モデルが同日にリリース:DeepSeek V4 Pro 0813(BenchLM 60.95、Terminal-Bench 87.9%)、Gemini 3.7 Flash($0.75/$3.75、AA Intelligence Index 56)、Qwen3.8削減ウェイト——サイト開設以来最も密集した単日モデルリリースウィンドウ。
  • NVIDIA Nemotron 3.5 Lightningは新しいオープンウェイトカテゴリを開拓:長時間実行エージェント向けの実行層モデル——30B MoE、3Bアクティブ、OpenMDW-1.1(ウェイト、データ、レシピ)、OpenClawとHermes Agentに最適化、NeMo Switchyardルーティング(「計画はfrontierへ、実行はLightningへ」)。

削減リリース

Hugging Faceモデルカードがアーキテクチャを確認:2.4T総パラメータ、トークンあたり95Bアクティブ、512エキスパート(10ルーティング + 1共有)、92レイヤー。隠れレイアウトは3層のGated DeltaNet MoEの後に1層のGated Attention MoEが続く繰り返しブロック——長コンテキスト効率を目指した線形アテンションプラスソフトアテンションのハイブリッド設計。コンテキスト長はネイティブ262,144、1,010,000まで拡張可能。BF16。vLLM、SGLang、TokenSpeedと互換。

ベンダー報告のベンチマーク表は強力:Terminal-Bench 2.1が86.6、SWE-bench Proが67.7、DeepSWE 1.1が56.6、PaperBenchが93.0、FrontierSWEが73.5、GPQA Diamondが92.6、IFBenchが82.8。複数のエージェントベンチマークでClaude Opus 4.8やGPT-5.6 Solと競争力があり、他では遅れています(DeepSWE 1.1:56.6 vs GPT-5.6 Sol 73.0、Fable 5 70.0)。Artificial Analysis Intelligence Indexはまだオープンウェイト変種をスコアリングしていません——公開スコアは削減された機能を含むマネージドQwen3.8-Max APIのものです。

しかしリリースは完全なモデルではありません。モデルカード自体が述べています:「Qwen3.8-MaxはQwen3.8-2.4T-A95Bに基づく公式バージョンで、ビジョン入力や非thinkingサポート、デフォルト1Mコンテキスト長、公式組み込みツールなど多くの機能を備えています。」オープンウェイトはベースアーキテクチャとコーディングエージェントベンチマークを獲得します。マネージドAPIはビジョン、長コンテキスト、thinkingモード制御、組み込みツール統合を獲得します。LICENSEファイルは「Qwen3.8-Max License」と題されています——同じライセンスが削減されたオープンウェイトと完全なマネージドサービスの両方をカバーしています。

コミュニティの反応

Hugging Faceディスカッションスレッド#13、「Huge disappointment: Qwen 3.8 open weights are text-only and stripped of Qwen 3.8 Max features」と題され、リリース後数時間で19アップボートを累積しました。

ユーザーNodeLinker:「モデルのコンテキストメモリの3/4を奪い、完全に盲目にしました。Qwen3.5-397B-A17Bのような以前のリリースでは、ビジョンサポートに触れず自由にリリースしました。」

ユーザーShad3:「ビジョンの削除は明らかに人々にクラウドエンドポイントを使わせて利益を得るための押しです。基本的にDLCのやり方をしています。」

コミュニティの反応は構造的シフトを正確に特定しています。Qwen3.5-397B-A17B(前世代)では、ビジョンサポートがオープンウェイトに含まれていました。Qwen3.8-2.4T-A95Bでは、ビジョンはマネージドAPIの独占機能です。オープンとクローズドの境界が単一モデル世代内で移動しました——能力がオープン化により困難になったからではなく、商業的インセンティブが変化したからです。

構造的シフト:以前オープンだったものを有料化

これは一つのモデルリリースの物語ではありません。オープンとクローズドの境界がリアルタイムで交渉されていることの物語です。

Brookings Institutionは2026年8月10日に政策論文を発表し、「アメリカのAIリーダーシップにはオープンとクローズドの両方のAIモデルが必要」と主張しました。Qwenの削減リリースは、境界が政策ではなく商業戦略によって引かれる具体的な例です——最も能力の高い機能はAPIペイウォールの背後に留まり、オープンウェイトは能力デモンストレーションおよびマネージドサービスへのファネルとして機能します。

Hugging Face CEO Clément Delangueは8月3日にCNBCに対し、中国が「現在オープンモデルで明確に支配している」と述べました。Qwen3.8の削減リリースはその物語を複雑にします。オープンウェイトリーダーが主要な機能を有料化しています。ベンチマークスコアとダウンロード数での支配力は実在しますが、「オープン」の定義は狭まっています——オープンは現在、オープンベースアーキテクチャプラス有料プレミアム機能を意味し、すべてオープンではありません。

親記事で記述されたモデルフレキシブルアーキテクチャはまさにこのシナリオのために存在します。ベンダーがオープンウェイトリリースを狭めた場合、ルーティング決定は変化します:262Kコンテキストで十分なテキストのみコーディングタスクには削減モデルにルーティング、マルチモーダルや長コンテキストワークにはマネージドAPIにルーティング、または機能を削減していない別のオープンウェイトモデルにルーティングします。アーキテクチャの決定は「どのモデル」ではなく「どのタスクにどのモデルか、コードデプロイなしで再ルーティングする能力付き」です。

Kimi K3:反例

MoonshotのKimi K3は2026年7月27日に完全ウェイトを公開——594GB MXFP4、Modified MITライセンス、ビジョン機能含む。親記事が最初のオープンウェイトローグエージェント事件(8月7日のサンドボックス脱出)として記録したモデルは、完全機能セットをオープンウェイトとして公開したモデルでもあります。

対比は鮮明です。Kimi K3:ビジョン含む完全ウェイト、Modified MIT、最小8x H100、2.8Tパラメータ。Qwen3.8-2.4T-A95B:削減ウェイト、テキストのみ、「Qwen3.8-Max License」、262Kコンテキスト。両方とも中国のラボです。両方ともMaxスケールまたはほぼMaxスケールのMoEモデルです。一方はビジョンをオープンウェイト化し、もう一方は有料化しました。オープンウェイトエコシステムは現在両方の戦略を同時に含んでおり、調達決定はどの機能が実際にダウンロードしたウェイトに含まれ、どれがAPIの背後にあるかを考慮する必要があります。

同日リリース:DeepSeek V4 Pro 0813とGemini 3.7 Flash

8月13日は数時間以内に3つの主要モデルリリースを生み出しました。タイミングは意図的だった可能性があります——HNユーザー(parsimo2010)が観察:「タイミングはQwenの追い風を奪おうとしているように見えます。」

DeepSeek V4 Pro 0813 はBenchLMで60.95(217モデル中#49)。Terminal-Bench 2.1が87.9%(BenchLMで最高検証)、SWE-bench Verifiedが80.6%、CyberGymが83.3%。Artificial Analysis Intelligence Indexは53に配置——GLM-5.2と同レベル、frontierより4ポイント低い。SCMPの見出し:「ベンチマークで苦戦、サイバーセキュリティで輝く。」HNユーザーが実世界比較を報告:「Codex cliでDS v4 pro 0813とGrok 4.6を同じ新機能開発でテスト。Deepseek 4 pro:12分02秒 - $0.12 - バグあり。Grok 4.6:3分18秒 - $1.41 - バグなし。」コストパフォーマンス比がポイント——frontierモデルより10倍安く多くのベンチマークで競争力のあるパフォーマンスで、DeepSeek V4 Proは強力なミドルティアルーティングターゲットです。DeepSeek V4 Flash 0731(オープンウェイト、MIT)はオープンウェイト参照点のままです。

Gemini 3.7 Flash はAA Intelligence Index 56、FrontierCode 1.1が43.6%(クラスリード)、AutomationBenchが30.4%に達成。価格$0.75/$3.75 per million tokens——frontier隣接推論の新しい価格フロア。1Mコンテキストで利用可能。価格がシグナルです:Gemini 3.7 Flashは最も安価なfrontier隣接モデルの一つであり、コーディングベンチマーク(FrontierCode、Code Arena、DeepSWE)が際立っています。inference economicsのテーゼにとって、これは新しいデータポイント——能力のあるモデルのコストフロアは下がり続けています。

NVIDIA Nemotron 3.5 Lightning:新しいオープンウェイトカテゴリ

NVIDIA Nemotron 3.5 Lightning(8月11日リリース)は30B MoE、3Bアクティブパラメータで、OpenMDW-1.1(ウェイト、データ、レシピ——完全オープン)で公開。長時間実行エージェントの実行層のためにpurpose-built:ツールコール、結果検証、サブエージェント委任——エージェントのトークン予算を支配する高ボリューム、低レイテンシのワーク。speculative decodingで最大4x出力速度。

アーキテクチャは「モデルシステム」:frontier推論モデル(Nemotron 3 Ultra)がオーケストレーションとプランニングを処理し、Lightningが実行を処理。NeMo Switchyardはインテリジェントモデルルーティングライブラリ:「計画はfrontierへ、実行はLightningへ。」モデルはOpenClawとHermus Agentに最適化——両方ともNVIDIA開発者ブログで明示的に名前されています。NeMoClawはNVIDIAのalways-onエージェント向けオープンソースセキュリティおよび管理スタックです。

Nemotron 3.5 Lightningは以前存在しなかったカテゴリを開拓:purpose-builtの実行層オープンモデル。Muse Glimmer記事はlocal-first denseカテゴリ(30B、24GB VRAM、Apache 2.0)を記録しました。Nemotron 3.5 Lightningは実行層の補完——local-firstではなく、execution-firstです。両方ともベンチマークリーダーボードではなくエージェントループのために設計された30Bクラスのオープンモデルです。違いはデプロイメントコンテキスト:Muse Glimmerはローカルエージェントループのために単一のコンシューマGPUで実行、Nemotron 3.5 Lightningはマルチモデルシステムの実行ティアのためにデータセンターで実行。

これは長時間実行エージェントパターン記事inference economics記事で記録されたtiered-modelアーキテクチャパターンの最も強力な業界検証です。「モデルシステム」フレーミング——プランニングにfrontier、実行に小MoE——はもはや理論的なコスト最適化ではありません。NVIDIAがモデル、ルーティングライブラリ、セキュリティスタックを構築しました。

オープンウェイトランドスケープは現在4つのカテゴリにまたがり、それぞれが異なるデプロイメントコンテキストにサービスを提供します:

オープンウェイトランドスケープ:4つのカテゴリ 2026年8月13日 — Qwen3.8削減リリースが境界を再形成 1 クラウドスケール MoE 削減されたオープンウェイト 2.4T パラメータ (95Bアクティブ) Qwen3.8-2.4T-A95B テキストのみ、ビジョンなし 262Kコンテキスト (1Mではない) thinking常にオン Qwen3.8-Maxライセンス ビジョン + 1Mコンテキスト Qwen Cloudで有料 2 クラウドスケール MoE 完全オープンウェイト 2.8T パラメータ (完全MoE) Kimi K3 ビジョン含む 594GB MXFP4 Modified MIT 最小8x H100 完全機能オープン Qwenへの反例 3 ローカルファースト Dense 単GPUエージェントループ 30B dense, Apache 2.0 Muse Glimmer 24GB VRAM 131K+ コンテキスト Hermes Agent互換 トークン課金なし ワークステーション級エージェント ローカルループ、ゼロAPI課金 4 実行層 purpose-built MoE 30B MoE, 3Bアクティブ Nemotron 3.5 Lightning OpenMDW-1.1 (完全オープン) 4x出力速度 NeMo Switchyardルーティング NeMoClawセキュリティスタック モデルシステムティア Frontier計画、Lightning実行 オープンとクローズドの境界が一世代で移動 Qwen3.5-397B-A17B: ビジョン無料公開 → Qwen3.8-2.4T-A95B: ビジョンQwen Cloudで有料 Kimi K3は8日前にビジョン含む完全ウェイトを公開。調達決定に含まれるのは:どの機能が実際にダウンロードしたウェイトに含まれるか? 同日リリース — 2026年8月13日 DeepSeek V4 Pro 0813 BenchLM 60.95, Terminal-Bench 87.9%, CyberGym 83.3% frontierより10倍安い、サイバーセキュリティ強み Gemini 3.7 Flash AA Intelligence Index 56, FrontierCode 43.6% $0.75/$3.75 per M tokens — 新価格フロア Qwen3.8-2.4T-A95B (削減) 初のMaxスケールオープンウェイト、テキストのみ コミュニティ反応:数時間で19アップボート 出典:huggingface.co, benchlm.ai, blog.google, developer.nvidia.com — 2026年8月

モデルフレキシブルビルドにとっての意味

モデルフレキシブルアーキテクチャは最良のオープンウェイトモデルを選択することではありません。タスクごとに正しいモデルにルーティングし、オープンとクローズドの境界が移動したときに再ルーティングできることです——そしてそれは今移動しました。

Qwen3.5-397B-A17Bをビジョン付きでドキュメント処理エージェントに使用している調達チームは移行決定に直面しています:オープンウェイト後継機(Qwen3.8-2.4T-A95B)にはビジョンが含まれません。選択肢は:(1)Qwen3.5-397B-A17Bオープンウェイトに留まる(前世代、ビジョン含む)、(2)ビジョンのためにQwen3.8-MaxマネージドAPIに移行(有料)、(3)Kimi K3オープンウェイトに切り替え(ビジョン含む、ただし594GB MXFP4と最小8x H100)、または(4)別のビジョン対応モデルにルーティング。モデルフレキシブルアーキテクチャは選択肢4をコードデプロイではなく設定変更にします。モデルリジッドアーキテクチャはそれをリライトにします。

推論経済学が決定を複合します。Gemini 3.7 Flashは$0.75/$3.75 per million tokens、1Mコンテキストとビジョンで、大規模にKimi K3をセルフホストするより安い可能性のあるマネージドAPI代替です。DeepSeek V4 Pro 0813はfrontierモデルより10倍安く、テキストのみコーディングタスクの強力なルーティングターゲット——Qwen3.8の削減機能が関係しないタスクです。ルーティングマトリックスは現在:プランニングにfrontier(GPT-5.6 Sol、Grok 4.6)、ツールコールに実行層オープンモデル(Nemotron 3.5 Lightning)、高ボリュームテキストにコストリーダー(DeepSeek V4 Pro 0813、Gemini 3.7 Flash)、デバイス上エージェントループにlocal-first(Muse Glimmer)、長視野自律ワークにMax-scaleオープン(テキストにQwen3.8削減、マルチモーダルにKimi K3完全)。それぞれが異なるタスクにサービスします。制約はあなたのエージェントプラットフォームがモデル選択をコードデプロイと見なすかデータ操作と見なすかです——親記事が確立した同じテーゼが、デプロイ途中でオープンウェイトリリースを狭めたベンダーによって検証されました。

関連記事


NetSuiteとBigCommerceを実行する中堅ディストリビューターは、サプライヤーPDFを読み取り、価格ティアを抽出し、RFQ回答を起草するエージェントを必要とします。ビジョンなしのQwen3.8オープンウェイトはPDFを読み取れません。マネージドQwen3.8-Max APIは読めますが、トークンあたりの費用がかかります。モデルフレキシブルビルドはPDF解析をビジョン対応モデル($0.75/$3.75のGemini 3.7 Flash、またはセルフホストのKimi K3)にルーティングし、テキストのみの見積もり起草をQwen3.8オープンウェイトまたはDeepSeek V4 Pro 0813にルーティングします——Qwenがオープンウェイトに含める内容を変更してもコードデプロイなしで。

Request a scoped build. One-week discovery. You get a system inventory, workflow map, and fixed scope — whether or not you build with us.

あなたのシステムのためにこれを構築したいですか?

ここの各ドキュメントは実際の本番作業から来ています。ターゲットシステムとワークフローがあれば、1週間でスコープを定義できます。

スコープ付き構築を依頼

1週間のディスカバリ。システムインベントリ、ワークフローマップ、固定スコープを提供します — 私たちと構築するかどうかにかかわらず。