ライブラリに戻る
戦略

Qwen3.8-27B と DeepSeek Harness:真にオープンなエージェントスタックの到来

最終更新:2026年8月14日

8月13日に公開された Qwen3.8-2.4T オープンウェイト は削減版でした——テキストのみ、ビジョンなし、thinking固定オン、1Mではなく262Kコンテキスト。コミュニティはこれをフロンティアのペイウォール化と呼びました。2日後、Alibabaは Qwen3.8-27B を公開しました——2.4T版が削除したすべてを含んでいます:ネイティブビジョン言語理解(画像と動画)、柔軟な思考制御(リクエストごとに無効化、推論深度の調整、メッセージ間での思考保持)、262Kコンテキスト(1Mに拡張可能)。そして同日、DeepSeek は Harness をオープンソース化 しました——MITライセンスのエージェントランタイムで「すべてがプラグイン」、数時間で 33,000以上の GitHub スター を獲得。本記事は Open-Weight Models Crossed the Agentic Frontier を基に構築されており、同記事は2026年7月までの能力ギャップをマッピングしました。ここでは真にオープンなエージェントスタックを完成させる2つの開発をカバーします:何も保留しないモデルと、すべての能力を交換可能として扱うランタイム。

主要ポイント

  • Qwen3.8-27B はビジョン、柔軟な思考制御、262Kコンテキスト(1Mに拡張可能)を含む——削減版 2.4T の真にオープンな兄弟機——Terminal-Bench 2.1 で 73.0 は Muse Glimmer 30B の 51.7 を上回り、SWE-bench Pro で 61.7 は Muse Glimmer の 51.2 を上回ります。27B はほとんどのチームが実際にローカルで実行するモデルです(Hugging Face)。
  • DeepSeek Harness:MITライセンス、「すべてがプラグイン」、数時間で 33,000以上の GitHub スター——モデル、ツール、スキル、セッション、サンドボックス、ストレージ、ループ、スケジューリング、UI はすべて「パッチすべき特権コアなし」の交換可能プラグインです(DeepSeekThe New Stack)。
  • 4つのオープンウェイト戦略が可視化:Z.ai(安全ハードニング後のウェイト)、Qwen 削減 2.4T(能力のペイウォール化)、Qwen 27B(真にオープン)、Kimi K3(ビジョン含む完全ウェイト)——オープンウェイトフロンティアはリリース哲学のポートフォリオであり、単一戦略ではありません。それぞれが異なる能力を保留または公開します。
  • 追加専用セッションログは発見された最も具体的なオブザーバビリティパターン:モデルに可視のすべての入力が単一イベントストリームから再構築可能——レジューム、フォーク、リプレイ、トランスクリプト、テレメトリ、Web UI はすべて同じログ上で動作します(DeepSeek)。
  • OSレベルのサンドボックス(Linux Landlock、macOS Seatbelt、Windows ACL)が harness に組み込み——別のセキュリティ製品を必要とせずに kill-switch アーキテクチャを検証する具体的なコンテインメントパターン。

Qwen3.8-27B:真にオープンなモデル

Hugging Face モデルカード がアーキテクチャを確認:27B パラメータ、64層、Gated DeltaNet + Gated Attention ハイブリッド(3 DeltaNet 層の後に 1 Attention 層が続く16の繰り返しブロック)、262,144 コンテキスト(ネイティブで 1,000,000 に拡張可能)。ネイティブビジョン言語モデルです——STEM 図やドキュメントから時間スケールの動画まで、画像と動画を理解します。thinking モードはデフォルトでオンですがリクエストごとに無効化可能;推論深度は reasoning_effort で調整可能;履歴メッセージからの推論コンテキストは preserve_thinking で保持されます。これらはまさに 削減版 2.4T がペイウォール化した機能です:ビジョン、非 thinking モード、柔軟なコンテキストは 27B ではオープンで、Max ではクラウドのみです。

27B 密モデルとしてベンチマーク表は強力です。Terminal-Bench 2.1 で 73.0——Muse Glimmer の 51.7 を 21 ポイント上回る。SWE-bench Pro で 61.7、DeepSWE 1.1 で 42.2、QwenSWEBench で 79.0、CoWorkBench で 70.7。ビジョン言語ベンチマークでは:OSWorld-Verified で 84.3、WebArena-Verified で 64.8、AndroidWorld で 81.9。27B は両者がスコアされるすべてのコーディングベンチマークで 30B の Muse Glimmer を上回ります——ビジョンを持つ 27B 密モデルは、ビジョンのない 30B 密モデルとは異なるデプロイメントカテゴリです。

コミュニティの反応は即時でした。27B は"2026年で最も重要なローカル AI リリース"と呼ばれました——ほとんどのチームがコンシューマハードウェア上で低レイテンシと完全なプライバシーで実際にローカル実行するモデルです。2.4T Max は技術的スペクタクル;27B はデプロイメントターゲットです。2.4T モデルの 4 ビット表現はウェイトだけで約 1.2 テラバイトを必要とします——クラスターデプロイメント。27B はワークステーションクラスのハードウェアに収まります。

4戦略オープンウェイトスペクトラム

27B は親記事が 3 つの戦略として記録したものを 4 方向比較に完成させます。各中国ラボは現在、独自のオープンウェイトリリース哲学を代表します:

戦略 ラボ モデル オープンなもの 保留されるもの
安全ハードニング後のウェイト Z.ai GLM-5.3 完全ウェイト(安全評価後 2 週間保留) なし(ハードニング後にウェイト公開)
削減、能力のペイウォール化 Alibaba Qwen3.8-2.4T-A95B テキストのみウェイト、262K コンテキスト、thinking 固定 ビジョン、非 thinking モード、1M コンテキスト、組み込みツール
真にオープン、ローカル実行可能 Alibaba Qwen3.8-27B ビジョン、柔軟な思考、262K コンテキスト、ローカルデプロイ なし(完全機能セットがオープンウェイトに含まれる)
ビジョン含む完全ウェイト Moonshot Kimi K3 ビジョン含む完全ウェイト(594GB MXFP4) なし(ただし最低 8x H100——クラスタースケール)

スペクトラムは「クラウドに押し込むための削減」(Qwen 2.4T)から「真にオープン、ワークステーションで実行可能」(Qwen 27B)から「完全ウェイトだがクラスタースケール」(Kimi K3)まで広がります。モデルフレキシブルビルドの存在はまさに、調達チームが Z.ai のハードニング後サイバー能力、Qwen 27B のローカル実行可能ビジョン、Kimi K3 の完全ウェイトマルチモーダル能力を比較検討し——コードデプロイメントなしでタスクごとにルーティング——できるようにするためです。

The Genuinely-Open Agent Stack Four open-weight strategies + plugin-first runtime = production agent with no vendor lock-in FOUR OPEN-WEIGHT STRATEGIES Z.ai GLM-5.3 Weights after hardening Open: full weights (pending 2wk) Withheld: nothing CyberGym 84.5% (leading) 2,436 vulns disclosed Qwen 2.4T-A95B Stripped, paywalled Open: text-only, 262K ctx Withheld: vision, 1M ctx, thinking off Community backlash Cluster-scale deployment Qwen 3.8-27B Genuinely open Open: vision, thinking ctrl, 262K+ Withheld: nothing Terminal-Bench 73.0 Workstation-deployable Kimi K3 Full weights, cluster-scale Open: full weights + vision Withheld: nothing 594GB MXFP4 8x H100 minimum GENUINELY-OPEN AGENT STACK Model Layer Qwen3.8-27B (27B, vision, flexible thinking) or Muse Glimmer (30B, Apache 2.0, 24GB VRAM) Genuinely open, workstation-deployable, no per-token charge, no vendor can strip capabilities Runtime Layer DeepSeek Harness (MIT, plugin-first, append-only session log, OS-level sandboxing) 33K+ GitHub stars, provider-agnostic, MCP client built in, Landlock/Seatbelt/Windows ACL Integration Layer MCP modules (NetSuite, HubSpot, BigCommerce, ShipStation) following the code standard Open standard, swappable plugins, same directory structure and error contract across connectors Governance Layer Append-only session log (observability) + OS-level sandboxing (containment) + per-plugin scoping Ships in the runtime, not as a separate product. Resume, fork, replay from a single event stream. No managed API required. No per-token charge. No vendor permission to modify. The binding constraint is the integration layer — where the build effort concentrates. Sources: Hugging Face Qwen3.8-27B model card, DeepSeek Harness, The New Stack, The Register

DeepSeek Harness:プラグインファーストのランタイム

真にオープンなモデルには真にオープンなランタイムが必要です。DeepSeek Harness は 8 月 13-14 日に MIT ライセンスで開発者プレビューとして公開されました——Claude Code と Codex 以降で最も重要なオープンソースエージェントランタイムのリリースです。

コア設計原則は「すべてがプラグイン」です。「時空のコンポーザビリティ」のための Cordis メタフレームワーク 上に構築され、harness はモデルアダプタ、ツールレジストリ、セッションログ、サンドボックス、ファイルシステム、エージェントループ、スケジューリング、UI を交換可能プラグインとして扱います。パッチすべき特権コアはありません——harness を拡張することは他のプラグインの隣にプラグインをマウントすることを意味します。Cordis カーネルがプラグインのマウント、アンマウント、依存関係を管理;エージェント能力はプラグインに存在;開発者は harness ソースコードを変更することなく設定で任意の能力を選択、交換、拡張できます(The New Stack)。

4 つのプリセットが同梱:Standard(ファイルシステムツール、シェルアクセス、Web 検索、サブエージェント、プランモードを含む完全コーディングエージェント)、Minimal(2 つのツールのみ——bashstr_replace_editor)、Code(TypeScript SDK を生成し、モデルが複数ステップの操作を 1 つのプログラムで組み合わせられるようにする——5 往復かかるシーケンスが単一呼び出しで実行)、Creator(ランタイムインスペクション、プラグイン実験、プリセットオーサリング)。

追加専用セッションログ

モデルが見るすべてのものが追加専用セッションログに記録されます:システムプロンプト、推論、ツール呼び出しと結果、サブエージェントスケジューリング、すべてのコンテキストインジェクション。レジューム、フォーク、検索、リプレイはすべて同じイベントストリーム上で動作します。新しいモデル可視入力を追加することは新しいセッションイベントを追加することを意味します。これは任意のオープンソースエージェントランタイムで発見された最も具体的なオブザーバビリティパターンです——モデルリクエストに到達するすべてのものがログから再構築可能でなければなりません。長時間実行エージェントパターンアーキテクチャにとって、追加専用ログはチェックポイント/レジュームパターンの本番実装です:数時間または数日間実行するエージェントは単一イベントストリームから一時停止、検査、フォーク、リプレイ可能です。

OSレベルのサンドボックス

harness はサブプロセスを Linux Landlock(Node アドオン経由)、macOS Seatbelt、または Windows ACL 制限トークンランナーでラップします。これは具体的なコンテインメントパターンです——ポリシーレイヤーやプロンプトレベルのガードレールではなく、エージェントのツール呼び出しがアクセスできるものを制限するオペレーティングシステム強制境界です。kill-switch アーキテクチャにとって、OSレベルのサンドボックスはランタイムサーキットブレーカーの基盤です:モデルが悪意のあるツール呼び出しを生成しても、オペレーティングシステムが境界を強制するため、エージェントはサンドボックスから逃れられません。

プロバイダーアグノスティック + MCP クライアント内蔵

プロバイダーカタログは Anthropic、OpenAI、AWS Bedrock、Microsoft Azure、Google Gemini Enterprise Agent Platform、DeepSeek 自身のエンドポイントをカバーします。カスタム OpenAI 互換ゲートウェイがサポートされます。2 つのサブエージェントプロバイダーが Claude Code と Codex に委譲します。MCP クライアントが内蔵され、Agent Client Protocol サポートも含まれます。harness は AGENTS.mdCLAUDE.md ファイルを読みます。The Register はこのリリースを「中国の AI ラボは前進し続け、米国のラボは守備に徹している」と枠付けしました。

プロバイダーアグノスティック設計は親記事のモデルフレキシブルビルドのテーゼを検証します:harness は DeepSeek のモデルに縛り付けません。チームは計画をフロンティアモデルに、実行を Qwen3.8-27B や Muse Glimmer のようなローカルファーストオープンウェイトモデルに、ツール呼び出しを MCP モジュール経由でルーティングできます——すべて同じランタイム内で、すべてプラグインスワップとして。

プラグインアーキテクチャが検証するもの

「すべてがプラグイン」設計は、MCP Module Code Standard のこれまでで最も強力な業界検証です。コード標準はディレクトリ構造、ツール登録パターン、エラー処理契約、レート制限、監査ログ、PII 境界ルールを定義し、すべてのコネクタが同じように見えるようにします。DeepSeek Harness は同じ原則をランタイムレベルで適用します:モデル、ツール、スキル、セッション、サンドボックス、ループはすべて同じプラグイン契約に従います。コード標準に従って MCP モジュールを構築するチームは、それらを harness の MCP クライアントにプラグインとしてマウントできます——モジュールパターンと harness パターンは補完的であり、競合しません。

真にオープンなエージェントスタック

2 つの発展が組み合わさり、1 週間前には不可能だったスタックを完成させます。中堅 B2B チームは以下から本番エージェントを組み立てられます:

  1. モデルレイヤー: Qwen3.8-27B(27B、ビジョン、柔軟な思考、262K コンテキスト、ローカル実行可能)または Muse Glimmer(30B、Apache 2.0、24GB VRAM、Hermes Agent 互換)——両方とも真にオープン、両方ともワークステーションデプロイ可能
  2. ランタイムレイヤー: DeepSeek Harness(MIT、プラグインファースト、追加専用セッションログ、OSレベルサンドボックス、プロバイダーアグノスティック、MCP クライアント内蔵)
  3. インテグレーションレイヤー: コード標準に従う MCP モジュール——NetSuite、HubSpot、BigCommerce、ShipStation コネクタを交換可能プラグインとして
  4. ガバナンスレイヤー: オブザーバビリティのための追加専用セッションログ、コンテインメントのための OSレベルサンドボックス、比例ガバナンスのためのプラグインごとの能力スコーピング

このスタックのどのコンポーネントもマネージド API、トークンごとの課金、ベンダーの変更許可を必要としません。モデルウェイトはダウンロード可能です。ランタイムは MIT ライセンスです。MCP モジュールはオープン標準に従います。ガバナンスパターンはランタイムに組み込まれ、別製品ではありません。

制約は親記事が特定したもののままです:モデルではなく、インテグレーションレイヤーです。真にオープンなエージェントスタックは NetSuite、HubSpot、BigCommerce に接続する MCP モジュールの必要性を排除しません——モデルとランタイムレイヤーをオープンにし、インテグレーションレイヤーがビルド作業の集中場所にします。自身の MCP モジュールを所有し、それらをプラグインファーストランタイムにマウントし、ローカル 27B モデルとフロンティア API の間をタスクごとにルーティングするチームは、いかなるベンダーも取り消し、計量、または削減できない本番エージェントを持ちます。

関連読書

  • Open-Weight Models Crossed the Agentic Frontier——親記事、2026年7月までのオープンウェイトモデルとクローズドフロンティアモデル間の能力ギャップをマッピング、モデルフレキシブルビルドのテーゼと本記事が4つに拡張する3戦略オープンウェイト比較を含む
  • Qwen3.8 Open Weights Arrived Stripped——削減版 2.4T で、Qwen3.8-27B はその真にオープンな対抗叙事です。コミュニティの反発とペイウォール化された機能セットをカバー
  • MCP Module Code Standard——DeepSeek Harness プラグインアーキテクチャがランタイムレベルで検証する構造パターン——すべてのプラグインが同じ契約に従うため、すべてのコネクタが同じように見える

NetSuite と BigCommerce を実行する中堅ディストリビューターは、サプライヤー PDF を読み取り(ビジョン)、価格ティアを抽出し、在庫を確認し、RFQ 応答を起草するエージェントを必要とします。削減版 Qwen3.8 2.4T は PDF を読み取れません。27B は可能です——オープンウェイトにビジョンが含まれています。エージェントランタイムには監査証跡のための追加専用セッションログとコンテインメントのための OSレベルサンドボックスが必要です。DeepSeek Harness が両方を提供します。NetSuite と BigCommerce に接続する MCP モジュールはコード標準に従い、プラグインとしてマウントされます。モデルは PDF 解析とローカル実行のために Qwen3.8-27B に、戦略的交渉のためにフロンティアモデルにルーティングされます——すべて同じ harness 内で、すべて設定として、コードデプロイメントではなく。いかなるベンダーもビジョン能力を削減、推論を計量、またはランタイムを取り消しできません。

あなたのシステムのためにこれを構築したいですか?

ここの各ドキュメントは実際の本番作業から来ています。ターゲットシステムとワークフローがあれば、1週間でスコープを定義できます。

スコープ付き構築を依頼

1週間のディスカバリ。システムインベントリ、ワークフローマップ、固定スコープを提供します — 私たちと構築するかどうかにかかわらず。