Qwen3.8-27B 與 DeepSeek Harness:真正開放的代理堆疊到來
8 月 13 日發布的 Qwen3.8-2.4T 開源權重 是被裁剪的——僅文字、無視覺、思維鎖定開啟、262K 上下文而非 1M。社群稱之為將前沿付費牆化。兩天後,阿里巴巴發布了 Qwen3.8-27B,包含 2.4T 版本移除的一切:原生視覺語言理解(圖像和影片)、靈活思維控制(按請求停用、調整推理深度、跨訊息保留思維)、262K 上下文可擴展至 1M。同一天,DeepSeek 開源了 Harness——一個 MIT 授權的代理執行時,"一切皆插件",數小時內獲得 33,000+ GitHub 星標。本文建立在 Open-Weight Models Crossed the Agentic Frontier 之上,該文映射了截至 2026 年 7 月的能力差距;這裡我們覆蓋完成真正開放代理堆疊的兩個發展:一個不保留任何能力的模型,和一個將每項能力視為可交換的執行時。
關鍵要點
- Qwen3.8-27B 包含視覺、靈活思維控制和 262K 上下文可擴展至 1M——被裁剪 2.4T 的真正開放同胞——Terminal-Bench 2.1 為 73.0,超過 Muse Glimmer 30B 的 51.7;SWE-bench Pro 為 61.7,超過 Muse Glimmer 的 51.2。27B 是大多數團隊將在本地執行的模型(Hugging Face)。
- DeepSeek Harness:MIT 授權,"一切皆插件",數小時內 33,000+ GitHub 星標——模型、工具、技能、會話、沙箱、儲存、迴圈、排程和 UI 都是可交換插件,"沒有需要修補的特權核心"(DeepSeek;The New Stack)。
- 四種開源權重策略現已可見:Z.ai(安全加固後發布權重)、Qwen 裁剪 2.4T(能力付費牆化)、Qwen 27B(真正開放)、Kimi K3(含視覺的完整權重)——開源權重前沿是發布理念的組合,而非單一策略。每種策略保留或暴露不同的能力。
- 僅追加會話日誌是最具體的可觀測性模式:每個模型可見輸入可從單一事件流重建——恢復、分叉、重放、轉錄、遙測和 Web UI 都在同一日誌上執行(DeepSeek)。
- 作業系統級沙箱(Linux Landlock、macOS Seatbelt、Windows ACL)內建於 harness——一個具體的容器化模式,無需單獨的安全產品即可驗證 kill-switch 架構。
Qwen3.8-27B:真正開放的模型
Hugging Face 模型卡 確認了架構:27B 參數、64 層、Gated DeltaNet 加 Gated Attention 混合(16 個重複塊,每 3 層 DeltaNet 後跟 1 層 Attention)、262,144 上下文原生可擴展至 1,000,000。它是原生視覺語言模型——理解圖像和影片,從 STEM 圖表和文件到小時級影片。思維模式預設開啟但可按請求停用;推理深度透過 `reasoning_effort` 調整;歷史訊息的推理上下文透過 `preserve_thinking` 保留。這些正是裁剪版 2.4T 付費牆化的功能:視覺、非思維模式和靈活上下文在 27B 中是開放的,在 Max 中僅限雲端。
基準測試表對於 27B 稠密模型來說很強。Terminal-Bench 2.1 為 73.0——比 Muse Glimmer 的 51.7 高 21 分。SWE-bench Pro 為 61.7,DeepSWE 1.1 為 42.2,QwenSWEBench 為 79.0,CoWorkBench 為 70.7。在視覺語言基準上:OSWorld-Verified 為 84.3,WebArena-Verified 為 64.8,AndroidWorld 為 81.9。27B 在兩者都評分的每個編碼基準上都超過了 30B 的 Muse Glimmer——一個帶視覺的 27B 稠密模型與一個不帶視覺的 30B 稠密模型是不同的部署類別。
社群反響是即時的。27B 被稱為"2026 年最重要的本地 AI 發布"——大多數團隊將在消費級硬體上本地執行的模型,低延遲且完全隱私。2.4T Max 是技術奇觀;27B 是部署目標。2.4T 模型的四位元表示僅權重就需要約 1.2 TB——叢集部署。27B 適合工作站級硬體。
四策略開源權重光譜
27B 完成了父文章記錄為三種策略的四向比較。每個中國實驗室現在代表一種獨特的開源權重發布理念:
| 策略 | 實驗室 | 模型 | 開放內容 | 保留內容 |
|---|---|---|---|---|
| 安全加固後發布權重 | Z.ai | GLM-5.3 | 完整權重(安全評估後 2 週發布) | 無(加固後發布權重) |
| 裁剪,能力付費牆化 | 阿里巴巴 | Qwen3.8-2.4T-A95B | 僅文字權重,262K 上下文,思維鎖定 | 視覺、非思維模式、1M 上下文、內建工具 |
| 真正開放,可本地執行 | 阿里巴巴 | Qwen3.8-27B | 視覺、靈活思維、262K 上下文、本地部署 | 無(完整功能集在開源權重中) |
| 含視覺的完整權重 | 月之暗面 | Kimi K3 | 完整權重含視覺(594GB MXFP4) | 無(但最低 8x H100——叢集規模) |
光譜從"裁剪以推向雲端"(Qwen 2.4T)到"真正開放,可在工作站執行"(Qwen 27B)到"完整權重但叢集規模"(Kimi K3)。模型靈活建構的存在正是為了讓採購團隊可以權衡 Z.ai 的加固後網路能力、Qwen 27B 的本地可執行視覺和 Kimi K3 的完整權重多模態能力——並按任務路由而無需程式碼部署。
DeepSeek Harness:插件優先的執行時
真正開放的模型需要真正開放的執行時。DeepSeek Harness 於 8 月 13-14 日作為開發者預覽版在 MIT 授權下發布——自 Claude Code 和 Codex 以來最重要的開源代理執行時發布。
核心設計原則是"一切皆插件。"基於 Cordis 元框架 建構,實現"時空可組合性",harness 將模型介面卡、工具登錄、會話日誌、沙箱、檔案系統、代理迴圈、排程和 UI 視為可交換插件。沒有需要修補的特權核心——擴展 harness 意味著在其他插件旁掛載一個插件。Cordis 核心管理插件的掛載、卸載和依賴;代理能力存在於插件中;開發者可以在設定中選擇、交換或擴展任何能力而無需更改 harness 原始碼(The New Stack)。
四個預設隨附:Standard(完整編碼代理,含檔案系統工具、shell 存取、網路搜尋、子代理、計畫模式)、Minimal(僅兩個工具——`bash` 和 `str_replace_editor`)、Code(生成 TypeScript SDK,使模型可在一個程式中組合多步操作——一個需要五次往返的序列作為單次呼叫執行)、Creator(執行時檢查、插件實驗、預設創作)。
僅追加會話日誌
模型看到的一切都記錄在僅追加會話日誌中:系統提示、推理、工具呼叫和結果、子代理排程以及每次上下文注入。恢復、分叉、搜尋和重放都在同一事件流上執行。添加任何新的模型可見輸入意味著添加新的會話事件。這是在任何開源代理執行時中發現的最具體的可觀測性模式——任何到達模型請求的內容必須可從日誌重建。對於長時間執行代理模式架構,僅追加日誌是檢查點/恢復模式的生產實作:一個執行數小時或數天的代理可以從單一事件流暫停、檢查、分叉和重放。
作業系統級沙箱
harness 將子程序包裝在 Linux Landlock(透過 Node 插件)、macOS Seatbelt 或 Windows ACL 限制令牌執行器中。這是一個具體的容器化模式——不是策略層或提示級護欄,而是限制代理工具呼叫可存取內容的作業系統強制邊界。對於 kill-switch 架構,作業系統級沙箱是執行時斷路器的基礎:即使模型產生惡意工具呼叫,代理也無法逃出其沙箱,因為作業系統強制執行邊界。
供應商無關且內建 MCP 客戶端
供應商目錄涵蓋 Anthropic、OpenAI、AWS Bedrock、Microsoft Azure、Google Gemini Enterprise Agent Platform 和 DeepSeek 自己的端點。支援自訂 OpenAI 相容閘道。兩個子代理供應者委託給 Claude Code 和 Codex。內建 MCP 客戶端,並包含 Agent Client Protocol 支援。harness 讀取 `AGENTS.md` 和 `CLAUDE.md` 檔案。The Register 將此次發布描述為"中國 AI 實驗室繼續前進,而美國實驗室在防守。"
供應商無關設計驗證了父文章的模型靈活建構論點:harness 不會將你綁定到 DeepSeek 的模型。團隊可以將規劃路由到前沿模型,將執行路由到本地優先開源權重模型如 Qwen3.8-27B 或 Muse Glimmer,將工具呼叫通過 MCP 模組——所有這些都在同一執行時內,全部作為插件交換。
插件架構驗證了什麼
"一切皆插件"設計是迄今為止對 MCP Module Code Standard 最強的行業驗證。程式碼標準定義了目錄結構、工具登錄模式、錯誤處理契約、速率限制、稽核日誌和 PII 邊界規則,使每個連接器看起來相同。DeepSeek Harness 在執行時級別應用相同原則:模型、工具、技能、會話、沙箱和迴圈都遵循相同的插件契約。按照程式碼標準建構 MCP 模組的團隊可以將它們作為插件掛載到 harness 的 MCP 客戶端中——模組模式和 harness 模式是互補的,不是競爭的。
真正開放的代理堆疊
這兩個發展共同完成了一週前還不可能的堆疊。中階市場 B2B 團隊現在可以從以下組件組裝生產代理:
- 模型層: Qwen3.8-27B(27B、視覺、靈活思維、262K 上下文、可本地執行)或 Muse Glimmer(30B、Apache 2.0、24GB VRAM、Hermes Agent 相容)——兩者都真正開放,兩者都可工作站部署
- 執行時層: DeepSeek Harness(MIT、插件優先、僅追加會話日誌、作業系統級沙箱、供應商無關、內建 MCP 客戶端)
- 整合層: 遵循程式碼標準的 MCP 模組——NetSuite、HubSpot、BigCommerce、ShipStation 連接器作為可交換插件
- 治理層: 僅追加會話日誌用於可觀測性、作業系統級沙箱用於容器化、按插件能力範圍劃分用於比例治理
此堆疊中的任何組件都不需要託管 API、按 token 收費或供應商的修改許可。模型權重可下載。執行時是 MIT 授權的。MCP 模組遵循開放標準。治理模式內建於執行時,而非作為單獨產品。
約束仍然是父文章確定的:不是模型,而是整合層。真正開放的代理堆疊不消除對連接 NetSuite、HubSpot 和 BigCommerce 的 MCP 模組的需求——它使模型和執行時層開放,以便整合層成為建構工作集中的地方。擁有自己的 MCP 模組、將它們掛載到插件優先執行時中、並在本地 27B 模型和前沿 API 之間按任務路由的團隊,擁有一個任何供應商都無法撤銷、計量或裁剪的生產代理。
相關閱讀
- Open-Weight Models Crossed the Agentic Frontier——父文章,映射截至 2026 年 7 月開源權重模型與閉源前沿模型之間的能力差距,包括模型靈活建構論點和本文擴展為四種的三策略開源權重比較
- Qwen3.8 Open Weights Arrived Stripped——裁剪版 2.4T,Qwen3.8-27B 是其真正開放的對應敘事,涵蓋社群反彈和付費牆功能集
- MCP Module Code Standard——DeepSeek Harness 插件架構在執行時級別驗證的結構模式——每個連接器看起來相同,因為每個插件遵循相同的契約
一個執行 NetSuite 和 BigCommerce 的中階市場分銷商需要一個代理來讀取供應商 PDF(視覺)、提取定價層級、檢查庫存並起草 RFQ 回應。裁剪版 Qwen3.8 2.4T 無法讀取 PDF。27B 可以——它在開源權重中包含視覺。代理執行時需要僅追加會話日誌用於稽核和作業系統級沙箱用於容器化。DeepSeek Harness 提供兩者。連接到 NetSuite 和 BigCommerce 的 MCP 模組遵循程式碼標準並作為插件掛載。模型將 PDF 解析和本地執行路由到 Qwen3.8-27B,將戰略談判路由到前沿模型——全部在同一 harness 內,全部作為設定而非程式碼部署。任何供應商都無法裁剪視覺能力、計量推理或撤銷執行時。
想為您的系統建構這個嗎?
這裡的每份文件都來自真實的生產工作。如果您有目標系統和工作流程想法,我們可以在一週內確定範圍。
申請客製開發為期一週的發掘階段。您會拿到系統清單、工作流程地圖和固定範圍——無論您最終是否與我們合作開發。