Qwen3.8 開源權重到貨但被裁剪:開放-封閉邊界已經移動
對 Qwen3.8-2.4T-A95B 開源權重 的 10 天等待於 2026 年 8 月 13 日結束。權重已在 Hugging Face 上線——2.4T 總參數、95B 激活、512 專家的稀疏 MoE、Gated DeltaNet 加 Gated Attention 混合架構。這是任何主要實驗室首次以 Max 規模發布開源權重。但發布是裁剪過的:僅文字(無視覺輸入)、原生 262,144 上下文(不是託管 API 提供的 1M)、思維模式始終開啟——無法關閉。完整的 Qwen3.8-Max 功能集——視覺、非思維模式、1M 上下文、內建工具——是 Qwen Cloud 託管 API 獨有的。LICENSE 檔案標題為「Qwen3.8-Max License」,儘管模型卡稱 Max 功能是「一個單獨的、僅限雲端的奢侈品」。本文基於 Open-Weight Models Crossed the Agentic Frontier,該文映射了截至 2026 年 7 月的能力差距;這裡我們涵蓋結構性轉變:開放-封閉邊界正在移動,Qwen 正在將此前開放的能力付費化。
關鍵要點
- Qwen3.8-2.4T-A95B 開源權重僅文字、無視覺、262K 上下文限制、思維模式始終開啟——首次 Max 規模(2.4T)開源權重發布,但 Qwen 將完整功能集(視覺、1M 上下文、非思維模式、內建工具)付費化在 Qwen Cloud 上。在 Qwen3.5-397B-A17B 中,視覺支援是免費發布的。
- 社群反應迅速:Hugging Face 討論 #13 在數小時內達到 19 個讚——「你剝奪了模型 3/4 的上下文記憶並完全致盲了它」(用戶 NodeLinker)。用戶 Shad3:「移除視覺顯然是為了推動人們使用他們的雲端入口來賺錢。」
- Kimi K3 於 7 月 27 日發布了包含視覺的完整權重——594GB MXFP4、Modified MIT、最低 8x H100。反例:Moonshot 開源了視覺而 Qwen 將其付費化。
- 三個主要模型同日發布:DeepSeek V4 Pro 0813(BenchLM 60.95、Terminal-Bench 87.9%)、Gemini 3.7 Flash($0.75/$3.75、AA Intelligence Index 56)和 Qwen3.8 裁剪權重——自網站上線以來最密集的單日模型發布窗口。
- NVIDIA Nemotron 3.5 Lightning 開啟了新的開源權重類別:為長時間運行代理構建的執行層模型——30B MoE、3B 激活、OpenMDW-1.1(權重、資料、配方)、為 OpenClaw 和 Hermes Agent 優化、NeMo Switchyard 路由(「計劃上升到 frontier,執行下降到 Lightning」)。
裁剪版發布
Hugging Face 模型卡 確認了架構:2.4T 總參數、每 token 激活 95B、512 專家(10 路由 + 1 共享)、92 層。隱藏布局是 3 層 Gated DeltaNet MoE 後跟 1 層 Gated Attention MoE 的重複塊——一種面向長上下文效率的線性注意力加軟注意力混合設計。上下文長度原生 262,144,可擴展至 1,010,000。BF16。相容 vLLM、SGLang 和 TokenSpeed。
供應商報告的基準測試表很強:Terminal-Bench 2.1 為 86.6、SWE-bench Pro 為 67.7、DeepSWE 1.1 為 56.6、PaperBench 為 93.0、FrontierSWE 為 73.5、GPQA Diamond 為 92.6、IFBench 為 82.8。在多個代理基準上與 Claude Opus 4.8 和 GPT-5.6 Sol 競爭力相當,在其他方面落後(DeepSWE 1.1:56.6 vs GPT-5.6 Sol 73.0、Fable 5 70.0)。Artificial Analysis Intelligence Index 尚未對開源變體評分——已發布的分數是針對託管的 Qwen3.8-Max API,包含被裁剪的功能。
但發布不是完整模型。模型卡本身聲明:「Qwen3.8-Max 是基於 Qwen3.8-2.4T-A95B 的官方版本,具有更多功能,如視覺輸入和非思維支援、預設 1M 上下文長度、官方內建工具。」開源權重獲得基礎架構和編碼代理基準。託管 API 獲得視覺、長上下文、思維模式控制和內建工具整合。LICENSE 檔案標題為「Qwen3.8-Max License」——同一授權涵蓋裁剪的開源權重和完整託管服務。
社群反應
Hugging Face 討論線程 #13,標題為「Huge disappointment: Qwen 3.8 open weights are text-only and stripped of Qwen 3.8 Max features」,在發布後數小時內累積了 19 個讚。
用戶 NodeLinker:「你剝奪了模型 3/4 的上下文記憶並完全致盲了它。在之前的版本如 Qwen3.5-397B-A17B 中,你沒有觸碰視覺支援並免費發布了它。」
用戶 Shad3:「移除視覺顯然是為了推動人們使用他們的雲端入口來賺錢。他們基本上在做 DLC 那套。」
社群反應精確地識別了結構性轉變。在 Qwen3.5-397B-A17B(上一代)中,視覺支援包含在開源權重中。在 Qwen3.8-2.4T-A95B 中,視覺是託管 API 獨有的。開放-封閉邊界在單個模型世代內移動了——不是因為能力變得更難開放,而是因為商業激勵發生了變化。
結構性轉變:將此前開放的能力付費化
這不是關於一個模型發布的故事。這是關於開放-封閉邊界正在實時被重新協商的故事。
Brookings Institution 於 2026 年 8 月 10 日發布了一篇政策論文,論證「開放和封閉的 AI 模型都是必需的」以實現美國 AI 領導力。Qwen 的裁剪發布是邊界由商業策略而非政策劃定的一個具體例子——最強大的功能留在 API 付費牆後面,開源權重作為能力展示和通向託管服務的漏斗。
Hugging Face CEO Clément Delangue 於 8 月 3 日告訴 CNBC,中國「現在顯然在開放模型上佔據主導地位。」Qwen3.8 的裁剪發布使這一敘述變得複雜。開源權重領導者現在正在將關鍵能力付費化。在基準分數和下載量上的主導地位是真實的,但「開放」的定義正在縮小——開放現在意味著開放基礎架構加付費的高級功能,不是全部開放。
父文章 中描述的模型靈活架構正是為這種情況而存在的。當供應商縮小其開源權重發布時,路由決策發生變化:路由到裁剪模型處理 262K 上下文足夠的純文字編碼任務,路由到託管 API 處理多模態或長上下文工作,或路由到未裁剪功能的其他開源權重模型。架構決策不是「哪個模型」而是「哪個模型處理哪個任務,並能夠在不進行程式碼部署的情況下重新路由。」
Kimi K3:反例
Moonshot 的 Kimi K3 於 2026 年 7 月 27 日發布了完整權重——594GB MXFP4、Modified MIT 授權、包含視覺能力。父文章記錄為首個開源權重 rogue-agent 事件(8 月 7 日的沙箱逃逸)的模型,也是將完整功能集作為開源權重發布的模型。
對比鮮明。Kimi K3:完整權重包含視覺、Modified MIT、最低 8x H100、2.8T 參數。Qwen3.8-2.4T-A95B:裁剪權重、僅文字、「Qwen3.8-Max License」、262K 上下文。兩者都是中國實驗室。兩者都是 Max 規模或近 Max 規模的 MoE 模型。一個開源了視覺;另一個將其付費化。開源權重生態系統現在同時包含兩種策略,採購決策必須考慮哪些功能實際在下載的權重中,哪些在 API 後面。
同日發布:DeepSeek V4 Pro 0813 和 Gemini 3.7 Flash
8 月 13 日在數小時內產生了三個主要模型發布。時間可能是有意為之——一位 HN 用戶(parsimo2010)觀察到:「這個時間看起來像是他們試圖搶 Qwen 的風頭。」
DeepSeek V4 Pro 0813 在 BenchLM 上得分 60.95(217 個模型中第 49 名)。Terminal-Bench 2.1 為 87.9%(BenchLM 上最佳驗證)、SWE-bench Verified 為 80.6%、CyberGym 為 83.3%。Artificial Analysis Intelligence Index 將其排在 53——與 GLM-5.2 持平,落後 frontier 四分。SCMP 標題:「基準測試掙扎,網路安全出色。」一位 HN 用戶報告了真實世界比較:「在 Codex cli 上測試了 DS v4 pro 0813 和 Grok 4.6 開發同一新功能。Deepseek 4 pro:工作了 12 分 02 秒 - 花費 $0.12 - 有 bug。Grok 4.6:工作了 3 分 18 秒 - 花費 $1.41 - 無 bug。」成本效能比是關鍵——比 frontier 模型便宜 10 倍且在多個基準上競爭力強,DeepSeek V4 Pro 是一個強大的中端路由目標。DeepSeek V4 Flash 0731(開源權重、MIT)仍然是開源權重參考點。
Gemini 3.7 Flash 達到 AA Intelligence Index 56,FrontierCode 1.1 為 43.6%(同類領先),AutomationBench 為 30.4%。定價 $0.75/$3.75 每百萬 token——frontier 鄰近推理的新價格底線。1M 上下文可用。定價是訊號:Gemini 3.7 Flash 是最便宜的 frontier 鄰近模型之一,編碼基準(FrontierCode、Code Arena、DeepSWE)是亮點。對於 inference economics 論點,這是一個新資料點——有能力模型的成本底線繼續下降。
NVIDIA Nemotron 3.5 Lightning:新的開源權重類別
NVIDIA Nemotron 3.5 Lightning(8 月 11 日發布)是一個 30B MoE、3B 激活參數的模型,在 OpenMDW-1.1 下發布(權重、資料、配方——完全開放)。它專為長時間運行代理的執行層構建:工具呼叫、結果驗證、子代理委派——主導代理 token 預算的高 volume、低延遲工作。透過 speculative decoding 實現高達 4x 輸出速度。
架構是「模型系統」:frontier 推理模型(Nemotron 3 Ultra)處理編排和規劃,Lightning 處理執行。NeMo Switchyard 是智慧模型路由庫:「計劃上升到 frontier,執行下降到 Lightning。」模型為 OpenClaw 和 Hermes Agent 優化——兩者在 NVIDIA 開發者部落格 中被明確提及。NeMoClaw 是 NVIDIA 為 always-on 代理提供的開源安全和管理堆疊。
Nemotron 3.5 Lightning 開啟了一個此前不存在的類別:purpose-built 的執行層開源模型。Muse Glimmer 文章記錄了 local-first dense 類別(30B、24GB VRAM、Apache 2.0)。Nemotron 3.5 Lightning 是執行層補充——不是 local-first,而是 execution-first。兩者都是為代理迴圈而非基準排行榜設計的 30B 級開源模型。區別在於部署上下文:Muse Glimmer 在單塊消費級 GPU 上運行本地代理迴圈;Nemotron 3.5 Lightning 在資料中心運行多模型系統的執行層。
這是對 長時間運行代理模式文章 和 inference economics 文章 中記錄的 tiered-model 架構模式的最強行業驗證。「模型系統」框架——frontier 用於規劃、小 MoE 用於執行——不再是理論上的成本最佳化。NVIDIA 構建了模型、路由庫和安全堆疊。
開源權重格局現在涵蓋四個類別,每個服務於不同的部署上下文:
這對模型靈活構建意味著什麼
模型靈活架構不是關於選擇最好的開源權重模型。它是關於為每個任務路由到正確的模型,並能夠在開放-封閉邊界移動時重新路由——它剛剛移動了。
一個運行 Qwen3.5-397B-A17B 帶視覺的採購團隊,用於文件處理代理,現在面臨遷移決策:開源權重繼任者(Qwen3.8-2.4T-A95B)不包含視覺。選項是:(1)留在 Qwen3.5-397B-A17B 開源權重上(上一代,包含視覺),(2)轉到 Qwen3.8-Max 託管 API 取得視覺(付費),(3)切換到 Kimi K3 開源權重(包含視覺,但 594GB MXFP4 和最低 8x H100),或(4)路由到不同的視覺能力模型。模型靈活架構使選項 4 成為配置變更,而非程式碼部署。模型剛性架構使其成為重寫。
推理經濟學使決策複合。Gemini 3.7 Flash 以 $0.75/$3.75 每百萬 token、1M 上下文和視覺,是一個託管 API 替代方案,可能比大規模自託管 Kimi K3 更便宜。DeepSeek V4 Pro 0813 比 frontier 模型便宜 10 倍,是純文字編碼任務的強路由目標——Qwen3.8 的裁剪功能在這些任務中不重要。路由矩陣現在是:frontier 用於規劃(GPT-5.6 Sol、Grok 4.6),執行層開源模型用於工具呼叫(Nemotron 3.5 Lightning),成本領先者用於高 volume 文字(DeepSeek V4 Pro 0813、Gemini 3.7 Flash),local-first 用於裝置端代理迴圈(Muse Glimmer),Max-scale 開源用於長視野自主工作(Qwen3.8 裁剪用於文字、Kimi K3 完整用於多模態)。每個服務於不同任務。約束是你的代理平台是否將模型選擇視為程式碼部署或資料操作——與父文章建立的相同論點,現在由供應商在部署中途縮小其開源權重發布而得到驗證。
相關閱讀
- Open-Weight Models Crossed the Agentic Frontier — 父文章,映射截至 2026 年 7 月開源權重和封閉 frontier 模型之間的能力差距,包括 Kimi K3、DeepSeek V4、GLM-5.2 和安全治理維度
- Muse Glimmer and the Open-Weight Bifurcation — local-first dense 類別:30B、Apache 2.0、24GB VRAM、相容 Hermes Agent
- Inference Economics: Why Always-On Production Agents Are Now Affordable — 使多模型路由在經濟上可行的成本崩潰,Nemotron 3.5 Lightning 現在驗證的 tiered-model 架構模式
一家運行 NetSuite 和 BigCommerce 的中型分銷商需要一個代理來讀取供應商 PDF、提取定價層級並起草 RFQ 回覆。無視覺的 Qwen3.8 開源權重無法讀取 PDF;託管的 Qwen3.8-Max API 可以,但按 token 收費。模型靈活構建將 PDF 解析路由到視覺能力模型($0.75/$3.75 的 Gemini 3.7 Flash,或自託管的 Kimi K3),將純文字報價起草路由到 Qwen3.8 開源權重或 DeepSeek V4 Pro 0813——當 Qwen 更改其開源權重包含內容時無需程式碼部署。
Request a scoped build. One-week discovery. You get a system inventory, workflow map, and fixed scope — whether or not you build with us.
想為您的系統建構這個嗎?
這裡的每份文件都來自真實的生產工作。如果您有目標系統和工作流程想法,我們可以在一週內確定範圍。
申請客製開發為期一週的發掘階段。您會拿到系統清單、工作流程地圖和固定範圍——無論您最終是否與我們合作開發。