Qwen3.8 开源权重到货但被裁剪:开放-封闭边界已经移动
对 Qwen3.8-2.4T-A95B 开源权重 的 10 天等待于 2026 年 8 月 13 日结束。权重已在 Hugging Face 上线——2.4T 总参数、95B 激活、512 专家的稀疏 MoE、Gated DeltaNet 加 Gated Attention 混合架构。这是任何主要实验室首次以 Max 规模发布开源权重。但发布是裁剪过的:仅文本(无视觉输入)、原生 262,144 上下文(不是托管 API 提供的 1M)、思维模式始终开启——无法关闭。完整的 Qwen3.8-Max 功能集——视觉、非思维模式、1M 上下文、内置工具——是 Qwen Cloud 托管 API 独有的。LICENSE 文件标题为"Qwen3.8-Max License",尽管模型卡称 Max 功能是"一个单独的、仅限云端的奢侈品"。本文基于 Open-Weight Models Crossed the Agentic Frontier,该文映射了截至 2026 年 7 月的能力差距;这里我们涵盖结构性转变:开放-封闭边界正在移动,Qwen 正在将此前开放的能力付费化。
关键要点
- Qwen3.8-2.4T-A95B 开源权重仅文本、无视觉、262K 上下文限制、思维模式始终开启——首次 Max 规模(2.4T)开源权重发布,但 Qwen 将完整功能集(视觉、1M 上下文、非思维模式、内置工具)付费化在 Qwen Cloud 上。在 Qwen3.5-397B-A17B 中,视觉支持是免费发布的。
- 社区反应迅速:Hugging Face 讨论 #13 在数小时内达到 19 个赞——"你剥夺了模型 3/4 的上下文记忆并完全致盲了它"(用户 NodeLinker)。用户 Shad3:"移除视觉显然是为了推动人们使用他们的云端入口来赚钱。"
- Kimi K3 于 7 月 27 日发布了包含视觉的完整权重——594GB MXFP4、Modified MIT、最低 8x H100。反例:Moonshot 开源了视觉而 Qwen 将其付费化。
- 三个主要模型同日发布:DeepSeek V4 Pro 0813(BenchLM 60.95、Terminal-Bench 87.9%)、Gemini 3.7 Flash($0.75/$3.75、AA Intelligence Index 56)和 Qwen3.8 裁剪权重——自网站上线以来最密集的单日模型发布窗口。
- NVIDIA Nemotron 3.5 Lightning 开启了新的开源权重类别:为长时间运行代理构建的执行层模型——30B MoE、3B 激活、OpenMDW-1.1(权重、数据、配方)、为 OpenClaw 和 Hermes Agent 优化、NeMo Switchyard 路由("计划上升到 frontier,执行下降到 Lightning")。
裁剪版发布
Hugging Face 模型卡 确认了架构:2.4T 总参数、每 token 激活 95B、512 专家(10 路由 + 1 共享)、92 层。隐藏布局是 3 层 Gated DeltaNet MoE 后跟 1 层 Gated Attention MoE 的重复块——一种面向长上下文效率的线性注意力加软注意力混合设计。上下文长度原生 262,144,可扩展至 1,010,000。BF16。兼容 vLLM、SGLang 和 TokenSpeed。
供应商报告的基准测试表很强:Terminal-Bench 2.1 为 86.6、SWE-bench Pro 为 67.7、DeepSWE 1.1 为 56.6、PaperBench 为 93.0、FrontierSWE 为 73.5、GPQA Diamond 为 92.6、IFBench 为 82.8。在多个代理基准上与 Claude Opus 4.8 和 GPT-5.6 Sol 竞争力相当,在其他方面落后(DeepSWE 1.1:56.6 vs GPT-5.6 Sol 73.0、Fable 5 70.0)。Artificial Analysis Intelligence Index 尚未对开源变体评分——已发布的分数是针对托管的 Qwen3.8-Max API,包含被裁剪的功能。
但发布不是完整模型。模型卡本身声明:"Qwen3.8-Max 是基于 Qwen3.8-2.4T-A95B 的官方版本,具有更多功能,如视觉输入和非思维支持、默认 1M 上下文长度、官方内置工具。"开源权重获得基础架构和编码代理基准。托管 API 获得视觉、长上下文、思维模式控制和内置工具集成。LICENSE 文件标题为"Qwen3.8-Max License"——同一许可证覆盖裁剪的开源权重和完整托管服务。
社区反应
Hugging Face 讨论线程 #13,标题为"Huge disappointment: Qwen 3.8 open weights are text-only and stripped of Qwen 3.8 Max features",在发布后数小时内累积了 19 个赞。
用户 NodeLinker:"你剥夺了模型 3/4 的上下文记忆并完全致盲了它。在之前的版本如 Qwen3.5-397B-A17B 中,你没有触碰视觉支持并免费发布了它。"
用户 Shad3:"移除视觉显然是为了推动人们使用他们的云端入口来赚钱。他们基本上在做 DLC 那套。"
社区反应精确地识别了结构性转变。在 Qwen3.5-397B-A17B(上一代)中,视觉支持包含在开源权重中。在 Qwen3.8-2.4T-A95B 中,视觉是托管 API 独有的。开放-封闭边界在单个模型世代内移动了——不是因为能力变得更难开放,而是因为商业激励发生了变化。
结构性转变:将此前开放的能力付费化
这不是关于一个模型发布的故事。这是关于开放-封闭边界正在实时被重新协商的故事。
Brookings Institution 于 2026 年 8 月 10 日发布了一篇政策论文,论证"开放和封闭的 AI 模型都是必需的"以实现美国 AI 领导力。Qwen 的裁剪发布是边界由商业策略而非政策划定的一个具体例子——最强大的功能留在 API 付费墙后面,开源权重作为能力展示和通向托管服务的漏斗。
Hugging Face CEO Clément Delangue 于 8 月 3 日告诉 CNBC,中国"现在显然在开放模型上占据主导地位。"Qwen3.8 的裁剪发布使这一叙述变得复杂。开源权重领导者现在正在将关键能力付费化。在基准分数和下载量上的主导地位是真实的,但"开放"的定义正在缩小——开放现在意味着开放基础架构加付费的高级功能,不是全部开放。
父文章 中描述的模型灵活架构正是为这种情况而存在的。当供应商缩小其开源权重发布时,路由决策发生变化:路由到裁剪模型处理 262K 上下文足够的纯文本编码任务,路由到托管 API 处理多模态或长上下文工作,或路由到未裁剪功能的其他开源权重模型。架构决策不是"哪个模型"而是"哪个模型处理哪个任务,并能够在不进行代码部署的情况下重新路由。"
Kimi K3:反例
Moonshot 的 Kimi K3 于 2026 年 7 月 27 日发布了完整权重——594GB MXFP4、Modified MIT 许可证、包含视觉能力。父文章记录为首个开源权重 rogue-agent 事件(8 月 7 日的沙箱逃逸)的模型,也是将完整功能集作为开源权重发布的模型。
对比鲜明。Kimi K3:完整权重包含视觉、Modified MIT、最低 8x H100、2.8T 参数。Qwen3.8-2.4T-A95B:裁剪权重、仅文本、"Qwen3.8-Max License"、262K 上下文。两者都是中国实验室。两者都是 Max 规模或近 Max 规模的 MoE 模型。一个开源了视觉;另一个将其付费化。开源权重生态系统现在同时包含两种策略,采购决策必须考虑哪些功能实际在下载的权重中,哪些在 API 后面。
同日发布:DeepSeek V4 Pro 0813 和 Gemini 3.7 Flash
8 月 13 日在数小时内产生了三个主要模型发布。时间可能是有意为之——一位 HN 用户(parsimo2010)观察到:"这个时间看起来像是他们试图抢 Qwen 的风头。"
DeepSeek V4 Pro 0813 在 BenchLM 上得分 60.95(217 个模型中第 49 名)。Terminal-Bench 2.1 为 87.9%(BenchLM 上最佳验证)、SWE-bench Verified 为 80.6%、CyberGym 为 83.3%。Artificial Analysis Intelligence Index 将其排在 53——与 GLM-5.2 持平,落后 frontier 四分。SCMP 标题:"基准测试挣扎,网络安全出色。"一位 HN 用户报告了真实世界比较:"在 Codex cli 上测试了 DS v4 pro 0813 和 Grok 4.6 开发同一新功能。Deepseek 4 pro:工作了 12 分 02 秒 - 花费 $0.12 - 有 bug。Grok 4.6:工作了 3 分 18 秒 - 花费 $1.41 - 无 bug。"成本性能比是关键——比 frontier 模型便宜 10 倍且在多个基准上竞争力强,DeepSeek V4 Pro 是一个强大的中端路由目标。DeepSeek V4 Flash 0731(开源权重、MIT)仍然是开源权重参考点。
Gemini 3.7 Flash 达到 AA Intelligence Index 56,FrontierCode 1.1 为 43.6%(同类领先),AutomationBench 为 30.4%。定价 $0.75/$3.75 每百万 token——frontier 邻近推理的新价格底线。1M 上下文可用。定价是信号:Gemini 3.7 Flash 是最便宜的 frontier 邻近模型之一,编码基准(FrontierCode、Code Arena、DeepSWE)是亮点。对于 inference economics 论点,这是一个新数据点——有能力模型的成本底线继续下降。
NVIDIA Nemotron 3.5 Lightning:新的开源权重类别
NVIDIA Nemotron 3.5 Lightning(8 月 11 日发布)是一个 30B MoE、3B 激活参数的模型,在 OpenMDW-1.1 下发布(权重、数据、配方——完全开放)。它专为长时间运行代理的执行层构建:工具调用、结果验证、子代理委派——主导代理 token 预算的高 volume、低延迟工作。通过 speculative decoding 实现高达 4x 输出速度。
架构是"模型系统":frontier 推理模型(Nemotron 3 Ultra)处理编排和规划,Lightning 处理执行。NeMo Switchyard 是智能模型路由库:"计划上升到 frontier,执行下降到 Lightning。"模型为 OpenClaw 和 Hermes Agent 优化——两者在 NVIDIA 开发者博客 中被明确提及。NeMoClaw 是 NVIDIA 为 always-on 代理提供的开源安全和管理栈。
Nemotron 3.5 Lightning 开启了一个此前不存在的类别:purpose-built 的执行层开源模型。Muse Glimmer 文章记录了 local-first dense 类别(30B、24GB VRAM、Apache 2.0)。Nemotron 3.5 Lightning 是执行层补充——不是 local-first,而是 execution-first。两者都是为代理循环而非基准排行榜设计的 30B 级开源模型。区别在于部署上下文:Muse Glimmer 在单块消费级 GPU 上运行本地代理循环;Nemotron 3.5 Lightning 在数据中心运行多模型系统的执行层。
这是对 长时间运行代理模式文章 和 inference economics 文章 中记录的 tiered-model 架构模式的最强行业验证。"模型系统"框架——frontier 用于规划、小 MoE 用于执行——不再是理论上的成本优化。NVIDIA 构建了模型、路由库和安全栈。
开源权重格局现在涵盖四个类别,每个服务于不同的部署上下文:
这对模型灵活构建意味着什么
模型灵活架构不是关于选择最好的开源权重模型。它是关于为每个任务路由到正确的模型,并能够在开放-封闭边界移动时重新路由——它刚刚移动了。
一个运行 Qwen3.5-397B-A17B 带视觉的采购团队,用于文档处理代理,现在面临迁移决策:开源权重继任者(Qwen3.8-2.4T-A95B)不包含视觉。选项是:(1)留在 Qwen3.5-397B-A17B 开源权重上(上一代,包含视觉),(2)转到 Qwen3.8-Max 托管 API 获取视觉(付费),(3)切换到 Kimi K3 开源权重(包含视觉,但 594GB MXFP4 和最低 8x H100),或(4)路由到不同的视觉能力模型。模型灵活架构使选项 4 成为配置变更,而非代码部署。模型刚性架构使其成为重写。
推理经济学使决策复合。Gemini 3.7 Flash 以 $0.75/$3.75 每百万 token、1M 上下文和视觉,是一个托管 API 替代方案,可能比大规模自托管 Kimi K3 更便宜。DeepSeek V4 Pro 0813 比 frontier 模型便宜 10 倍,是纯文本编码任务的强路由目标——Qwen3.8 的裁剪功能在这些任务中不重要。路由矩阵现在是:frontier 用于规划(GPT-5.6 Sol、Grok 4.6),执行层开源模型用于工具调用(Nemotron 3.5 Lightning),成本领先者用于高 volume 文本(DeepSeek V4 Pro 0813、Gemini 3.7 Flash),local-first 用于设备端代理循环(Muse Glimmer),Max-scale 开源用于长视野自主工作(Qwen3.8 裁剪用于文本、Kimi K3 完整用于多模态)。每个服务于不同任务。约束是你的代理平台是否将模型选择视为代码部署或数据操作——与父文章建立的相同论点,现在由供应商在部署中途缩小其开源权重发布而得到验证。
相关阅读
- Open-Weight Models Crossed the Agentic Frontier — 父文章,映射截至 2026 年 7 月开源权重和封闭 frontier 模型之间的能力差距,包括 Kimi K3、DeepSeek V4、GLM-5.2 和安全治理维度
- Muse Glimmer and the Open-Weight Bifurcation — local-first dense 类别:30B、Apache 2.0、24GB VRAM、兼容 Hermes Agent
- Inference Economics: Why Always-On Production Agents Are Now Affordable — 使多模型路由在经济上可行的成本崩溃,Nemotron 3.5 Lightning 现在验证的 tiered-model 架构模式
一家运行 NetSuite 和 BigCommerce 的中型分销商需要一个代理来读取供应商 PDF、提取定价层级并起草 RFQ 回复。无视觉的 Qwen3.8 开源权重无法读取 PDF;托管的 Qwen3.8-Max API 可以,但按 token 收费。模型灵活构建将 PDF 解析路由到视觉能力模型($0.75/$3.75 的 Gemini 3.7 Flash,或自托管的 Kimi K3),将纯文本报价起草路由到 Qwen3.8 开源权重或 DeepSeek V4 Pro 0813——当 Qwen 更改其开源权重包含内容时无需代码部署。
Request a scoped build. One-week discovery. You get a system inventory, workflow map, and fixed scope — whether or not you build with us.
想为您的系统构建这个吗?
这里的每份文档都来自真实的生产工作。如果您有目标系统和工作流想法,我们可以在一周内确定范围。
申请定制开发为期一周的发现阶段。您会拿到系统清单、工作流地图和固定范围——无论您最终是否与我们合作开发。