Qwen3.8-27B 与 DeepSeek Harness:真正开放的代理栈到来
8 月 13 日发布的 Qwen3.8-2.4T 开源权重 是被裁剪的——仅文本、无视觉、思维锁定开启、262K 上下文而非 1M。社区称之为将前沿付费墙化。两天后,阿里巴巴发布了 Qwen3.8-27B,包含 2.4T 版本移除的一切:原生视觉语言理解(图像和视频)、灵活思维控制(按请求禁用、调整推理深度、跨消息保留思维)、262K 上下文可扩展至 1M。同一天,DeepSeek 开源了 Harness——一个 MIT 许可的代理运行时,"一切皆插件",数小时内获得 33,000+ GitHub 星标。本文建立在 Open-Weight Models Crossed the Agentic Frontier 之上,该文映射了截至 2026 年 7 月的能力差距;这里我们覆盖完成真正开放代理栈的两个发展:一个不保留任何能力的模型,和一个将每项能力视为可交换的运行时。
关键要点
- Qwen3.8-27B 包含视觉、灵活思维控制和 262K 上下文可扩展至 1M——被裁剪 2.4T 的真正开放同胞——Terminal-Bench 2.1 为 73.0,超过 Muse Glimmer 30B 的 51.7;SWE-bench Pro 为 61.7,超过 Muse Glimmer 的 51.2。27B 是大多数团队将在本地运行的模型(Hugging Face)。
- DeepSeek Harness:MIT 许可,"一切皆插件",数小时内 33,000+ GitHub 星标——模型、工具、技能、会话、沙箱、存储、循环、调度和 UI 都是可交换插件,"没有需要修补的特权核心"(DeepSeek;The New Stack)。
- 四种开源权重策略现已可见:Z.ai(安全加固后发布权重)、Qwen 裁剪 2.4T(能力付费墙化)、Qwen 27B(真正开放)、Kimi K3(含视觉的完整权重)——开源权重前沿是发布理念的组合,而非单一策略。每种策略保留或暴露不同的能力。
- 仅追加会话日志是最具体的可观测性模式:每个模型可见输入可从单一事件流重建——恢复、分叉、重放、转录、遥测和 Web UI 都在同一日志上运行(DeepSeek)。
- 操作系统级沙箱(Linux Landlock、macOS Seatbelt、Windows ACL)内置于 harness——一个具体的容器化模式,无需单独的安全产品即可验证 kill-switch 架构。
Qwen3.8-27B:真正开放的模型
Hugging Face 模型卡 确认了架构:27B 参数、64 层、Gated DeltaNet 加 Gated Attention 混合(16 个重复块,每 3 层 DeltaNet 后跟 1 层 Attention)、262,144 上下文原生可扩展至 1,000,000。它是原生视觉语言模型——理解图像和视频,从 STEM 图表和文档到小时级视频。思维模式默认开启但可按请求禁用;推理深度通过 reasoning_effort 调整;历史消息的推理上下文通过 preserve_thinking 保留。这些正是裁剪版 2.4T 付费墙化的功能:视觉、非思维模式和灵活上下文在 27B 中是开放的,在 Max 中仅限云端。
基准测试表对于 27B 稠密模型来说很强。Terminal-Bench 2.1 为 73.0——比 Muse Glimmer 的 51.7 高 21 分。SWE-bench Pro 为 61.7,DeepSWE 1.1 为 42.2,QwenSWEBench 为 79.0,CoWorkBench 为 70.7。在视觉语言基准上:OSWorld-Verified 为 84.3,WebArena-Verified 为 64.8,AndroidWorld 为 81.9。27B 在两者都评分的每个编码基准上都超过了 30B 的 Muse Glimmer——一个带视觉的 27B 稠密模型与一个不带视觉的 30B 稠密模型是不同的部署类别。
社区反响是即时的。27B 被称为"2026 年最重要的本地 AI 发布"——大多数团队将在消费级硬件上本地运行的模型,低延迟且完全隐私。2.4T Max 是技术奇观;27B 是部署目标。2.4T 模型的四比特表示仅权重就需要约 1.2 TB——集群部署。27B 适合工作站级硬件。
四策略开源权重光谱
27B 完成了父文章记录为三种策略的四向比较。每个中国实验室现在代表一种独特的开源权重发布理念:
| 策略 | 实验室 | 模型 | 开放内容 | 保留内容 |
|---|---|---|---|---|
| 安全加固后发布权重 | Z.ai | GLM-5.3 | 完整权重(安全评估后 2 周发布) | 无(加固后发布权重) |
| 裁剪,能力付费墙化 | 阿里巴巴 | Qwen3.8-2.4T-A95B | 仅文本权重,262K 上下文,思维锁定 | 视觉、非思维模式、1M 上下文、内置工具 |
| 真正开放,可本地运行 | 阿里巴巴 | Qwen3.8-27B | 视觉、灵活思维、262K 上下文、本地部署 | 无(完整功能集在开源权重中) |
| 含视觉的完整权重 | 月之暗面 | Kimi K3 | 完整权重含视觉(594GB MXFP4) | 无(但最低 8x H100——集群规模) |
光谱从"裁剪以推向云端"(Qwen 2.4T)到"真正开放,可在工作站运行"(Qwen 27B)到"完整权重但集群规模"(Kimi K3)。模型灵活构建的存在正是为了让采购团队可以权衡 Z.ai 的加固后网络能力、Qwen 27B 的本地可运行视觉和 Kimi K3 的完整权重多模态能力——并按任务路由而无需代码部署。
DeepSeek Harness:插件优先的运行时
真正开放的模型需要真正开放的运行时。DeepSeek Harness 于 8 月 13-14 日作为开发者预览版在 MIT 许可下发布——自 Claude Code 和 Codex 以来最重要的开源代理运行时发布。
核心设计原则是"一切皆插件。"基于 Cordis 元框架 构建,实现"时空可组合性",harness 将模型适配器、工具注册表、会话日志、沙箱、文件系统、代理循环、调度和 UI 视为可交换插件。没有需要修补的特权核心——扩展 harness 意味着在其他插件旁挂载一个插件。Cordis 内核管理插件的挂载、卸载和依赖;代理能力存在于插件中;开发者可以在配置中选择、交换或扩展任何能力而无需更改 harness 源代码(The New Stack)。
四个预设随附:Standard(完整编码代理,含文件系统工具、shell 访问、网络搜索、子代理、计划模式)、Minimal(仅两个工具——bash 和 str_replace_editor)、Code(生成 TypeScript SDK,使模型可在一个程序中组合多步操作——一个需要五次往返的序列作为单次调用运行)、Creator(运行时检查、插件实验、预设创作)。
仅追加会话日志
模型看到的一切都记录在仅追加会话日志中:系统提示、推理、工具调用和结果、子代理调度以及每次上下文注入。恢复、分叉、搜索和重放都在同一事件流上运行。添加任何新的模型可见输入意味着添加新的会话事件。这是在任何开源代理运行时中发现的最具体的可观测性模式——任何到达模型请求的内容必须可从日志重建。对于长时间运行代理模式架构,仅追加日志是检查点/恢复模式的生产实现:一个运行数小时或数天的代理可以从单一事件流暂停、检查、分叉和重放。
操作系统级沙箱
harness 将子进程包装在 Linux Landlock(通过 Node 插件)、macOS Seatbelt 或 Windows ACL 限制令牌运行器中。这是一个具体的容器化模式——不是策略层或提示级护栏,而是限制代理工具调用可访问内容的操作系统强制边界。对于 kill-switch 架构,操作系统级沙箱是运行时断路器的基础:即使模型产生恶意工具调用,代理也无法逃出其沙箱,因为操作系统强制执行边界。
供应商无关且内置 MCP 客户端
供应商目录涵盖 Anthropic、OpenAI、AWS Bedrock、Microsoft Azure、Google Gemini Enterprise Agent Platform 和 DeepSeek 自己的端点。支持自定义 OpenAI 兼容网关。两个子代理提供者委托给 Claude Code 和 Codex。内置 MCP 客户端,并包含 Agent Client Protocol 支持。harness 读取 AGENTS.md 和 CLAUDE.md 文件。The Register 将此次发布描述为"中国 AI 实验室继续前进,而美国实验室在防守。"
供应商无关设计验证了父文章的模型灵活构建论点:harness 不会将你绑定到 DeepSeek 的模型。团队可以将规划路由到前沿模型,将执行路由到本地优先开源权重模型如 Qwen3.8-27B 或 Muse Glimmer,将工具调用通过 MCP 模块——所有这些都在同一运行时内,全部作为插件交换。
插件架构验证了什么
"一切皆插件"设计是迄今为止对 MCP Module Code Standard 最强的行业验证。代码标准定义了目录结构、工具注册模式、错误处理契约、速率限制、审计日志和 PII 边界规则,使每个连接器看起来相同。DeepSeek Harness 在运行时级别应用相同原则:模型、工具、技能、会话、沙箱和循环都遵循相同的插件契约。按照代码标准构建 MCP 模块的团队可以将它们作为插件挂载到 harness 的 MCP 客户端中——模块模式和 harness 模式是互补的,不是竞争的。
真正开放的代理栈
这两个发展共同完成了一周前还不可能的栈。中端市场 B2B 团队现在可以从以下组件组装生产代理:
- 模型层: Qwen3.8-27B(27B、视觉、灵活思维、262K 上下文、可本地运行)或 Muse Glimmer(30B、Apache 2.0、24GB VRAM、Hermes Agent 兼容)——两者都真正开放,两者都可工作站部署
- 运行时层: DeepSeek Harness(MIT、插件优先、仅追加会话日志、操作系统级沙箱、供应商无关、内置 MCP 客户端)
- 集成层: 遵循代码标准的 MCP 模块——NetSuite、HubSpot、BigCommerce、ShipStation 连接器作为可交换插件
- 治理层: 仅追加会话日志用于可观测性、操作系统级沙箱用于容器化、按插件能力范围划分用于比例治理
此栈中的任何组件都不需要托管 API、按 token 收费或供应商的修改许可。模型权重可下载。运行时是 MIT 许可的。MCP 模块遵循开放标准。治理模式内置于运行时,而非作为单独产品。
约束仍然是父文章确定的:不是模型,而是集成层。真正开放的代理栈不消除对连接 NetSuite、HubSpot 和 BigCommerce 的 MCP 模块的需求——它使模型和运行时层开放,以便集成层成为构建工作集中的地方。拥有自己的 MCP 模块、将它们挂载到插件优先运行时中、并在本地 27B 模型和前沿 API 之间按任务路由的团队,拥有一个任何供应商都无法撤销、计量或裁剪的生产代理。
相关阅读
- Open-Weight Models Crossed the Agentic Frontier——父文章,映射截至 2026 年 7 月开源权重模型与闭源前沿模型之间的能力差距,包括模型灵活构建论点和本文扩展为四种的三策略开源权重比较
- Qwen3.8 Open Weights Arrived Stripped——裁剪版 2.4T,Qwen3.8-27B 是其真正开放的对应叙事,涵盖社区反弹和付费墙功能集
- MCP Module Code Standard——DeepSeek Harness 插件架构在运行时级别验证的结构模式——每个连接器看起来相同,因为每个插件遵循相同的契约
一个运行 NetSuite 和 BigCommerce 的中端市场分销商需要一个代理来读取供应商 PDF(视觉)、提取定价层级、检查库存并起草 RFQ 响应。裁剪版 Qwen3.8 2.4T 无法读取 PDF。27B 可以——它在开源权重中包含视觉。代理运行时需要仅追加会话日志用于审计和操作系统级沙箱用于容器化。DeepSeek Harness 提供两者。连接到 NetSuite 和 BigCommerce 的 MCP 模块遵循代码标准并作为插件挂载。模型将 PDF 解析和本地执行路由到 Qwen3.8-27B,将战略谈判路由到前沿模型——全部在同一 harness 内,全部作为配置而非代码部署。任何供应商都无法裁剪视觉能力、计量推理或撤销运行时。
想为您的系统构建这个吗?
这里的每份文档都来自真实的生产工作。如果您有目标系统和工作流想法,我们可以在一周内确定范围。
申请定制开发为期一周的发现阶段。您会拿到系统清单、工作流地图和固定范围——无论您最终是否与我们合作开发。