Volver a la Biblioteca
Estrategia

Qwen3.8-27B y DeepSeek Harness: La pila de agentes genuinamente abierta llega

Última actualización: 14 de agosto de 2026

Los pesos abiertos de Qwen3.8-2.4T que llegaron el 13 de agosto fueron recortados — solo texto, sin visión, thinking bloqueado, contexto de 262K en lugar de 1M. La comunidad lo llamó paywalling the frontier. Dos días después, Alibaba publicó Qwen3.8-27B con todo lo que la versión 2.4T eliminó: comprensión nativa de lenguaje visual (imágenes y video), control flexible de pensamiento (desactivar por solicitud, ajustar profundidad de razonamiento, preservar pensamiento entre mensajes), contexto de 262K extensible a 1M. Y el mismo día, DeepSeek abrió el código del Harness — un runtime de agentes con licencia MIT donde "todo es un plugin," alcanzando 33,000+ estrellas en GitHub en horas. Este artículo se basa en Open-Weight Models Crossed the Agentic Frontier, que mapeó la brecha de capacidades hasta julio de 2026; aquí cubrimos los dos desarrollos que completan la pila de agentes genuinamente abierta: un modelo que no retiene nada y un runtime que trata cada capacidad como intercambiable.

Puntos clave

  • Qwen3.8-27B incluye visión, control de pensamiento flexible y contexto de 262K extensible a 1M — el hermano genuinamente abierto del 2.4T recortado — Terminal-Bench 2.1 en 73.0 supera a Muse Glimmer 30B en 51.7, y SWE-bench Pro en 61.7 supera a Muse Glimmer en 51.2. El 27B es el modelo que la mayoría de los equipos ejecutará localmente (Hugging Face).
  • DeepSeek Harness: licencia MIT, "todo es un plugin," 33,000+ estrellas en GitHub en horas — modelos, herramientas, skills, sesiones, sandboxes, almacenamiento, loops, scheduling y UI son todos plugins intercambiables con "sin núcleo privilegiado que parchear" (DeepSeek; The New Stack).
  • Cuatro estrategias de pesos abiertos ahora visibles: Z.ai (pesos tras hardening de seguridad), Qwen 2.4T recortado (capacidades de pago), Qwen 27B (genuinamente abierto), Kimi K3 (pesos completos con visión) — la frontera de pesos abiertos es un portafolio de filosofías de liberación, no una sola estrategia. Cada una retiene o expone diferentes capacidades.
  • El registro de sesión append-only es el patrón de observabilidad más concreto encontrado: cada entrada visible para el modelo es reconstruible desde un único flujo de eventos — resume, fork, replay, transcripciones, telemetría y UI web operan todos sobre el mismo registro (DeepSeek).
  • Sandboxing a nivel de SO (Linux Landlock, macOS Seatbelt, Windows ACL) se incluye en el harness — un patrón de contención concreto que valida la arquitectura kill-switch sin requerir un producto de seguridad separado.

Qwen3.8-27B: el modelo genuinamente abierto

La tarjeta del modelo en Hugging Face confirma la arquitectura: 27B parámetros, 64 capas, híbrido Gated DeltaNet más Gated Attention (16 bloques repetidos de 3 capas DeltaNet seguidas de 1 capa Attention), 262,144 de contexto nativamente extensible a 1,000,000. Es un modelo nativo de lenguaje visual — comprende imágenes y videos, desde diagramas STEM y documentos hasta video de duración de horas. El modo thinking está activado por defecto pero puede desactivarse por solicitud; la profundidad de razonamiento es ajustable vía reasoning_effort; y el contexto de razonamiento de mensajes históricos se conserva vía preserve_thinking. Estas son las características exactas que la versión recortada 2.4T puso tras pago: visión, modo non-thinking y contexto flexible son abiertos en el 27B y solo en la nube en el Max.

La tabla de benchmarks es fuerte para un modelo denso de 27B. Terminal-Bench 2.1 en 73.0 — 21 puntos por encima de Muse Glimmer en 51.7. SWE-bench Pro en 61.7, DeepSWE 1.1 en 42.2, QwenSWEBench en 79.0, CoWorkBench en 70.7. En benchmarks de lenguaje visual: OSWorld-Verified en 84.3, WebArena-Verified en 64.8, AndroidWorld en 81.9. El 27B supera al Muse Glimmer 30B en cada benchmark de codificación donde ambos son evaluados — un modelo denso de 27B con visión es una categoría de despliegue diferente de un modelo denso de 30B sin visión.

La recepción de la comunidad fue inmediata. El 27B fue llamado "el lanzamiento local de IA más importante de 2026" — el modelo que la mayoría de los equipos ejecutará localmente en hardware de consumo con baja latencia y privacidad total. El 2.4T Max es el espectáculo tecnológico; el 27B es el objetivo de despliegue. Una representación de cuatro bits del modelo 2.4T requiere aproximadamente 1.2 terabytes solo para los pesos — un despliegue de cluster. El 27B cabe en hardware de clase workstation.

El espectro de cuatro estrategias de pesos abiertos

El 27B completa una comparación de cuatro vías que el artículo principal documentó como tres estrategias. Cada labor chino representa ahora una filosofía de liberación de pesos abiertos distinta:

Estrategia Lab Modelo Lo que es abierto Lo que se retiene
Pesos tras hardening de seguridad Z.ai GLM-5.3 Pesos completos (pendiente 2 semanas para evaluación de seguridad) Nada (pesos liberados tras hardening)
Recortado, capacidades de pago Alibaba Qwen3.8-2.4T-A95B Pesos solo texto, contexto 262K, thinking bloqueado Visión, modo non-thinking, contexto 1M, herramientas integradas
Genuinamente abierto, ejecutable local Alibaba Qwen3.8-27B Visión, pensamiento flexible, contexto 262K, despliegue local Nada (conjunto completo de características en pesos abiertos)
Pesos completos con visión Moonshot Kimi K3 Pesos completos incluyendo visión (594GB MXFP4) Nada (pero mínimo 8x H100 — escala de cluster)

El espectro va de "recortado para empujarte a la nube" (Qwen 2.4T) a "genuinamente abierto, ejecutable en workstation" (Qwen 27B) a "pesos completos pero escala de cluster" (Kimi K3). La construcción model-flexible existe precisamente para que un equipo de aprovisionamiento pueda sopesar la capacidad cyber post-hardening de Z.ai, la visión ejecutable local del Qwen 27B y la capacidad multimodal de pesos completos del Kimi K3 — y enrutar por tarea sin un despliegue de código.

The Genuinely-Open Agent Stack Four open-weight strategies + plugin-first runtime = production agent with no vendor lock-in FOUR OPEN-WEIGHT STRATEGIES Z.ai GLM-5.3 Weights after hardening Open: full weights (pending 2wk) Withheld: nothing CyberGym 84.5% (leading) 2,436 vulns disclosed Qwen 2.4T-A95B Stripped, paywalled Open: text-only, 262K ctx Withheld: vision, 1M ctx, thinking off Community backlash Cluster-scale deployment Qwen 3.8-27B Genuinely open Open: vision, thinking ctrl, 262K+ Withheld: nothing Terminal-Bench 73.0 Workstation-deployable Kimi K3 Full weights, cluster-scale Open: full weights + vision Withheld: nothing 594GB MXFP4 8x H100 minimum GENUINELY-OPEN AGENT STACK Model Layer Qwen3.8-27B (27B, vision, flexible thinking) or Muse Glimmer (30B, Apache 2.0, 24GB VRAM) Genuinely open, workstation-deployable, no per-token charge, no vendor can strip capabilities Runtime Layer DeepSeek Harness (MIT, plugin-first, append-only session log, OS-level sandboxing) 33K+ GitHub stars, provider-agnostic, MCP client built in, Landlock/Seatbelt/Windows ACL Integration Layer MCP modules (NetSuite, HubSpot, BigCommerce, ShipStation) following the code standard Open standard, swappable plugins, same directory structure and error contract across connectors Governance Layer Append-only session log (observability) + OS-level sandboxing (containment) + per-plugin scoping Ships in the runtime, not as a separate product. Resume, fork, replay from a single event stream. No managed API required. No per-token charge. No vendor permission to modify. The binding constraint is the integration layer — where the build effort concentrates. Sources: Hugging Face Qwen3.8-27B model card, DeepSeek Harness, The New Stack, The Register

DeepSeek Harness: el runtime plugin-first

El modelo genuinamente abierto necesita un runtime genuinamente abierto. DeepSeek Harness se publicó el 13-14 de agosto como developer preview bajo licencia MIT — el lanzamiento de runtime de agentes de código abierto más significativo desde Claude Code y Codex.

El principio de diseño central es "todo es un plugin." Construido sobre el meta-framework Cordis para "componibilidad espacio-temporal," el harness trata el adaptador de modelo, el registro de herramientas, el registro de sesión, el sandbox, el sistema de archivos, el loop del agente, el scheduling y la UI como plugins intercambiables. No hay núcleo privilegiado que parchear — extender el harness significa montar un plugin junto a los demás. El kernel de Cordis gestiona el montaje, desmontaje y dependencias de plugins; las capacidades del agente viven en los plugins; y los desarrolladores seleccionan, intercambian o extienden cualquier capacidad en configuración sin cambiar el código fuente del harness (The New Stack).

Cuatro presets se incluyen: Standard (agente de codificación completo con herramientas de sistema de archivos, acceso shell, búsqueda web, subagentes, modo plan), Minimal (solo dos herramientas — bash y str_replace_editor), Code (genera un SDK de TypeScript para que el modelo combine operaciones multi-paso en un programa — una secuencia que tomaría cinco viajes de ida y vuelta se ejecuta como una sola llamada), y Creator (inspección de runtime, experimentos de plugins, creación de presets).

Registro de sesión append-only

Todo lo que el modelo ve se registra en un registro de sesión append-only: prompts del sistema, razonamiento, llamadas a herramientas y resultados, scheduling de subagentes y cada inyección de contexto. Resume, fork, search y replay operan todos sobre el mismo flujo de eventos. Añadir cualquier nueva entrada visible para el modelo significa añadir un nuevo evento de sesión. Este es el patrón de observabilidad más concreto encontrado en cualquier runtime de agentes de código abierto — cualquier cosa que llegue a una solicitud del modelo debe ser reconstruible desde el registro. Para la arquitectura de patrones de agentes de larga duración, el registro append-only es la implementación de producción del patrón checkpoint/resume: un agente que funciona durante horas o días puede pausarse, inspeccionarse, bifurcarse y reproducirse desde un único flujo de eventos.

Sandboxing a nivel de SO

El harness envuelve subprocesos en Linux Landlock (a través de un addon de Node), macOS Seatbelt, o un runner de Windows ACL con token restringido. Este es un patrón de contención concreto — no una capa de política o un guardrail a nivel de prompt, sino un límite de aplicación a nivel de sistema operativo que limita lo que las llamadas a herramientas del agente pueden acceder. Para la arquitectura kill-switch, el sandboxing a nivel de SO es la base del circuit breaker de runtime: el agente no puede escapar de su sandbox incluso si el modelo produce una llamada a herramienta maliciosa, porque el sistema operativo aplica el límite.

Agnóstico de proveedor con cliente MCP

El catálogo de proveedores cubre Anthropic, OpenAI, AWS Bedrock, Microsoft Azure, Google Gemini Enterprise Agent Platform y el endpoint propio de DeepSeek. Se soportan gateways compatibles con OpenAI personalizados. Dos proveedores de subagentes delegan a Claude Code y Codex. Un cliente MCP está integrado, y se incluye soporte para Agent Client Protocol. El harness lee archivos AGENTS.md y CLAUDE.md. The Register enmarcó el lanzamiento como "los laboratorios chinos de IA siguen avanzando mientras los laboratorios estadounidenses juegan a la defensiva."

El diseño agnóstico de proveedor valida la tesis de construcción model-flexible del artículo principal: el harness no te ata a los modelos de DeepSeek. Un equipo puede enrutar la planificación a un modelo frontier, la ejecución a un modelo de pesos abiertos local-first como Qwen3.8-27B o Muse Glimmer, y las llamadas a herramientas a través de módulos MCP — todo dentro del mismo runtime, todo como intercambios de plugins.

Lo que valida la arquitectura de plugins

El diseño de "todo es un plugin" es la validación más fuerte de la industria hasta la fecha del MCP Module Code Standard. El estándar de código define una estructura de directorios, patrón de registro de herramientas, contrato de manejo de errores, rate limiting, registro de auditoría y reglas de límite de PII para que cada conector se vea igual. DeepSeek Harness aplica el mismo principio a nivel de runtime: modelos, herramientas, skills, sesiones, sandboxes y loops siguen todos el mismo contrato de plugin. Un equipo que construye módulos MCP según el estándar de código puede montarlos en el cliente MCP del harness como plugins — el patrón de módulo y el patrón de harness son complementarios, no competidores.

La pila de agentes genuinamente abierta

Los dos desarrollos juntos completan una pila que no era posible hace una semana. Un equipo B2B de mercado intermedio puede ahora ensamblar un agente de producción con:

  1. Capa de modelo: Qwen3.8-27B (27B, visión, pensamiento flexible, contexto 262K, ejecutable local) o Muse Glimmer (30B, Apache 2.0, 24GB VRAM, compatible con Hermes Agent) — ambos genuinamente abiertos, ambos desplegables en workstation
  2. Capa de runtime: DeepSeek Harness (MIT, plugin-first, registro de sesión append-only, sandboxing a nivel de SO, agnóstico de proveedor, cliente MCP integrado)
  3. Capa de integración: módulos MCP siguiendo el estándar de código — conectores NetSuite, HubSpot, BigCommerce, ShipStation como plugins intercambiables
  4. Capa de gobernanza: registro de sesión append-only para observabilidad, sandboxing a nivel de SO para contención, scoping de capacidades por plugin para gobernanza proporcional

Ningún componente en esta pila requiere una API gestionada, un cargo por token o el permiso de un proveedor para modificar. Los pesos del modelo son descargables. El runtime tiene licencia MIT. Los módulos MCP siguen un estándar abierto. Los patrones de gobernanza se incluyen en el runtime, no como un producto separado.

La restricción vinculante sigue siendo la que el artículo principal identificó: no el modelo, sino la capa de integración. La pila de agentes genuinamente abierta no elimina la necesidad de módulos MCP que conecten a NetSuite, HubSpot y BigCommerce — hace que las capas de modelo y runtime sean abiertas para que la capa de integración sea donde se concentre el esfuerzo de construcción. Un equipo que posee sus módulos MCP, los monta en un runtime plugin-first y enruta entre un modelo local 27B y una API frontier por tarea tiene un agente de producción que ningún proveedor puede revocar, medir o recortar.

Lectura relacionada

  • Open-Weight Models Crossed the Agentic Frontier — el artículo principal, mapeando la brecha de capacidades entre modelos de pesos abiertos y modelos frontier cerrados hasta julio de 2026, incluyendo la tesis de construcción model-flexible y la comparación de tres estrategias de pesos abiertos que este artículo extiende a cuatro
  • Qwen3.8 Open Weights Arrived Stripped — la versión recortada 2.4T de la que Qwen3.8-27B es la contranarrativa genuinamente abierta, cubriendo la reacción de la comunidad y el conjunto de características de pago
  • MCP Module Code Standard — el patrón estructural que la arquitectura de plugins de DeepSeek Harness valida a nivel de runtime — cada conector se ve igual porque cada plugin sigue el mismo contrato

Un distribuidor de mercado intermedio que opera NetSuite y BigCommerce necesita un agente que lea PDFs de proveedores (visión), extraiga niveles de precios, verifique inventario y redacte respuestas RFQ. El Qwen3.8 2.4T recortado no puede leer los PDFs. El 27B puede — incluye visión en los pesos abiertos. El runtime del agente necesita un registro de sesión append-only para auditoría y sandboxing a nivel de SO para contención. DeepSeek Harness proporciona ambos. Los módulos MCP que conectan a NetSuite y BigCommerce siguen el estándar de código y se montan como plugins. El modelo enruta a Qwen3.8-27B para el análisis de PDF y ejecución local, y a un modelo frontier para la negociación estratégica — todo dentro del mismo harness, todo como configuración, no despliegue de código. Ningún proveedor puede recortar la capacidad de visión, medir la inferencia o revocar el runtime.

¿Quieres esto construido para tus sistemas?

Cada documento aquí viene de trabajo real de producción. Si tienes un sistema objetivo y un flujo en mente, podemos definir un proyecto en una semana.

Solicitar un proyecto

Descubrimiento de una semana. Obtienes un inventario de sistemas, mapa de flujos y alcance fijo — decidas o no construir con nosotros.