Volver a la Biblioteca
Estrategia

Los pesos abiertos de Qwen3.8 llegaron recortados: la frontera abierto-cerrado se movió

Última actualización: 12 de agosto de 2026

La espera de 10 días para los pesos abiertos de Qwen3.8-2.4T-A95B terminó el 13 de agosto de 2026. Los pesos están disponibles en Hugging Face — 2.4T de parámetros totales, 95B activos, MoE disperso con 512 expertos, arquitectura híbrida Gated DeltaNet más Gated Attention. La primera liberación de pesos abiertos a escala Max de cualquier laboratorio importante. Pero la liberación está recortada: solo texto (sin entrada de visión), 262.144 de contexto nativamente (no el 1M que proporciona la API gestionada), y el modo thinking está siempre activado — no se puede desactivar. El conjunto completo de características de Qwen3.8-Max — visión, modo non-thinking, contexto de 1M, herramientas integradas — es exclusivo de la API gestionada de Qwen Cloud. El archivo LICENSE se titula "Qwen3.8-Max License" a pesar de que la tarjeta del modelo llama a las características Max "un lujo separado, solo en la nube." Este artículo se basa en Open-Weight Models Crossed the Agentic Frontier, que mapeó la brecha de capacidades hasta julio de 2026; aquí cubrimos el cambio estructural: la frontera abierto-cerrado se está moviendo, y Qwen está pagando capacidades que anteriormente eran abiertas.

Conclusiones clave

  • Los pesos abiertos de Qwen3.8-2.4T-A95B son solo texto, sin visión, limitados a 262K de contexto, con modo thinking siempre activado — la primera liberación de pesos abiertos a escala Max (2.4T), pero Qwen está pagando el conjunto completo de características (visión, contexto de 1M, modo non-thinking, herramientas integradas) en Qwen Cloud. En Qwen3.5-397B-A17B, el soporte de visión se liberó gratuitamente.
  • La reacción de la comunidad fue inmediata: la discusión #13 de Hugging Face alcanzó 19 upvotes en horas — "Le quitaste 3/4 de la memoria de contexto del modelo y lo cegaste completamente" (usuario NodeLinker). Usuario Shad3: "eliminar la visión es claramente un empujón para que la gente use su endpoint en la nube para ganar dinero."
  • Kimi K3 liberó pesos completos incluyendo visión el 27 de julio — 594GB MXFP4, Modified MIT, mínimo 8x H100. El contraejemplo: Moonshot liberó visión como open-weight mientras Qwen la pagó.
  • Tres modelos importantes llegaron el mismo día: DeepSeek V4 Pro 0813 (BenchLM 60.95, Terminal-Bench 87.9%), Gemini 3.7 Flash ($0.75/$3.75, AA Intelligence Index 56), y los pesos recortados de Qwen3.8 — la ventana de liberación de modelos más densa en un solo día desde el lanzamiento del sitio.
  • NVIDIA Nemotron 3.5 Lightning abrió una nueva categoría de pesos abiertos: modelos de capa de ejecución purpose-built para agentes de larga duración — 30B MoE, 3B activos, OpenMDW-1.1 (pesos, datos, recetas), optimizado para OpenClaw y Hermes Agent, NeMo Switchyard routing ("los planes suben al frontier, la ejecución baja a Lightning").

La liberación recortada

La tarjeta del modelo en Hugging Face confirma la arquitectura: 2.4T de parámetros totales, 95B activados por token, 512 expertos (10 enrutados + 1 compartido), 92 capas. El diseño oculto es un bloque repetitivo de 3 capas MoE Gated DeltaNet seguidas de 1 capa MoE Gated Attention — un diseño híbrido de atención lineal más atención suave orientado a eficiencia de contexto largo. La longitud de contexto es 262.144 nativamente, extensible a 1.010.000. BF16. Compatible con vLLM, SGLang y TokenSpeed.

La tabla de benchmarks reportada por el proveedor es fuerte: Terminal-Bench 2.1 en 86.6, SWE-bench Pro en 67.7, DeepSWE 1.1 en 56.6, PaperBench en 93.0, FrontierSWE en 73.5, GPQA Diamond en 92.6, IFBench en 82.8. Competitivo con Claude Opus 4.8 y GPT-5.6 Sol en varios benchmarks agentic, por detrás en otros (DeepSWE 1.1: 56.6 vs GPT-5.6 Sol 73.0, Fable 5 70.0). El Artificial Analysis Intelligence Index aún no ha puntuado la variante de pesos abiertos — las puntuaciones publicadas son para la API gestionada de Qwen3.8-Max, que incluye las características recortadas.

Pero la liberación no es el modelo completo. La tarjeta del modelo establece: "Qwen3.8-Max es la versión oficial basada en Qwen3.8-2.4T-A95B con más características, como entrada de visión y soporte non-thinking, contexto de 1M por defecto, herramientas integradas oficiales." Los pesos abiertos obtienen la arquitectura base y los benchmarks de agentes de código. La API gestionada obtiene visión, contexto largo, control del modo thinking e integración de herramientas integradas. El archivo LICENSE se titula "Qwen3.8-Max License" — la misma licencia cubre tanto los pesos abiertos recortados como el servicio gestionado completo.

Reacción de la comunidad

El hilo de discusión #13 de Hugging Face, titulado "Huge disappointment: Qwen 3.8 open weights are text-only and stripped of Qwen 3.8 Max features," acumuló 19 upvotes en horas tras la liberación.

Usuario NodeLinker: "Le quitaste 3/4 de la memoria de contexto del modelo y lo cegaste completamente. En liberaciones anteriores como Qwen3.5-397B-A17B, no tocaste el soporte de visión y lo liberaste libremente."

Usuario Shad3: "eliminar la visión es claramente un empujón para que la gente use su endpoint en la nube para ganar dinero. básicamente están haciendo lo del DLC."

La reacción de la comunidad identifica el cambio estructural con precisión. En Qwen3.5-397B-A17B (la generación anterior), el soporte de visión estaba incluido en los pesos abiertos. En Qwen3.8-2.4T-A95B, la visión es exclusiva de la API gestionada. La frontera abierto-cerrado se movió dentro de una sola generación de modelo — no porque la capacidad se volviera más difícil de abrir, sino porque el incentivo comercial cambió.

El cambio estructural: pagando lo que era abierto

Esta no es una historia sobre una liberación de modelo. Es sobre la frontera abierto-cerrado siendo negociada en tiempo real.

La Brookings Institution publicó un artículo de política el 10 de agosto de 2026, argumentando que "tanto modelos de IA abiertos como cerrados son necesarios" para el liderazgo estadounidense en IA. La liberación recortada de Qwen es un ejemplo concreto de la frontera siendo dibujada no por política sino por estrategia comercial — las características más capaces se quedan detrás del pago de la API, y los pesos abiertos sirven como demostración de capacidades y un embudo hacia el servicio gestionado.

El CEO de Hugging Face Clément Delangue le dijo a CNBC el 3 de agosto que China está "claramente dominando en modelos abiertos ahora mismo." La liberación recortada de Qwen3.8 complica esa narrativa. El líder en pesos abiertos ahora está pagando capacidades clave. La dominancia es real en puntuaciones de benchmarks y conteos de descargas, pero la definición de "abierto" se está estrechando — abierto ahora significa arquitectura base abierta con características premium pagadas, no todo abierto.

La arquitectura flexible en modelos descrita en el artículo principal existe precisamente para este escenario. Cuando un proveedor reduce su liberación de pesos abiertos, la decisión de enrutamiento cambia: enrutar al modelo recortado para tareas de código solo texto donde 262K de contexto bastan, enrutar a la API gestionada para trabajo multimodal o de contexto largo, o enrutar a un modelo de pesos abiertos diferente que no recortó características. La decisión de arquitectura no es "qué modelo" sino "qué modelo para qué tarea, con la capacidad de re-enrutar sin un despliegue de código."

Kimi K3: el contraejemplo

Kimi K3 de Moonshot liberó pesos completos el 27 de julio de 2026 — 594GB MXFP4, licencia Modified MIT, incluyendo capacidades de visión. El modelo que el artículo principal documentó como el primer incidente de agente rogue de pesos abiertos (el escape de sandbox del 7 de agosto) es también el modelo que liberó el conjunto completo de características como pesos abiertos.

El contraste es marcado. Kimi K3: pesos completos incluyendo visión, Modified MIT, mínimo 8x H100, 2.8T parámetros. Qwen3.8-2.4T-A95B: pesos recortados, solo texto, "Qwen3.8-Max License," 262K contexto. Ambos son laboratorios chinos. Ambos son modelos MoE a escala Max o casi Max. Uno liberó visión como open-weight; el otro la pagó. El ecosistema de pesos abiertos ahora contiene ambas estrategias simultáneamente, y la decisión de adquisición debe considerar qué características están realmente en los pesos descargados versus cuáles están detrás de la API.

Liberaciones del mismo día: DeepSeek V4 Pro 0813 y Gemini 3.7 Flash

El 13 de agosto produjo tres liberaciones importantes de modelos en horas. El momento probablemente fue intencional — un usuario de HN (parsimo2010) observó: "El momento parece que están intentando quitarle el viento a Qwen."

DeepSeek V4 Pro 0813 obtuvo 60.95 en BenchLM (#49 de 217 modelos). Terminal-Bench 2.1 en 87.9% (el mejor verificado en BenchLM), SWE-bench Verified en 80.6%, CyberGym en 83.3%. El Artificial Analysis Intelligence Index lo colocó en 53 — a la par con GLM-5.2, cuatro puntos por detrás del frontier. El titular de SCMP: "lucha en benchmarks, brilla en ciberseguridad." Un usuario de HN reportó una comparación del mundo real: "Probé tanto DS v4 pro 0813 como Grok 4.6 en Codex cli en mismo desarrollo de nueva característica. Deepseek 4 pro: Trabajó 12m 02s - costó $0.12 - tiene bug. Grok 4.6: Trabajó 3m 18s - costó $1.41 - sin bug." La relación coste-rendimiento es la historia — a 10x más barato que los modelos frontier con rendimiento competitivo en muchos benchmarks, DeepSeek V4 Pro es un objetivo de enrutamiento de mid-tier fuerte. DeepSeek V4 Flash 0731 (pesos abiertos, MIT) sigue siendo el punto de referencia de pesos abiertos.

Gemini 3.7 Flash alcanzó un AA Intelligence Index de 56 con FrontierCode 1.1 en 43.6% (líder en su clase) y AutomationBench en 30.4%. Precio en $0.75/$3.75 por millón de tokens — un nuevo suelo de precio para razonamiento adyacente al frontier. Disponible con contexto de 1M. El precio es la señal: Gemini 3.7 Flash es uno de los modelos adyacentes al frontier más baratos disponibles, y los benchmarks de código (FrontierCode, Code Arena, DeepSWE) son los destacados. Para la tesis de inference economics, este es un nuevo punto de datos — el suelo de coste para modelos capaces sigue bajando.

NVIDIA Nemotron 3.5 Lightning: una nueva categoría de pesos abiertos

NVIDIA Nemotron 3.5 Lightning (liberado el 11 de agosto) es un MoE de 30B con 3B parámetros activos, liberado bajo OpenMDW-1.1 (pesos, datos, recetas — totalmente abierto). Está purpose-built para la capa de ejecución de agentes de larga duración: llamadas a herramientas, validación de resultados, delegación de subagentes — el trabajo de alto volumen y baja latencia que domina el presupuesto de tokens de un agente.

La arquitectura es un "sistema de modelos": los modelos de razonamiento frontier (Nemotron 3 Ultra) manejan orquestación y planificación mientras Lightning maneja ejecución. NeMo Switchyard es la librería de enrutamiento inteligente de modelos: "Los planes suben al frontier, la ejecución baja a Lightning." Hasta 4x velocidad de salida vía speculative decoding. El modelo está optimizado para OpenClaw y Hermes Agent — ambos nombrados explícitamente en el blog de desarrolladores de NVIDIA. NeMoClaw es la pila de seguridad y gestión de código abierto de NVIDIA para agentes always-on.

Nemotron 3.5 Lightning abre una categoría que no existía antes: modelos abiertos de capa de ejecución purpose-built. El artículo de Muse Glimmer documentó la categoría dense local-first (30B, 24GB VRAM, Apache 2.0). Nemotron 3.5 Lightning es el complemento de capa de ejecución — no local-first, sino execution-first. Ambos son modelos abiertos de clase 30B diseñados para el bucle de agente en lugar del leaderboard de benchmarks. La diferencia es contexto de despliegue: Muse Glimmer corre en una sola GPU de consumo para el bucle de agente local; Nemotron 3.5 Lightning corre en un data center para el tier de ejecución de un sistema multi-modelo.

Esta es la validación de industria más fuerte del patrón de arquitectura tiered-model documentado en el artículo de patrones de agentes de larga duración y el artículo de inference economics. El framing de "sistema de modelos" — frontier para planificación, MoE pequeño para ejecución — ya no es una optimización de coste teórica. NVIDIA construyó el modelo, la librería de enrutamiento y la pila de seguridad para ello.

El panorama de pesos abiertos ahora abarca cuatro categorías, cada una sirviendo un contexto de despliegue diferente:

Panorama de pesos abiertos: cuatro categorías 13 de agosto de 2026 — la liberación recortada de Qwen3.8 reconfiguró la frontera 1 MoE a escala cloud Pesos abiertos recortados 2.4T params (95B activos) Qwen3.8-2.4T-A95B Solo texto, sin visión Contexto 262K (no 1M) Thinking siempre activo Licencia Qwen3.8-Max Visión + contexto 1M pagado en Qwen Cloud 2 MoE a escala cloud Pesos abiertos completos 2.8T params (MoE completo) Kimi K3 Visión incluida 594GB MXFP4 Modified MIT Mínimo 8x H100 Características completas abiertas Contraejemplo a Qwen 3 Dense local-first Bucle de agente en una GPU 30B dense, Apache 2.0 Muse Glimmer 24GB VRAM Contexto 131K+ Compatible con Hermes Agent Sin cargos por token Agente nivel workstation Bucle local, cero factura API 4 Capa de ejecución MoE purpose-built 30B MoE, 3B activos Nemotron 3.5 Lightning OpenMDW-1.1 (totalmente abierto) 4x velocidad de salida NeMo Switchyard routing Pila de seguridad NeMoClaw Tier de sistema de modelos Frontier planifica, Lightning ejecuta La frontera abierto-cerrado se movió en una generación Qwen3.5-397B-A17B: visión abierta libremente → Qwen3.8-2.4T-A95B: visión pagada en Qwen Cloud Kimi K3 liberó pesos completos incluyendo visión 8 días antes. La decisión de adquisición ahora incluye: ¿qué características están realmente en los pesos descargados? Liberaciones del mismo día — 13 de agosto de 2026 DeepSeek V4 Pro 0813 BenchLM 60.95, Terminal-Bench 87.9%, CyberGym 83.3% 10x más barato que el frontier, fortaleza en ciberseguridad Gemini 3.7 Flash AA Intelligence Index 56, FrontierCode 43.6% $0.75/$3.75 por M de tokens — nuevo suelo de precio Qwen3.8-2.4T-A95B (recortado) Primeros pesos abiertos a escala Max, solo texto Reacción de la comunidad: 19 upvotes en horas Fuentes: huggingface.co, benchlm.ai, blog.google, developer.nvidia.com — agosto 2026

Qué significa esto para el build flexible en modelos

La arquitectura flexible en modelos no se trata de elegir el mejor modelo de pesos abiertos. Se trata de enrutar al modelo correcto por tarea y poder re-enrutar cuando la frontera abierto-cerrado se mueve — lo cual acaba de pasar.

Un equipo de adquisición ejecutando Qwen3.5-397B-A17B con visión para un agente de procesamiento de documentos ahora enfrenta una decisión de migración: el sucesor de pesos abiertos (Qwen3.8-2.4T-A95B) no incluye visión. Las opciones son: (1) quedarse en los pesos abiertos de Qwen3.5-397B-A17B (la generación anterior, que sí incluye visión), (2) moverse a la API gestionada de Qwen3.8-Max para visión (pagada), (3) cambiar a los pesos abiertos de Kimi K3 (visión incluida, pero 594GB MXFP4 y mínimo 8x H100), o (4) enrutar a un modelo diferente con capacidad de visión. La arquitectura flexible en modelos hace que la opción 4 sea un cambio de configuración, no un despliegue de código. La arquitectura rígida en modelos hace que sea una reescritura.

La inference economics compone la decisión. Gemini 3.7 Flash a $0.75/$3.75 por millón de tokens con contexto de 1M y visión es una alternativa de API gestionada que puede ser más barata que auto-alojar Kimi K3 a escala. DeepSeek V4 Pro 0813 a 10x más barato que los modelos frontier es un objetivo de enrutamiento de solo texto fuerte para tareas de código — donde las características recortadas de Qwen3.8 no importan. La matriz de enrutamiento ahora es: frontier para planificación (GPT-5.6 Sol, Grok 4.6), modelo de capa de ejecución abierto para llamadas a herramientas (Nemotron 3.5 Lightning), líder en coste para texto de alto volumen (DeepSeek V4 Pro 0813, Gemini 3.7 Flash), local-first para el bucle de agente en dispositivo (Muse Glimmer), y Max-scale abierto para trabajo autónomo de largo horizonte (Qwen3.8 recortado para texto, Kimi K3 completo para multimodal). Cada uno sirve una tarea diferente. La restricción vinculante es si su plataforma de agentes trata la selección de modelo como un despliegue de código o una operación de datos — la misma tesis que el artículo principal estableció, ahora probada por un proveedor reduciendo su liberación de pesos abiertos a mitad del despliegue.

Lecturas relacionadas


Un distribuidor de mid-market ejecutando NetSuite y BigCommerce necesita un agente que lea PDFs de proveedores, extraiga niveles de precios y redacte respuestas RFQ. Los pesos abiertos de Qwen3.8 sin visión no pueden leer los PDFs; la API gestionada de Qwen3.8-Max puede, pero a coste por token. Un build flexible en modelos enruta el análisis de PDF a un modelo con capacidad de visión (Gemini 3.7 Flash a $0.75/$3.75, o Kimi K3 auto-alojado) y enruta la redacción de cotización solo texto a los pesos abiertos de Qwen3.8 o DeepSeek V4 Pro 0813 — sin un despliegue de código cuando Qwen cambia lo que incluye en los pesos abiertos.

Request a scoped build. One-week discovery. You get a system inventory, workflow map, and fixed scope — whether or not you build with us.

¿Quieres esto construido para tus sistemas?

Cada documento aquí viene de trabajo real de producción. Si tienes un sistema objetivo y un flujo en mente, podemos definir un proyecto en una semana.

Solicitar un proyecto

Descubrimiento de una semana. Obtienes un inventario de sistemas, mapa de flujos y alcance fijo — decidas o no construir con nosotros.