Volver a la Biblioteca
Estrategia

Los pesos de GLM-5.3 llegan tras una pausa de seguridad: la primera liberación escalonada de pesos abiertos

Última actualización: 30 de agosto de 2026

Cuando Z.ai lanzó GLM-5.3 el 14 de agosto de 2026, la tarjeta del modelo llevaba un compromiso inusual: "Liberaremos los pesos en dos semanas tras el lanzamiento, cuando la evaluación de seguridad y el endurecimiento estén completos." El 28 de agosto, los pesos se publicaron en Hugging Face — justo al final de la ventana indicada, con 66.195 descargas en los primeros días. El motivo de la retención fue novedoso. A medida que Z.ai escalaba el post-entrenamiento, la capacidad cibernética "se desarrolló más rápido de lo que esperábamos", y el modelo identificó, según los reportes, 2.436 vulnerabilidades en 269 proyectos de código abierto durante la evaluación, incluyendo 1.097 hallazgos de severidad crítica y alta. GLM-5.3 es la primera liberación de pesos abiertos que un laboratorio pausó explícitamente por su propia revisión de seguridad, y luego endureció y publicó.

Este artículo se basa en Open-Weight Models Crossed the Agentic Frontier, que rastreó la brecha de capacidades, la arquitectura de routing y la superficie de seguridad open-weight hasta el 27 de agosto — con los pesos de GLM-5.3 descritos como pendientes. Aquí el enfoque está en lo que cambia con la liberación completada: el patrón de liberación escalonada con revisión de seguridad se une al portafolio de estrategias de liberación, el registro de vulnerabilidades aporta el primer registro medible de lo que un modelo open-weight con capacidad cibernética encontró en codebases de producción, y la GLM-5.3 License establece un precedente para escalar las condiciones de seguridad por tamaño del desplegador en lugar de bloquear los pesos por completo. Si tu capa de routing trata la selección de modelos como un cambio de configuración, la liberación escalonada es una buena noticia entregada según un calendario. Si tu pipeline tiene hardcodeado un solo modelo, cada liberación escalonada es un proyecto de re-evaluación de dos semanas que alguien debe asignar.

Conclusiones clave

  • Los pesos abiertos de GLM-5.3 se publicaron en Hugging Face el 28 de agosto de 2026, cumpliendo la ventana de seguridad prometida de dos semanas — la primera liberación de pesos abiertos pausada explícitamente para una evaluación de seguridad tras una capacidad cibernética ofensiva emergente, y luego endurecida y publicada.
  • La evaluación encontró, según los reportes, 2.436 vulnerabilidades en 269 proyectos de código abierto, 1.097 de severidad crítica o alta, con 53 divulgadas públicamente y el registro público en cvd.z.ai — el descubrimiento de vulnerabilidades pasó de puntuación de benchmark a un impacto medible en codebases de producción, con la salvedad de que es auto-reportado.
  • La GLM-5.3 License condiciona una revisión de seguridad de 10.000 millones, no los pesos — permisos estilo MIT para casi cualquier desplegador, con la condición de revisión de seguridad aplicándose solo a operadores de model-as-a-service con más de 10.000 millones de dólares de ingresos en los últimos 12 meses.
  • La liberación escalonada es la quinta estrategia de liberación de pesos abiertos — uniéndose a pesos-tras-endurecimiento (esta liberación, como protocolo deliberado), recortada-inmediata, pesos-completos y pendiente-a-escala-Max, cada una con distintos tradeoffs de capacidad, seguridad y despliegue.
  • Las ganancias solo-de-post-entrenamiento ahora cubren la cadena de explotación — mismo modelo base que GLM-5.2, CyberGym 77,2% a 84,5% (el mejor publicado), ExploitBench 24,4% a 54,4% — la capacidad crece más rápido exactamente donde la brecha con la frontera cerrada es más ancha.

La liberación, en el registro

El post de lanzamiento del 14 de agosto fijó explícitamente el compromiso de dos semanas. El razonamiento fue inusual para un proveedor de modelos: "A medida que escalábamos el post-entrenamiento, la capacidad cibernética se desarrolló más rápido de lo que esperábamos. GLM-5.3 es estado del arte en CyberGym para descubrimiento de vulnerabilidades, y sus ganancias son mayores más arriba en la cadena de explotación, donde más que duplica a GLM-5.2 en benchmarks de explotación." Z.ai introdujo datos de descubrimiento de vulnerabilidades en la mezcla de entrenamiento y observó al modelo pasar de encontrar fallas aisladas a razonar a través de cadenas de explotación completas. El laboratorio retuvo su propia liberación abierta porque el modelo podía hacer más de lo esperado — y la publicó según lo previsto una vez que la evaluación y el endurecimiento estuvieron listos.

Esta es la versión a nivel de modelo de la lección que toda plataforma de agentes aprende cuando la capacidad supera la preparación: pausar, evaluar, endurecer y luego liberar. Los incidentes de agentes del verano — el escape de la evaluación de AISI, la intrusión de OpenAI en Hugging Face, el escape de sandbox de Kimi K3 documentado en el artículo principal — todos terminaron con equipos aplicando gobernanza de forma retroactiva a sistemas ya en marcha. Aquí, un proveedor aplicó esa misma secuencia a su propia liberación de modelo, antes de que los pesos fueran públicos. En paralelo con el hallazgo documentado de SaferAI sobre GLM-5.2 del 4 de agosto — una tasa de rechazo del 0% en tareas ofensivas de ciberseguridad y de doble uso sin marco de seguridad publicado — al tratar la evaluación de seguridad como un paso bloqueante de la liberación en lugar de una ocurrencia tardía que los investigadores descubren después.

El número que justificó la pausa: 2.436 vulnerabilidades

La capacidad que disparó la retención es ahora un registro público. Durante la evaluación, Z.ai trabajó con varios equipos de seguridad en China para ejecutar el modelo contra codebases reales; tras revisión experta, filtrado y deduplicación, el modelo identificó 2.436 vulnerabilidades en 269 proyectos — 1.097 de severidad crítica y alta, 53 divulgadas públicamente, 2.383 bajo embargo al momento de escribir esto. Los hallazgos abarcan kernels de sistema, sistemas operativos, motores de navegador, infraestructura de código abierto, aplicaciones web y protocolos de red. La falla más antigua se introdujo en 1981 — aproximadamente 45 años de impacto — y en promedio una vulnerabilidad vivió 26,6 años antes de ser descubierta. El registro histórico es público en el Z.ai Security Disclosure Ledger.

Esta es la evidencia de producción más fuerte hasta ahora del patrón de modelos open-weight como herramientas de seguridad que el artículo principal documentó: no una afirmación de benchmark sino un registro de divulgación de vulnerabilidades con CVEs adjuntos. El marcador honesto es que es auto-reportado — el registro es el esfuerzo de divulgación propio de Z.ai, y la cifra de 2.436 no ha sido auditada de forma independiente. Lo que es verificable independientemente es la trayectoria de benchmarks, que apunta en la misma dirección: CyberGym 77,2% a 84,5% (el mejor resultado publicado, por delante de Claude Mythos 5 con 83,8% y GPT-5.6 Sol con 83,6% según la tabla de benchmarks de Z.ai), y ExploitBench 24,4% a 54,4% — más que duplicado. El patrón es consistente a lo largo de la cadena de explotación: cuanto más lejos de la revisión de código white-box hacia la explotación real, mayor la ganancia, y también más ancha la brecha residual con la frontera cerrada (Mythos 5 mantiene 78,0% en ExploitBench y 181/247 en ExploitGym contra el 54,4% y 105/130 de GLM-5.3).

Para una decisión de despliegue, la división honesta del trabajo es: el registro muestra que el uso defensivo es real a escala de producción; la brecha de auditoría significa que la evaluación de la capacidad ofensiva todavía descansa en evaluaciones independientes como el informe de GLM-5.2 de SaferAI y la evaluación de NIST CAISI, no solo en afirmaciones del proveedor.

La licencia: una puerta de 10.000 millones, no una puerta sobre los pesos

La GLM-5.3 License es estilo MIT — usar, copiar, modificar, fusionar, publicar, distribuir, sublicenciar, vender y hacer fine-tuning, con el aviso de copyright retenido — con una condición, y la condición es sobre el modelo de negocio, no sobre los pesos. "Model como Servicio" se define comodar a un tercero control significativo sobre las entradas del modelo, los parámetros o los datos de entrenamiento. Si un licenciatario o afiliado opera un negocio de MaaS con ingresos agregados superiores a 10.000 millones de dólares estadounidenses (o equivalente) durante cualquier período consecutivo de 12 meses, el licenciatario debe pasar la revisión de seguridad de Z.ai antes de cualquier uso comercial.

Para todos los demás — incluyendo casi cualquier equipo B2B mid-market que lea esto — la licencia no impone ninguna condición adicional. Letra pequeña que vale la pena leer dos veces:

  1. La puerta escala por tamaño del desplegador, no por caso de uso. Una empresa con ingresos de $900M que ejecuta agentes orientados al cliente con los pesos no necesita revisión. Un proveedor de cloud que revende inferencia de GLM-5.3 es exactamente la clase a la que apunta la revisión — el operador con escala para propagar el riesgo rápidamente paga el costo de la evaluación.
  2. La definición excluye el simple relevo. Enrutar peticiones al endpoint alojado de GLM-5.3 de otra persona (el patrón de proveedor de inferencia) expresamente no es MaaS según el texto de la licencia.
  3. La condición es aprobación previa, no prohibición. Los operadores más grandes no tienen prohibido el uso comercial; deben someterse a una revisión cuyo alcance determina Z.ai.

En comparación con las estrategias de liberación ya documentadas — el Modified MIT de Kimi K3 con umbrales de atribución de 100M de usuarios activos mensuales o $20M de ingresos mensuales, la liberación recortada a escala Max de Qwen3.8 con capacidades de pago, el MIT sin condiciones de DeepSeek V4-Flash 0731, el hallazgo de Hugging Face sobre el tope de ingresos de $20M de Kimi — la innovación de la licencia es deliberada: hacer los pesos abiertos al conjunto más amplio posible, gravar el riesgo donde se concentra. Si la revisión tiene dientes es imposible saberlo desde afuera; lo que sí es saber es que la mayor liberación de pesos abiertos de este ciclo eligió revisión escalada por ingresos en lugar de restricción.

La liberación escalonada completada: lanzamiento de API, pausa de seguridad de dos semanas, pesos publicados — con las cifras del registro, los deltas de benchmarks, la puerta de la licencia y la superficie de routing de las tres variantes GLM.

GLM-5.3: la primera liberación escalonada de pesos abiertos Lanzamiento de API 14 ago → pausa de seguridad de dos semanas → pesos publicados 28 ago 2026 — la pausa de seguridad cumplió su calendario indicado 14 ago — lanzamiento de API Día 0 GLM-5.3 llega primero como API Pesos retenidos: "evaluación de seguridad y endurecimiento" prometidos en 2 semanas La pausa de seguridad ~2 semanas Capacidad cibernética emergente "se desarrolló más rápido de lo esperado" — primer laboratorio en pausar su propia liberación abierta 28 ago — pesos publicados 66.195 descargas en los primeros días en Hugging Face — 753B parámetros, estilo MIT + revisión MaaS de $10B Lo que la evaluación encontró (auto-reportado — registro público en cvd.z.ai) 2.436 vulnerabilidades encontradas en 269 proyectos OSS 1.097 hallazgos de severidad crítica y alta 53 divulgados públicamente; 2.383 bajo embargo 26,6 años antigüedad promedio de la falla; la más antigua de 1981 Mismo modelo base, solo post-entrenamiento (GLM-5.2 → 5.3) CyberGym (descubrimiento de vulnerabilidades) 77,2% → 84,5% — el mejor publicado ExploitBench (cadenas de explotación) 24,4% → 54,4% — más que duplicado Terminal Bench 3.0 4,6 → 28,3 — SOTA open-source La frontera cerrada sigue liderando en la cadena: Mythos 5 con 78,0% ExploitBench, 181/247 ExploitGym vs 54,4% y 105/130 de GLM-5.3 GLM-5.3 License: la puerta escala, los pesos no Estilo MIT: usar, modificar, vender, fine-tuning — aviso retenido Una condición: operadores MaaS > $10B TTM deben pasar la revisión de seguridad de Z.ai antes del uso comercial El relevo simple a endpoints alojados expresamente excluido. Casi cualquier desplegador mid-market: sin condición adicional. GLM-5.2 (base) tareas sensibles al costo $0.55 / $1.78 por millón de tokens de entrada / salida pesos publicados desde el 16 de junio GLM-5.2 Turbo tareas sensibles a la latencia $1.99 / $6.16 más rápido, no más barato — capa de velocidad solo API GLM-5.3 capacidad + seguridad defensiva $1.40 / $4.40 API activa + pesos en Hugging Face liberación escalonada completada el 28 de agosto Lectura de routing: ahora 5 estrategias de liberación — escalonada+revisión se une a recortada-inmediata, pesos-completos, MIT-sin-puerta y pendiente-a-escala-Max

Estrategias de liberación: de cuatro a cinco

El artículo principal rastreó una comparación creciente de estrategias de liberación. La liberación completada de GLM-5.3 lo hace cinco:

Estrategia Ejemplar Pesos Postura de seguridad Tradeoff de despliegue
Escalonada + revisión de seguridad GLM-5.3 (Z.ai) API primero, pesos a ~2 semanas "cuando la evaluación de seguridad y el endurecimiento estén completos" Evaluación interna bloqueante de la liberación; registro publicar-luego-verificar Vista previa de capacidades vía API antes de los pesos; los pesos llegan cuando el endurecimiento se completa
Pesos completos, rápido Kimi K3 594GB MXFP4 al día 27, visión incluida Auto-attestation; ~51% de tasa de alucinación no divulgada en gráficos del proveedor Acceso máximo a capacidades; gobernanza enteramente en el desplegador
Recortada, inmediata Qwen3.8 Max Solo texto, thinking siempre activado, capacidades en cloud de pago Pesos abiertos, capacidades cerradas Etiqueta open-weight con capacidades de pago; reacción de la comunidad documentada
Flash-tier sin puerta DeepSeek V4-Flash 0731 MIT, sin puerta, el mismo día Tarjeta de modelo publicada El camino más barato a clase frontera; fricción mínima, seguridad mínima del proveedor
Escalonada, condicionada por ingresos GLM-5.3 License Ampliamente abiertos; revisión de seguridad por encima de $10B TTM La revisión escala con la escala del operador Acceso amplio; puerta institucional solo para los mayores revendedores

La lectura del portafolio cambia el encuadre del artículo principal: la frontera open-weight no es una estrategia con valores atípicos — es una continuidad en maduración donde los laboratorios se diferencian en cómo liberan, no solo en qué liberan. Z.ai ahora ocupa dos filas de esa tabla con la misma liberación: calendario escalonado más licencia condicionada por ingresos. Un equipo que evalúa la frontera open-weight está eligiendo una filosofía de liberación tanto como un modelo.

El patrón escalonado también tiene una consecuencia de calendario que el seguimiento de Qwen del artículo principal surfaced primero: los pesos anunciados el día de lanzamiento llegan cuando llegan. El de GLM-5.3 cumplió — los pesos abiertos de Kimi K3 llegaron el 27 de julio como se prometió, y la promesa de "la semana del 10 de agosto" de Qwen3.8-Max se pasó de la ventana que el artículo documentó. Un compromiso de liberación-con-revisión solo es tan bueno como su historial; Z.ai ahora tiene un ciclo completado.

Lo que la construcción flexible en modelos hace con una liberación escalonada

La tesis de routing del artículo principal sobrevive a la liberación intacta — y gana una arruga operativa. Cuando los pesos llegan dos semanas después de la API, un equipo flexible en modelos evalúa en la API y se compromete con los pesos; un equipo con hardcode descubre la brecha cuando la tabla de benchmarks de su stack queda obsoleta. La liberación completada convierte el patrón de liberación escalonada de una novedad en un hecho de calendario: la línea de producto GLM ahora tiene GLM-5.2 ($0.55/$1.78), GLM-5.2 Turbo ($1.99/$6.16) y GLM-5.3 ($1.40/$4.40) activas en API, con pesos en Hugging Face para self-hosting bajo la licencia condicionada por ingresos. El routing entre esas variantes es una operación de datos en la arquitectura flexible en modelos — el mismo handler expone las tres, con la pista de auditoría registrando qué modelo sirvió cada llamada.

El modelo open-weight con capacidad cibernética también afila el caso de routing para uso defensivo que el artículo principal documentó con el trabajo forense de GLM-5.2: los equipos de seguridad que necesitan un modelo dispuesto a procesar datos del atacante, analizar cadenas de explotación y ejecutar escaneos de vulnerabilidades de codebase sin negarse ahora tienen una opción self-hostable cuyo rastro de evaluación es público. El perímetro de gobernanza alrededor — acceso de herramientas con mínimo privilegio, listas de permisos de salida de red, monitoreo de trayectorias — es la misma arquitectura que especifican el artículo del kill switch y la lista de verificación de gobernanza, y importa más, no menos, cuando el modelo es bueno encontrando las grietas: capacidad y autoridad deben otorgarse por separado.

La lectura honesta de la decisión de despliegue:

Consideración Lo que dice la evidencia Confianza
Capacidad de codificación Terminal Bench 3.0 con 28,3 (SOTA open-source), Z.ai Code Bench +50% sobre 5.2 — por detrás de Claude Fable 5 en la mayoría de comparaciones de frontera cerrada Números del proveedor; verificación independiente acumulándose
Seguridad defensiva CyberGym 84,5% el mejor publicado; registro de 2.436 vulnerabilidades público Capacidad verificada en benchmark; registro auto-reportado
Precedente de gobernanza Primera pausa de liberación retenida por el propio laboratorio por seguridad, publicada según lo previsto Verificado contra el compromiso de lanzamiento
Licencia Estilo MIT para MaaS <$10B; revisión por encima Verificado contra el texto del archivo LICENSE
Procedencia Modelo de jurisdicción china; consulta de controles de exportación en curso desde julio Riesgo estructural documentado en el artículo principal

Lecturas relacionadas


Un distribuidor regional que ejecuta NetSuite, BigCommerce y tres catálogos de proveedores despliega un agente de cotización que enruta por tarea: búsqueda de catálogo y retenciones de disponibilidad en DeepSeek V4-Flash a $0.14 por millón de tokens de entrada, generación de cotizaciones con precios por niveles y FX en la API de GLM-5.3 a $1.40/$4.40, e interpretación de políticas de casos límite escalada a GPT-5.6 Sol cuando la confianza cae por debajo del umbral. Cuando los pesos de GLM-5.3 se publicaron el 28 de agosto con la puerta MaaS de 10.000 millones — una condición que no toca a un operador mid-market — el equipo movió la generación de cotizaciones a un endpoint self-hosted con un cambio de configuración, mismos módulos MCP, misma pista de auditoría, sin redeploy. Las decisiones de routing son consultables en la misma pista de auditoría de DynamoDB que cada ejecución de herramienta. Esa construcción típicamente está activa en 5-8 semanas.

¿Quieres esto construido para tus sistemas?

Cada documento aquí viene de trabajo real de producción. Si tienes un sistema objetivo y un flujo en mente, podemos definir un proyecto en una semana.

Solicitar un proyecto

Descubrimiento de una semana. Obtienes un inventario de sistemas, mapa de flujos y alcance fijo — decidas o no construir con nosotros.