라이브러리로 돌아가기
전략

GLM-5.3 가중치, 안전 점검 후 공개: 최초의 단계별 오픈 웨이트 출시

최종 업데이트: 2026年8月30日

Z.ai가 2026년 8월 14일 GLM-5.3을 출시했을 때, 모델 카드에는 이례적인 약속이 적혀 있었습니다. "안전 평가와 하드닝이 완료되면 출시 2주 후에 가중치를 공개하겠다"는 것이었습니다. 8월 28일, 가중치가 Hugging Face에 올라왔습니다. 고지된 기간의 끝자락이었고, 첫 며칠 동안 66,195회의 다운로드를 기록했습니다. 공개 보류의 이유는 이례적이었습니다. Z.ai가 포스트트레이닝 규모를 확장하는 과정에서 사이버 역량이 "예상보다 빠르게 발달했다"는 것입니다. 보도에 따르면 이 모델은 평가 중 269개 오픈소스 프로젝트에서 2,436건의 취약점을 발견했으며, 그중 1,097건이 치명적 또는 높은 심각도였습니다. GLM-5.3은 자체 보안 검토를 위해 명시적으로 공개를 중단했다가 하드닝을 마치고 출시한 최초의 오픈 웨이트 출시입니다.

본 글은 Open-Weight Models Crossed the Agentic Frontier를 기반으로 합니다. 해당 글은 8월 27일까지의 능력 격차, 라우팅 아키텍처, 오픈 웨이트 보안 측면을 추적했으며, 당시 GLM-5.3의 가중치는 보류 중으로 묘사되었습니다. 여기서는 완료된 출시가 바꾸는 것에 초점을 맞춥니다. 단계적 출시+보안 검토 패턴이 출시 전략 포트폴리오에 합류하고, 취약점 대장은 사이버 능력을 갖춘 오픈 웨이트 모델이 프로덕션 코드베이스에서 무엇을 발견했는지에 대한 최초의 측정 가능한 기록을 제공하며, GLM-5.3 License는 가중치를 전면 잠그는 대신 배포자 규모로 보안 조건을 확장하는 선례를 만듭니다. 라우팅 계층이 모델 선택을 구성 변경으로 다룬다면, 단계적 출시는 예정대로 도착하는 좋은 소식입니다. 단일 모델을 하드코딩한 파이프라인이라면, 단계적 출시 때마다 누군가 맡아야 하는 2주짜리 재평가 프로젝트가 생깁니다.

핵심 요약

  • GLM-5.3 오픈 웨이트는 2026년 8월 28일 Hugging Face에 공개되었고, 약속된 2주 안전 기간을 지켰습니다 — 급등한 공격적 사이버 역량 이후 안전 평가를 위해 명시적으로 중단했다가 하드닝 후 출시한 최초의 오픈 웨이트 출시입니다.
  • 평가에서 269개 오픈소스 프로젝트에서 2,436건의 취약점이 발견된 것으로 보도되었고, 이 중 1,097건이 치명적·고심각도, 53건이 공개적으로 공개되었으며 공개 원장은 cvd.z.ai에 있습니다 — 취약점 발견이 벤치마크 점수에서 프로덕션 코드베이스에 대한 측정 가능한 영향으로 옮겨갔으며, 자체 보고라는 단서가 붙습니다.
  • GLM-5.3 License가 거는 것은 100억 달러 보안 검증 게이트이지, 가중치에 대한 잠금이 아닙니다 — 거의 모든 배포자에게 MIT 스타일 권한을 유지하면서, 보안 검토 조건은 최근 12개월 수익이 100억 달러를 초과하는 모델 즉 Model-as-a-Service 운영자에게만 적용됩니다.
  • 단계적 출시는 다섯 번째 오픈 웨이트 출시 전략입니다 — 하드닝 후 가중치 공개(이번 출시, 의도적인 프로토콜), 즉시 제거형, 완전 가중치, Max 규모 보류에 이어지는 것으로, 각각 능력·안전·배포 트레이드오프가 다릅니다.
  • 포스트트레이닝만의 개선이 이제 에스플로잇 체인 전체를 커버합니다 — GLM-5.2와 동일한 베이스 모델, CyberGym 77.2% → 84.5%(공개된 최고), ExploitBench 24.4% → 54.4% — 역량 성장이 가장 빠른 지점이 바로 폐쇄형 프런티어와의 격차가 가장 넓은 곳입니다.

기록에 남은 출시

8월 14일자 출시 게시물은 2주 약속을 명시했습니다. 그 논리는 모델 벤더로서 이례적이었습니다. "포스트트레이닝을 확장하면서 사이버 역량이 예상보다 빠르게 발달했습니다. GLM-5.3은 CyberGym 취약점 발견에서 최고 수준이며, 그 개선은 에스플로잇 체인 상류에서 더 크고, 에스플로잇 벤치마크에서는 GLM-5.2의 두 배 이상입니다." Z.ai는 취약점 발견 데이터를 학습 믹스에 도입했고, 모델이 고립된 결함 발견에서 완전한 에스플로잇 체인에 걸친 추론으로 나아가는 것을 관찰했습니다. 연구실은 모델이 예상 이상을 해낼 수 있음을 이유로 자체 오픈 출시를 보류했고, 평가와 하드닝이 끝나자 예정대로 공개했습니다.

이것은 역량이 준비도를 앞지를 때 모든 에이전트 플랫폼이 배우는 교훈의 모델 계층 버전입니다. 보류하고, 평가하고, 하드닝한 다음 출시한다. 올여름의 에이전트 사건들 — AISI 평가 탈출, OpenAI Hugging Face 침해 사고, 모 글에서 다룬 Kimi K3 샌드박스 탈출 — 은 모두 이미 가동 중인 시스템에 사후 거버넌스를 덧붙이는 방식으로 마무리되었습니다. 여기서는 한 벤더가 가중치가 공개되기 전에 그와 동일한 절차를 자사 모델 출시에 적용했습니다. 이는 SaferAI가 8월 4일에 문서화한 GLM-5.2 발견 — 공개된 안전 프레임워크 없이 공격적 사이버 및 이중용도 과제에 대한 거부율 0% — 과 상통하며, 이번 사례는 안전 평가를 연구자들이 나중에 발견하는 부수 항목이 아니라 출시를 막는 단계로 다룬 점에서 구별됩니다.

중단을 정당화한 숫자: 2,436건의 취약점

공개 보류를 촉발한 역량은 이제 공개 원장입니다. 평가 기간에 Z.ai는 중국의 여러 보안 팀과 협력해 모델을 실제 코드베이스에 대해 실행했습니다. 전문가 검토, 스크리닝, 중복 제거를 거쳐 모델은 269개 프로젝트에서 2,436건의 취약점을 식별했습니다 — 그중 1,097건이 치명적·고심각도, 53건이 공개적으로 공개되었고, 집필 시점 기준 2,383건이 엠바고 상태입니다. 발견은 시스템 커널, 운영체제, 브라우저 엔진, 오픈소스 인프라, 웹 애플리케이션, 네트워크 프로토콜에 걸쳐 있습니다. 가장 오래된 취약점은 1981년에 도입되었고 — 약 45년의 영향 범위 — 평균적으로 취약점은 발견되기까지 26.6년을 존속했습니다. 진행 기록은 Z.ai Security Disclosure Ledger에서 공개되어 있습니다.

이는 모 글에서 문서화한 "오픈 웨이트 모델을 보안 도구로 쓰는" 패턴에 대해 지금까지 가장 강력한 프로덕션 증거입니다. 벤치마크 주장이 아니라 CVE가 붙은 취약점 공개 기록입니다. 정직한 단서는 이것이 자체 보고라는 점입니다. 원장은 Z.ai 자신의 공개 활동이며, 2,436이라는 수치는 독립 감사를 받지 않았습니다. 독립적으로 검증 가능한 것은 벤치마크 궤적이며, 같은 방향을 가리킵니다. CyberGym 77.2% → 84.5%(공개된 최고 기록으로, Z.ai 벤치마크 테이블에 따르면 Claude Mythos 5의 83.8%, GPT-5.6 Sol의 83.6%를 앞섬), ExploitBench 24.4% → 54.4% — 두 배 이상입니다. 이 패턴은 에스플로잇 체인을 따라 일관됩니다. 화이트박스 소스 검토에서 멀어질수록, 실제 에스플로잇에 가까워질수록 개선 폭이 커지고, 폐쇄형 프런티어와의 잔여 격차도 넓어집니다 (Mythos 5는 ExploitBench 78.0%, ExploitGym 181/247을 유지. GLM-5.3은 54.4%, 105/130).

배포 결정을 위한 정직한 역할 분담은 다음과 같습니다. 원장은 방어적 용도가 프로덕션 규모에서 실재함을 보여줍니다. 감사 공백은 공격 역량 평가가 여전히 SaferAI의 GLM-5.2 보고서와 NIST CAISI 평가 같은 독립 평가에 의존한다는 뜻이며, 벤더 주장만으로는 안 됩니다.

라이선스: 100억 달러 게이트, 가중치에 대한 잠금이 아님

GLM-5.3 License는 MIT 스타일입니다 — 사용, 복제, 수정, 병합, 공개, 배포, 서브라이선스, 판매, 파인튜닝을 허용하고 저작권 표기를 유지합니다 — 한 가지 조건이 있으며, 그 조건은 가중치가 아니라 비즈니스 모델에 대한 것입니다. "Model as a Service"는 제3자가 모델 입력, 파라미터 또는 학습 데이터에 대한 실질적 통제권을 갖도록 하는 것으로 정의됩니다. 라이선스를 받은 주체 또는 계열사가 임의의 연속 12개월 동안 합산 100억 미국 달러(또는 상당액)를 초과하는 MaaS 사업을 운영한다면, 상업적 이용 전에 Z.ai의 보안 검토를 통과해야 합니다.

그 외 모든 이 — 이 글을 읽는 거의 모든 중견 B2B 팀을 포함해 — 에게 이 라이선스는 추가 조건을 부과하지 않습니다. 두 번 읽을 가치가 있는 조항:

  1. 게이트는 용도가 아니라 배포자 규모로 확대됩니다. 수익 9억 달러 기업이 이 가중치로 고객 대면 에이전트를 운영하는 데는 검토가 필요 없습니다. GLM-5.3 추론을 재판매하는 클라우드 제공자가 바로 이 검토가 겨냥하는 유형입니다 — 리스크를 빠르게 확산시킬 규모의 운영자가 평가 비용을 부담합니다.
  2. 이 정의는 단순 중계를 제외합니다. 요청을 타인의 호스팅 GLM-5.3 엔드포인트로 라우팅하는 것(추론 제공자 패턴)은 라이선스 문안상 명시적으로 MaaS가 아닙니다.
  3. 조건은 사전 승인이지 금지가 아닙니다. 최대 규모 운영자도 상업적 이용이 금지되지 않습니다. 범위를 Z.ai가 정하는 검토에 제출해야 할 뿐입니다.

이미 기록된 출시 전략들과 비교하면 — Kimi K3의 수정 MIT(월간 활성 사용자 100M 또는 월 수익 2,000만 달러의 귀속 임계값), Qwen3.8의 제거형 Max 출시(유료 능력), DeepSeek V4-Flash 0731의 무관문 MIT, Hugging Face가 지적한 Kimi의 2,000만 달러 수익 상한 — 라이선스의 혁신은 의도적입니다. 가중치를 가능한 한 넓게 개방하고, 리스크가 집중되는 곳에 과금한다. 검토에 실효성이 있는지는 외부에서 알 수 없습니다. 알 수 있는 것은 이 주기의 최대 오픈 웨이트 출시가 제한이 아닌 수익 규모 검증을 선택했다는 사실입니다.

완료된 단계적 출시: API 공개, 2주 안전 중단, 가중치 공개 — 원장 수치, 벤치마크 증분, 라이선스 게이트, 3개 변형 GLM 라우팅 면이 함께 담겼습니다.

GLM-5.3: 최초의 단계별 오픈 웨이트 출시 API 공개 8월 14일 → 2주 안전 중단 → 가중치 공개 2026년 8월 28일 — 안전 중단은 고지된 일정을 지켰습니다 8월 14일 — API 공개 Day 0 GLM-5.3은 API 우선으로 등장 가중치 보류: “2주 내 안전 평가와 하드닝”을 약속 안전 중단 기간 약 2주 급등한 사이버 역량이 “예상보다 빠르게 발달” — 자사의 오픈 출시를 중단한 최초의 연구실 8월 28일 — 가중치 공개 66,195 첫 며칠간 Hugging Face에서의 다운로드 — 753B 파라미터, MIT 스타일 + 100억 달러 MaaS 검토 평가가 밝혀낸 것 (자체 보고 — 공개 원장은 cvd.z.ai) 2,436 건의 취약점 발견 269개 OSS 프로젝트에서 1,097 치명적·고심각도 발견 건수 53 건 공개, 2,383건은 엠바고 26.6 년 취약점 평균 잔존 기간. 가장 오래된 것은 1981년 동일 베이스 모델, 포스트트레이닝만 적용 (GLM-5.2 → 5.3) CyberGym (취약점 발견) 77.2% → 84.5% — 공개 기준 최고 ExploitBench (에스플로잇 체인) 24.4% → 54.4% — 두 배 이상 Terminal Bench 3.0 4.6 → 28.3 — 오픈소스 SOTA 폐쇄형 프런티어는 체인 상류에서 여전히 리드: Mythos 5는 ExploitBench 78.0%, ExploitGym 181/247, GLM-5.3은 54.4%와 105/130 GLM-5.3 License: 게이트는 규모로 확대, 가중치는 그대로 MIT 스타일: 사용·수정·판매·파인튜닝 — 표기 유지 조건 하나: MaaS 운영자 TTM 수익 > 100억 달러 상업적 이용 전에 Z.ai의 보안 검토 통과 필요 호스팅 엔드포인트로의 단순 중계는 명시적으로 제외. 거의 모든 중견 배포자: 추가 조건 없음. GLM-5.2 (베이스) 비용 민감 작업 $0.55 / $1.78 100만 입력 / 출력 토큰당 가중치는 6월 16일부터 공개 GLM-5.2 Turbo 지연 민감 작업 $1.99 / $6.16 더 빠르지만 저렴하지 않음 — 속도 등급 API 전용 GLM-5.3 역량 + 방어적 보안 $1.40 / $4.40 API 가동 + 가중치는 Hugging Face 단계적 출시는 8월 28일 완료 라우팅 관점: 이제 5가지 출시 전략 — 단계적+검토가 즉시 제거형, 완전 가중치, 무관문 MIT, Max 규모 보류에 합류

출시 전략: 네 가지에서 다섯 가지로

모 글은 출시 전략의 비교를 추적해 왔습니다. GLM-5.3의 완료된 출시로 그 목록은 다섯이 됩니다:

전략 대표 사례 가중치 보안 자세 배포 트레이드오프
단계적 + 보안 검토 GLM-5.3 (Z.ai) API 우선, 가중치는 약 2주 후 "안전 평가와 하드닝이 완료될 때" 출시를 막는 내부 평가; 공개 후 검증 원장 가중치 전에 API로 능력 선견; 하드닝이 끝나면 가중치 도착
완전 가중치, 신속 Kimi K3 27일차 594GB MXFP4, 비전 포함 자기 인증; 벤더 차트에서 ~51% hallucination rate 미공개 최대 능력 접근; 거버넌스 전적으로 배포자 책임
제거형, 즉시 Qwen3.8 Max 텍스트 전용, thinking 상시 켜짐, 유료 클라우드의 능력 오픈 가중치, 폐쇄적 능력 유료 능력이 붙은 오픈 웨이트 레이블; 커뮤니티 반발 문서화됨
무관문 flash 등급 DeepSeek V4-Flash 0731 MIT, 무관문, 당일 모델 카드 게시 프런티어급으로 가는 가장 저렴한 길; 마찰 최소, 벤더 보장 최소
단계적, 수익 게이트형 GLM-5.3 License 대폭 개방; 100억 달러 TTM 수익 초과 시 보안 검토 검토는 운영자 규모에 따라 확대 광범위한 접근; 최대 리셀러에만 제도적 게이트

포트폴리오 관점은 모 글의 프레이밍을 바꿉니다: 오픈 웨이트 프런티어는 하나의 전략에 이것저것 붙은 것이 아니라 — 연구실들이 무엇을 출시하느냐만이 아니라 어떻게 출시하느냐로 차별화하는, 성숙해가는 연속체입니다. Z.ai는 이제 같은 출시로 이 표의 두 행을 차지합니다: 단계적 일정에 수익 연동 라이선스를 더한 것입니다. 오픈 웨이트 프런티어를 평가하는 팀은 모델만큼이나 출시 철학을 선택하고 있는 것입니다.

단계적 패턴에는, 모 글의 Qwen 추적이 처음 드러낸 달력상의 귀결도 있습니다: 출시일에 발표된 가중치는 오는 때에 옵니다. GLM-5.3의 것은 지켜졌습니다 — Kimi K3의 오픈 가중치는 약속대로 7월 27일에 도착했고, Qwen3.8-Max의 "8월 10일 주간" 약속은 모 글이 기록한 기간을 놓쳤습니다. 출시+검토의 약속은 그 실적만큼만 의미가 있습니다; Z.ai는 이제 완료된 한 주기를 갖게 되었습니다.

모델 유연형 빌드가 단계적 출시로 하는 일

모 글의 라우팅 논지는 이 출시를 온전히 통과합니다 — 그리고 운영상의 디테일을 하나 얻습니다. 가중치가 API 2주 후에 도착할 때, 모델 유연형 팀은 API에서 평가하고 가중치로 확정합니다; 하드코딩 팀은 자기 스택의 벤치마크 표가 낡았을 때 그 격차를 발견합니다. 완료된 출시는 단계적 출시 패턴을 신기한 것에서 스케줄링의 사실로 만들었습니다: GLM 제품군에는 GLM-5.2($0.55/$1.78), GLM-5.2 Turbo($1.99/$6.16), GLM-5.3($1.40/$4.40)가 API에서 가동 중이며, 수익 규모형 라이선스로 셀프호스팅 가능한 가중치가 Hugging Face에 있습니다. 이 변형들 사이의 라우팅은 모델 유연 아키텍처에서 데이터 작업입니다 — 동일 핸들러가 세 가지 모두를 노출하고, 감사 추적이 어느 요청에 어떤 모델이 응답했는지 기록합니다.

사이버 능력을 가진 오픈 웨이트 모델은 모 글이 GLM-5.2 포렌식 작업으로 기록한 방어적 사용 라우팅 사례를 더 날카롭게 합니다: 공격자 데이터를 처리하고, 에스플로잇 체인을 분석하고, 거부 없이 코드베이스 취약점 스캔을 실행해 주는 모델이 필요한 보안 팀에게는 평가 궤적이 공개된 셀프호스팅 옵션이 생겼습니다. 그 주위의 거버넌스 경계 — 최소 권한 도구 접근, 네트워크 egress 화이트리스트, 경로 모니터링 — 는 킬스위치 문서거버넌스 체크리스트가 명시하는 아키텍처이며, 모델이 균열을 잘 찾을수록 그 필요는 줄지 않고 커집니다: 능력과 권한은 분리해서 부여해야 합니다.

배포 결정에 대한 정직한 해석:

고려사항 증거가 말하는 것 신뢰도
코딩 능력 Terminal Bench 3.0 28.3 (오픈소스 SOTA), Z.ai Code Bench 5.2 대비 +50% — 대부분의 폐쇄 프런티어 비교에서 Claude Fable 5에 뒤짐 벤더 수치; 독립 검증 축적 중
방어적 보안 CyberGym 84.5% 공개 기준 최고; 2,436건 취약점 원장 공개 벤치마크 검증 능력; 원장은 자체 보고
거버넌스 선례 안전을 위해 자사 출시를 보류한 뒤 예정대로 공개한 최초의 사례 출시 약속 대조 검증
라이선스 100억 달러 미만 MaaS는 MIT 스타일; 초과 시 검토 LICENSE 파일 문안 대조 검증
출처 중국 관할 모델; 7월부터 수출 통제 문의 진행 중 모 글에 기록된 구조적 리스크

관련 읽기


NetSuite, BigCommerce, 그리고 세 개의 공급사 카탈로그를 운영하는 지역 유통업체가 작업별로 라우팅되는 견적 에이전트를 배치했습니다: 카탈로그 검색과 가용 홀드는 DeepSeek V4-Flash가 백만 입력 토큰당 $0.14로 처리하고, 계층 가격과 FX가 포함된 견적 생성은 GLM-5.3 API가 $1.40/$4.40으로 담당하며, 확신도가 임계값 아래로 떨어질 때의 엣지 케이스 정책 해석은 GPT-5.6 Sol로 에스컬레이션됩니다. GLM-5.3 가중치가 100억 달러 MaaS 게이트와 함께 8월 28일 출시되었을 때 — 이 조건은 중견 운영자에게는 영향이 없습니다 — 팀은 구성 변경만으로 견적 생성을 셀프호스팅 엔드포인트로 옮겼습니다. 같은 MCP 모듈, 같은 감사 추적, 재배포 없음. 라우팅 결정은 모든 도구 실행과 마찬가지로 동일한 DynamoDB 감사 추적에서 쿼리할 수 있습니다. 이런 빌드는 보통 5-8주 안에 라이브됩니다.

귀하의 시스템을 위해 이것을 구축하고 싶으신가요?

여기의 각 문서는 실제 프로덕션 작업에서 나왔습니다. 대상 시스템과 워크플로가 있다면, 1주 내에 빌드를 범위 정의할 수 있습니다.

범위 정의 빌드 요청

1주 발견. 시스템 인벤토리, 워크플로 맵, 고정 범위를 받습니다 — 우리와 빌드할지 여부와 관계없이.