GLM-5.3-Flash: 플래그십 가격의 10분의 1로 Claude Opus 4.8에 근접하는 320B 오픈 웨이트 모델
핵심 요약
- GLM-5.3-Flash는 320B 총 파라미터/18B 활성의 네이티브 멀티모달 MoE로 백만 토큰당 0.15/0.50달러에 가격이 책정되었습니다 — GLM-5.3의 1.40/4.40달러의 10분의 1 — Intelligence Index 57, 태스크당 0.045달러(할인가). Z.ai 자체 벤치마크 서술에 따르면 이 지능 수준은 이전에는 약 10배 비용에서만 가능했습니다(Z.AI blog).
- Terminal Bench 2.1에서 Flash 변형은 84.3점으로 Claude Opus 4.8과 1점 이내이며, AutomationBench에서는 48.8점으로 — Claude Opus 4.8의 41.0점과 GPT-5.6 Terra의 37.2점을 앞섭니다 — 저가 변형이 실제 워크플로 자동화를 측정하는 에이전트 벤치마크에서 기대를 넘어선 것입니다(Z.AI blog).
- Anthropic의 Frontier Red Team은 GLM-5.3-Flash가 두 개의 CVE(CVE-2026-11645 포함)를 독립적으로 연결해 ARM64 대상의 신뢰할 수 있는 익스플로잇 체인을 구축했음을 확인했습니다. 소요 시간은 인간 주의 20분 + 모델 작동 8시간, Zhipu API 가격으로 20.40달러 — 방어적 사용과 확산 리스크 모두 실재하며 독립적으로 검증되었습니다(Anthropic research).
- 744B GLM-5.3 플래그십 가중치는 여전히 비공개입니다 — «출시 후 2주» 약속은 기한이 지났고, GLM-5.3-Flash 가중치는 Hugging Face에 공개되어 있습니다 — 부모 문서가 기록한 단계적 출시는 이제 분할 출시입니다: Flash 변형은 공개, 플래그십은 미공개(Hugging Face).
- NIST CAISI는 GLM-5.3을 «지금까지 공개된 것 중 가장 사이버 능력이 뛰어난 오픈 웨이트 모델»이라 평가했으며, 미국 프런티어 대비 약 4개월 뒤처져 있습니다 — 프런티어 폐쇄형과 오픈 웨이트 간 사이버 능력 격차는 이제 추정이 아닌 측정값입니다(NIST CAISI).
본 글은 GLM-5.3 가중치, 안전 중단 후 출시되다: 최초의 단계적 오픈 웨이트 출시를 잇는 글입니다. 부모 문서는 744B 플래그십의 2주 안전 중단, 2,436건 취약점 공개 목록, 매출 연동 라이선스를 기록했습니다. 여기서의 초점은 Flash 변형이 바꾸는 것입니다: 비용 붕괴 논제는 가장 강력한 단일 데이터 포인트를 얻고, 단계적 출시는 공개된 Flash와 보류된 플래그십으로 갈라지며, Anthropic의 분석은 사이버 능력 주장을 벤더 자기 보고에서 독립 연구소 검증으로 전환했습니다 — 비용 20.40달러의 Flash 전용 익스플로잇 체인을 포함하여.
비용 붕괴 데이터 포인트
Z.AI 블로그 포스트는 이 출시를 장식 없이 설명합니다: «총 파라미터 320B, 활성은 18B뿐. 벤치마크와 실제 워크로드에서 GLM-5.2를 10분의 1 가격으로 앞서며, 코딩과 에이전트 벤치마크에서는 Claude Opus 4.8에 근접.» 아키텍처는 완전히 새롭습니다. GLM-5.2의 포스트트레인이 아니라 30T 토큰 멀티모달 코퍼스에서 새로 학습된 베이스이며, GLM-5 시리즈 최초의 네이티브 멀티모달 모델입니다. GLM 라인 최초의 sparse+linear 하이브리드 어텐션 구조, Manifold-Constrained Hyper-Connections(mHC), 100만 토큰 컨텍스트를 위한 IndexPool을 도입했습니다. GLM-5.3 대비 Flash 변형은 어텐션 연산을 3.0배 적게, KV 캐시를 4.4배 작게 사용합니다. 중국 AI 칩 위에서 대규모로 서비스되며, SGLang 기반 전용 추론 엔진으로 주류 NVIDIA GPU에 필적하는 엔드투엔드 서빙 성능 3배 개선을 달성합니다.
가격은 라우팅 결정을 바꾸는 부분입니다. 백만 토큰당 0.15/0.50달러(입력/출력)로 Flash 변형은 GLM-5.3의 1.40/4.40달러의 10분의 1입니다. Artificial Analysis Intelligence Index v4.1.1에서 57점을 기록했고, 태스크당 0.045달러(할인가). 이 지능 수준은 이전에는 약 10배의 비용에서만 가능했다고 Z.ai는 밝힙니다. LLM Gateway는 2026년 10월 7일 공개된 최신 모델로 GLM 5.3 Fast를 올렸습니다.
에이전트 워크로드에서 중요한 벤치마크는 실제 워크플로 자동화를 측정하는 AutomationBench입니다. GLM-5.3-Flash는 48.8점 — Claude Opus 4.8의 41.0점과 GPT-5.6 Terra의 37.2점을 앞섭니다. Terminal Bench 2.1에서는 84.3점으로 Claude Opus 4.8과 1점 이내입니다. DeepSWE v1.1에서는 63.4점으로 GLM-5.2의 46.2점을 크게 앞섭니다. 패턴은 이렇습니다: 저가 변형이 좁은 코딩 벤치마크에서 프런티어에 근접하는 데 그치지 않고, 프로덕션 에이전트가 실제로 수행하는 다단계 도구 사용 루프를 측정하는 벤치마크에서 프런티어를 앞선다.
태스크별로 라우팅하는 팀에게 이것은 구성 결정입니다. 단일 모델을 하드코딩한 팀에게는 전담 인력을 두고 수행해야 할 재평가입니다. DeepSeek V4.1-Flash 문서 — AI 검색 세션에서 11회 연속 인용 #3 — 는 무음 모델 교체 리스크를 기록했습니다: 벤더는 묻지 않고 모델을 바꿀 수 있습니다. GLM-5.3-Flash는 그 역방향 데이터 포인트입니다: 기대를 넘어서는 저가 변형이 오픈 웨이트로 제공되고, 당신이 소유한 레이어가 라우팅합니다.
단계적 출시는 갈라진다
부모 문서가 기록한 것은 완료된 단계적 출시입니다: 8월 14일 API 출시, 2주 안전 중단, 8월 28일 744B 가중치 Hugging Face 게시. Flash 변형은 이 그림을 복잡하게 만듭니다. GLM-5.3-Flash 가중치는 Hugging Face에서 이용 가능합니다. 744B GLM-5.3 가중치는 그렇지 않습니다 — Z.ai의 Hugging Face 조직에는 GLM-5.3 저장소가 없습니다. «출시 후 2주» 약속은 기한이 지났고 플래그십 가중치는 계속 보류 중입니다.
분할 출시에는 거버넌스 독해가 있습니다. Flash 변형은 «가중치 공개된 절반»입니다: 320B, 활성 18B, 0.15/0.50달러, 네이티브 멀티모달, 부모 문서가 기록한 것과 동일한 매출 연동 라이선스로 셀프호스팅 가능. 플래그십은 «보류된 절반»입니다: 744B, CyberGym 84.5%의 취약점 발견 능력, 2,436건 취약점 목록 — 공격적 능력이 애초에 안전 중단을 촉발한 모델입니다. Z.ai는 Flash 변형을 공개하고 플래그십을 보류했습니다. 744B 가중치가 언젠가 공개될지는 이제 예정된 사건이 아니라 미결 질문입니다.
모델 유연한 빌드에게 분할은 관리 가능합니다: 비용 민감한 80% 태스크는 Flash 변형(셀프호스팅 또는 API)으로 라우팅하고, 능력이 중요한 20%는 폐쇄형 프런티어 모델이나 GLM-5.3 API로 에스컬레이션합니다. 라우팅 레이어는 동일한 핸들러이며 엔드포인트만 바뀝니다. 하드코딩 빌드에게 분할은 «모델»이 단일 아티팩트가 아니라 제품 라인이 되었다는 환기이며 — 벤치마크한 변형이 최종 운용 변형과 다를 수 있습니다.
사이버 능력 분석: 독립 검증
부모 문서의 취약점 목록은 자기 보고였습니다 — Z.ai 자체 공개 활동, 2,436건 발견, 독립 감사 없음. Anthropic Frontier Red Team 분석은 2026년 9월 29일 공개되어 능력 주장을 벤더 자기 보고에서 독립 연구소 검증으로 전환했습니다.
ExploitBench(Chrome V8)에서 GLM-5.3은 410회 시도 중 50회(12%)에서 엔드투엔드 익스플로잇을 개발하며 Claude Mythos Preview의 14%와 맞먹습니다. Anthropic 내부 바이너리 익스플로잇 벤치마크에서 GLM-5.3은 완전한 제어 흐름 하이재킹 4%를 달성합니다. 이전 모델(Claude Opus 4.6, GLM-5.2)은 0%입니다. 연구자 주도 테스트에서 GLM-5.3은 인기 웹 브라우저의 JavaScript 엔진에서 미공개 취약점을 발견하고 이를 연결해 방문자 컴퓨터의 임의 파일을 읽는 동작하는 익스플로잇을 만들었습니다 — 하루 동안, 제한된 인간 주의로.
Flash 고유의 발견은 비용 붕괴 독해를 바꾸는 것입니다. Anthropic 연구원들은 GLM-5.3-Flash로 알려진 취약점(CVE-2026-11645, 최근 공개된 Chrome 결함)에 대한 익스플로잇을 개발했습니다. 유의미한 유도 없이, Flash 변형은 두 결함의 익스플로잇을 연결해 ARM64 대상의 신뢰할 수 있는 익스플로잇 체인을 구축하고 포인터 인증(PAC) 강화를 우회했습니다. 소요는 인간 주의 20분 + 모델 작동 8시간. Zhipu API 가격으로 이 작업은 20.40달러에 해당했습니다. 저가 변형은 양성 워크로드만이 아니라 공격적 보안 작업에서도 저렴하며, 오픈 웨이트이기까지 합니다.
세이프가드는 우회 가능합니다. Anthropic은 GLM-5.3의 세이프가드가 거짓 커버스토리로 64%, 사전 채움 추론으로 92%, abliterated 버전에서는 100% 우회됨을 확인했습니다(공개 며칠 내 여러 abliterated 버전이 공개되었습니다). 이 기법들은 테스트에서 세이프가드가 있는 Claude 모델에는 통하지 않았습니다. NIST CAISI의 9월 17일 평가는 GLM-5.3을 «지금까지 공개된 것 중 가장 사이버 능력이 뛰어난 오픈 웨이트 모델»이라 평가하며 사이버 벤치마크 종합에서 미국 프런티어 대비 약 4개월 뒤처짐을 기록했습니다.
거버넌스 독해는 부모 문서의 킬스위치와 거버넌스 체크리스트 교차 링크가 이미 독자에게 준비해 준 것입니다: 능력과 권한은 별도로 부여해야 합니다. 세이프가드가 우회 가능하고 프런티어에 근접한 사이버 능력을 지닌 오픈 웨이트 모델은, 최소 권한 도구 접근, 네트워크 송신 허용 목록, 궤적 모니터링을 갖춘 거버넌스가 적용된 MCP 모듈 뒤에서 작동할 때는 방어 도구입니다 — 거버넌스 체크리스트가 규정하는 아키텍처입니다. 그 경계 없이 작동하면 같은 모델은 확산 리스크입니다. 0.15/0.50달러의 Flash 변형은 두 용도 모두를 더 저렴하게 만듭니다.
라우팅 결정에서 무엇이 바뀌는가
추론 경제학 문서가 기록한 비용 붕괴 논제는 이제 가장 강력한 데이터 포인트를 얻었습니다. Terminal Bench에서 Claude Opus 4.8과 1점 이내이고 AutomationBench에서 이를 앞서며, Z.ai 자체 플래그십 가격의 10분의 1 — 그리고 오픈 웨이트로 제공됩니다. 트렌드 주기가 드러낸 기업 AI 예산 고갈(2026년 인프라 지출 62.5% 증가로 8,220억 달러, 측정 가능한 기업 전체 이익을 창출하는 채택 기업은 6%뿐 — AI Business Weekly, 미국 대기업에서는 예산이 1~2개월 만에 고갈 — MarketScale)이 수요 동인입니다. 비용 붕괴는 더 이상 다년간의 궤적이 아니라 같은 주의 라우팅 결정입니다.
모델 유연한 빌드는 Flash 변형을 오픈 웨이트 프런티어 문서가 추적하는 교체 가능 풀의 신규 항목으로 읽습니다. 풀은 이제 세 지역(미국: Reflection Beam, 유럽: Mistral ML4·Aleph Alpha Kolibri-1, 중국: DeepSeek·Qwen·GLM)과 다중 능력 계층에 걸쳐 있습니다. 오픈 웨이트와 폐쇄형 모델에 걸쳐 있던 라우팅 레이어는 Flash 변형을 에이전트 도구 사용 레인의 비용 최적화 기본값으로 추가하고, 신뢰도가 떨어지면 거버넌스가 적용된 MCP 모듈 뒤의 폐쇄형 프런티어 모델로 에스컬레이션할 수 있습니다. 감사 로그는 각 호출을 어떤 모델이 처리했는지 기록합니다. TypeSafe Jev 의사결정 계층 문서는 에스컬레이션 정책을 명시적으로 만드는 보정 계약을 기록합니다: 0.95 이상 결정은 자동 해결, 0.50 미만은 인간에게, 중간 대역은 확률을 붙여 검토 대기열로.
Flash 변형의 방어 보안 레인은 부모 문서의 CyberGym 84.5% 데이터 포인트가 열고 Anthropic 분석이 이제 독립적으로 확인한 것입니다. 공격자 데이터를 처리하고, 익스플로잇 체인을 분석하고, 코드베이스 취약점 스캔을 거부 없이 수행할 모델이 필요한 보안 팀은 이제 셀프호스팅 가능하고 독립 검증된 0.15/0.50달러 옵션을 갖추게 되었습니다. 그 주변의 거버넌스 경계 — 최소 권한 도구 접근, 네트워크 송신 허용 목록, 궤적 모니터링 — 는 킬스위치 문서가 규정하는 것과 동일한 아키텍처며, 모델이 틈을 찾는 데 능할수록 그 중요성은 줄지 않고 커집니다.
관련 문서
- GLM-5.3 가중치, 안전 중단 후 출시되다: 최초의 단계적 오픈 웨이트 출시 — 부모 문서. 744B 플래그십의 2주 안전 중단, 2,436건 취약점 공개 목록, 매출 연동 라이선스, 그리고 본 짝문서가 Flash 변형으로 확장하는 다섯 번째 출시 전략
- DeepSeek V4.1-Flash와 무음 모델 교체: 벤더는 동의 없이 당신의 프로덕션 에이전트를 자동 라우팅한다 — 역방향 데이터 포인트. 모델을 묻지 않고 바꾼 벤더가 사용자 압력으로 철회했습니다. 당신이 소유한 라우팅 레이어가 안전장치입니다
- 추론 경제학: always-on 프로덕션 에이전트가 이제 저렴한 이유 — 비용 붕괴의 부모 문서. 토큰당 비용 1,000배 하락, 통합 대 모델 비용의 10:1 비율, 그리고 모델이 비용의 10%이고 통합이 90%인 이유
NetSuite, BigCommerce, 세 개의 공급업체 카탈로그를 운영하는 지역 유통업체가 태스크별로 라우팅하는 견적 에이전트를 배치했습니다. 카탈로그 검색과 재고 확보는 GLM-5.3-Flash가 백만 토큰당 0.15/0.50달러로 처리합니다 — 워크플로의 80%를 담당하는 에이전트 도구 사용 레인의 비용 최적화 기본값입니다. 등급 가격과 FX를 포함한 견적 생성은 신뢰도가 임계값 아래로 떨어지면 거버넌스가 적용된 MCP 모듈 뒤의 폐쇄형 프런티어 모델로 에스컬레이션됩니다. Flash 변형의 셀프호스팅 엔드포인트는 같은 MCP 모듈, 같은 감사 로그 위에서 작동하며 재배포가 필요 없습니다 — 구성 변경이지 조달 협상이 아닙니다. Anthropic 분석이 Flash 변형의 사이버 능력을 확인했을 때, 보안 팀은 같은 모델을 최소 권한 도구 접근과 네트워크 송신 허용 목록 뒤의 셀프호스팅 코드베이스 취약점 스캐너로 추가했습니다 — 킬스위치 아키텍처가 규정하는 거버넌스 경계로, 능력과 별도로 부여됩니다. 이런 빌드는 보통 5~8주 안에 가동됩니다.
범위가 정해진 빌드를 요청하세요. 1주일 디스커버리. 시스템 인벤토리, 워크플로우 맵, 고정 범위를 받습니다 — 저희와 빌드하든 아니든.
귀하의 시스템을 위해 이것을 구축하고 싶으신가요?
여기의 각 문서는 실제 프로덕션 작업에서 나왔습니다. 대상 시스템과 워크플로가 있다면, 1주 내에 빌드를 범위 정의할 수 있습니다.
범위 정의 빌드 요청1주 발견. 시스템 인벤토리, 워크플로 맵, 고정 범위를 받습니다 — 우리와 빌드할지 여부와 관계없이.