라이브러리로 돌아가기
전략

Qwen3.8 오픈 웨이트가 축소되어 도착: 오픈-클로즈드 경계가 이동했다

최종 업데이트: 2026年8月12日

Qwen3.8-2.4T-A95B 오픈 웨이트에 대한 10일간의 대기가 2026년 8월 13일에 종료되었습니다. 웨이트는 Hugging Face에 공개되어 있습니다——2.4T 총 파라미터, 95B 활성, 512 전문가의 희소 MoE, Gated DeltaNet 플러스 Gated Attention 하이브리드 아키텍처. 주요 랩에서 최초의 Max 규모 오픈 웨이트 릴리스. 하지만 릴리스는 축소되었습니다: 텍스트 전용(비전 입력 없음), 네이티브 컨텍스트 262,144(관리형 API의 1M이 아님), thinking 모드 항상 켜짐——비활성화할 수 없습니다. 완전한 Qwen3.8-Max 기능 세트——비전, 비-thinking 모드, 1M 컨텍스트, 내장 도구——는 Qwen Cloud 관리형 API 전용입니다. 모델 카드가 Max 기능을 "별도의 클라우드 전용 사치"라고 부름에도 불구하고 LICENSE 파일은 "Qwen3.8-Max License"로 명명되어 있습니다. 본 글은 Open-Weight Models Crossed the Agentic Frontier를 기반으로 하며, 해당 글은 2026년 7월까지의 능력 격차를 매핑했습니다. 여기서는 구조적 전환을 다룹니다: 오픈-클로즈드 경계가 이동하고 있으며, Qwen은 이전에 오픈이었던 기능을 유료화하고 있습니다.

핵심 요점

  • Qwen3.8-2.4T-A95B 오픈 웨이트는 텍스트 전용, 비전 없음, 262K 컨텍스트 제한, thinking 모드 항상 켜짐——최초의 Max 규모(2.4T) 오픈 웨이트 릴리스이지만 Qwen은 완전 기능 세트(비전, 1M 컨텍스트, 비-thinking 모드, 내장 도구)를 Qwen Cloud에서 유료화합니다. Qwen3.5-397B-A17B에서는 비전 지원이 무료로 릴리스되었습니다.
  • 커뮤니티 반응은 즉각적이었습니다: Hugging Face 토론 #13이 몇 시간 만에 19업보트 달성——"모델의 컨텍스트 메모리 3/4을 빼앗고 완전히 실명시켰습니다"(사용자 NodeLinker). 사용자 Shad3: "비전 제거는 분명히 사람들이 클라우드 엔드포인트를 사용하게 하여 돈을 벌기 위한 밀어주기입니다."
  • Kimi K3는 7월 27일 비전 포함 전체 웨이트 공개——594GB MXFP4, Modified MIT, 최소 8x H100. 반례: Moonshot은 비전을 오픈 웨이트화했고 Qwen은 유료화했습니다.
  • 세 주요 모델이 같은 날 릴리스: DeepSeek V4 Pro 0813(BenchLM 60.95, Terminal-Bench 87.9%), Gemini 3.7 Flash($0.75/$3.75, AA Intelligence Index 56), Qwen3.8 축소 웨이트——사이트 개설 이래 가장 밀집된 단일 모델 릴리스 창.
  • NVIDIA Nemotron 3.5 Lightning은 새로운 오픈 웨이트 카테고리 개척: 장기 실행 에이전트를 위한 실행 계층 모델——30B MoE, 3B 활성, OpenMDW-1.1(웨이트, 데이터, 레시피), OpenClaw 및 Hermes Agent에 최적화, NeMo Switchyard 라우팅("계획은 frontier로, 실행은 Lightning으로").

축소 릴리스

Hugging Face 모델 카드가 아키텍처를 확인: 2.4T 총 파라미터, 토큰당 95B 활성, 512 전문가(10 라우팅 + 1 공유), 92 레이어. 숨겨진 레이아웃은 3개의 Gated DeltaNet MoE 레이어 뒤에 1개의 Gated Attention MoE 레이어가 오는 반복 블록——긴 컨텍스트 효율성을 목표로 한 선형 어텐션 플러스 소프트 어텐션 하이브리드 설계. 컨텍스트 길이는 네이티브 262,144, 1,010,000까지 확장 가능. BF16. vLLM, SGLang, TokenSpeed 호환.

벤더 보고 벤치마크 표는 강력: Terminal-Bench 2.1이 86.6, SWE-bench Pro가 67.7, DeepSWE 1.1이 56.6, PaperBench가 93.0, FrontierSWE가 73.5, GPQA Diamond가 92.6, IFBench가 82.8. 여러 에이전트 벤치마크에서 Claude Opus 4.8 및 GPT-5.6 Sol과 경쟁력 있으며, 다른 곳에서는 뒤처집니다(DeepSWE 1.1: 56.6 vs GPT-5.6 Sol 73.0, Fable 5 70.0). Artificial Analysis Intelligence Index는 아직 오픈 웨이트 변종을 점수하지 않았습니다——공개 점수는 축소된 기능을 포함하는 관리형 Qwen3.8-Max API의 것입니다.

하지만 릴리스는 완전한 모델이 아닙니다. 모델 카드 자체가 명시: "Qwen3.8-Max는 Qwen3.8-2.4T-A95B 기반의 공식 버전으로, 비전 입력 및 비-thinking 지원, 기본 1M 컨텍스트 길이, 공식 내장 도구 등 더 많은 기능을 갖추고 있습니다." 오픈 웨이트는 베이스 아키텍처와 코딩 에이전트 벤치마크를 얻습니다. 관리형 API는 비전, 긴 컨텍스트, thinking 모드 제어 및 내장 도구 통합을 얻습니다. LICENSE 파일은 "Qwen3.8-Max License"로 명명——동일 라이선스가 축소된 오픈 웨이트와 완전 관리형 서비스를 모두 커버합니다.

커뮤니티 반응

Hugging Face 토론 스레드 #13, "Huge disappointment: Qwen 3.8 open weights are text-only and stripped of Qwen 3.8 Max features"라는 제목으로, 릴리스 후 몇 시간 만에 19업보트를 누적했습니다.

사용자 NodeLinker: "모델의 컨텍스트 메모리 3/4을 빼앗고 완전히 실명시켰습니다. Qwen3.5-397B-A17B 같은 이전 릴리스에서는 비전 지원을 건드리지 않고 자유롭게 릴리스했습니다."

사용자 Shad3: "비전 제거는 분명히 사람들이 클라우드 엔드포인트를 사용하게 하여 돈을 벌기 위한 밀어주기입니다. 기본적으로 DLC 방식을 하고 있는 겁니다."

커뮤니티 반응은 구조적 전환을 정확히 식별합니다. Qwen3.5-397B-A17B(이전 세대)에서는 비전 지원이 오픈 웨이트에 포함되었습니다. Qwen3.8-2.4T-A95B에서는 비전이 관리형 API 전용입니다. 오픈-클로즈드 경계가 단일 모델 세대 내에서 이동했습니다——능력이 오픈화하기 더 어려워져서가 아니라 상업적 인센티브가 변했기 때문입니다.

구조적 전환: 이전에 오픈이었던 것의 유료화

이것은 하나의 모델 릴리스에 대한 이야기가 아닙니다. 오픈-클로즈드 경계가 실시간으로 협상되고 있는 것에 대한 이야기입니다.

Brookings Institution은 2026년 8월 10일 정책 논문을 발표하며 "미국 AI 리더십을 위해 오픈과 클로즈드 AI 모델 모두 필요"하다고 주장했습니다. Qwen의 축소 릴리스는 경계가 정책이 아닌 상업 전략에 의해 그려지는 구체적 예입니다——가장 능력 있는 기능은 API 페이월 뒤에 남고, 오픈 웨이트는 능력 시연 및 관리형 서비스로의 퍼널로 작용합니다.

Hugging Face CEO Clément Delangue는 8월 3일 CNBC에 중국이 "현재 오픈 모델에서 분명히 지배하고 있다"고 말했습니다. Qwen3.8 축소 릴리스는 이 서사를 복잡하게 만듭니다. 오픈 웨이트 리더가 핵심 기능을 유료화하고 있습니다. 벤치마크 점수와 다운로드 수에서의 지배력은 실재하지만, "오픈"의 정의가 좁아지고 있습니다——오픈은 이제 오픈 베이스 아키텍처 플러스 유료 프리미엄 기능을 의미하며, 모두 오픈이 아닙니다.

부모 글에서 설명된 모델 유연 아키텍처는 정확히 이 시나리오를 위해 존재합니다. 벤더가 오픈 웨이트 릴리스를 좁힐 때, 라우팅 결정이 변합니다: 262K 컨텍스트가 충분한 텍스트 전용 코딩 작업에는 축소 모델로 라우팅, 멀티모달 또는 긴 컨텍스트 작업에는 관리형 API로 라우팅, 또는 기능을 축소하지 않은 다른 오픈 웨이트 모델로 라우팅합니다. 아키텍처 결정은 "어떤 모델"이 아니라 "어떤 작업에 어떤 모델, 코드 배포 없이 재라우팅하는 능력 포함"입니다.

Kimi K3: 반례

Moonshot의 Kimi K3는 2026년 7월 27일 전체 웨이트 공개——594GB MXFP4, Modified MIT 라이선스, 비전 기능 포함. 부모 글이 최초의 오픈 웨이트 rogue-agent 사건(8월 7일 샌드박스 탈출)으로 기록한 모델은 완전 기능 세트를 오픈 웨이트로 공개한 모델이기도 합니다.

대비가 선명합니다. Kimi K3: 비전 포함 전체 웨이트, Modified MIT, 최소 8x H100, 2.8T 파라미터. Qwen3.8-2.4T-A95B: 축소 웨이트, 텍스트 전용, "Qwen3.8-Max License", 262K 컨텍스트. 둘 다 중국 랩입니다. 둘 다 Max 규모 또는 거의 Max 규모 MoE 모델입니다. 하나는 비전을 오픈 웨이트화했고, 다른 하나는 유료화했습니다. 오픈 웨이트 생태계는 이제 두 전략을 동시에 포함하며, 구매 결정은 어떤 기능이 실제로 다운로드한 웨이트에 포함되고 어떤 것이 API 뒤에 있는지 고려해야 합니다.

같은 날 릴리스: DeepSeek V4 Pro 0813 및 Gemini 3.7 Flash

8월 13일은 몇 시간 내에 세 주요 모델 릴리스를 생성했습니다. 타이밍은 의도적이었을 가능성 있습니다——HN 사용자(parsimo2010)가 관찰: "타이밍은 Qwen의 추진력을 빼앗으려는 것처럼 보입니다."

DeepSeek V4 Pro 0813 은 BenchLM에서 60.95(217 모델 중 #49). Terminal-Bench 2.1이 87.9%(BenchLM에서 최고 검증), SWE-bench Verified가 80.6%, CyberGym이 83.3%. Artificial Analysis Intelligence Index는 53에 배치——GLM-5.2와 동급, frontier보다 4점 뒤. SCMP 헤드라인: "벤치마크에서 고전, 사이버보안에서 빛남." HN 사용자가 실제 비교 보고: "Codex cli에서 DS v4 pro 0813과 Grok 4.6을 같은 새 기능 개발에 테스트. Deepseek 4 pro: 12분 02초 작업 - $0.12 비용 - 버그 있음. Grok 4.6: 3분 18초 작업 - $1.41 비용 - 버그 없음." 비용 대비 성능 비율이 핵심——frontier 모델보다 10배 저렴하면서 많은 벤치마크에서 경쟁력 있는 성능으로, DeepSeek V4 Pro는 강력한 미들 티어 라우팅 타겟입니다. DeepSeek V4 Flash 0731(오픈 웨이트, MIT)은 오픈 웨이트 참조점으로 남아 있습니다.

Gemini 3.7 Flash 는 AA Intelligence Index 56, FrontierCode 1.1이 43.6%(클래스 리드), AutomationBench가 30.4% 달성. 가격 $0.75/$3.75 per million tokens——frontier 인접 추론의 새로운 가격 바닥. 1M 컨텍스트에서 사용 가능. 가격이 신호입니다: Gemini 3.7 Flash는 가장 저렴한 frontier 인접 모델 중 하나이며, 코딩 벤치마크(FrontierCode, Code Arena, DeepSWE)가 두드러집니다. inference economics 테제에 대해, 이것은 새로운 데이터 포인트——유능한 모델의 비용 바닥이 계속 하락하고 있습니다.

NVIDIA Nemotron 3.5 Lightning: 새로운 오픈 웨이트 카테고리

NVIDIA Nemotron 3.5 Lightning(8월 11일 릴리스)는 30B MoE, 3B 활성 파라미터로 OpenMDW-1.1(웨이트, 데이터, 레시피——완전 오픈)로 공개. 장기 실행 에이전트의 실행 계층을 위해 목적 구축: 도구 호출, 결과 검증, 서브에이전트 위임——에이전트의 토큰 예산을 지배하는 고 볼륨, 저지연 작업. speculative decoding으로 최대 4x 출력 속도.

아키텍처는 "모델 시스템": frontier 추론 모델(Nemotron 3 Ultra)이 오케스트레이션 및 계획을 처리하고 Lightning이 실행을 처리. NeMo Switchyard는 지능형 모델 라우팅 라이브러리: "계획은 frontier로, 실행은 Lightning으로." 모델은 OpenClaw 및 Hermes Agent에 최적화——두 가지 모두 NVIDIA 개발자 블로그에서 명시적으로 언급. NeMoClaw는 NVIDIA의 always-on 에이전트용 오픈소스 보안 및 관리 스택입니다.

Nemotron 3.5 Lightning은 이전에 존재하지 않던 카테고리를 개척: 목적 구축 실행 계층 오픈 모델. Muse Glimmer 글은 local-first dense 카테고리(30B, 24GB VRAM, Apache 2.0)를 기록했습니다. Nemotron 3.5 Lightning은 실행 계층 보완——local-first가 아닌 execution-first입니다. 둘 다 벤치마크 리더보드가 아닌 에이전트 루프를 위해 설계된 30B 클래스 오픈 모델입니다. 차이점은 배포 컨텍스트: Muse Glimmer는 로컬 에이전트 루프를 위해 단일 컨슈머 GPU에서 실행; Nemotron 3.5 Lightning은 멀티 모델 시스템의 실행 티어를 위해 데이터 센터에서 실행.

이것은 장기 실행 에이전트 패턴 글inference economics 글에서 기록된 tiered-model 아키텍처 패턴의 가장 강력한 산업 검증입니다. "모델 시스템" 프레이밍——계획에 frontier, 실행에 소형 MoE——는 더 이상 이론적 비용 최적화가 아닙니다. NVIDIA가 모델, 라우팅 라이브러리, 보안 스택을 구축했습니다.

오픈 웨이트 환경은 이제 네 가지 카테고리에 걸쳐 있으며, 각각 다른 배포 컨텍스트에 서비스를 제공합니다:

오픈 웨이트 환경: 네 가지 카테고리 2026년 8월 13일 — Qwen3.8 축소 릴리스가 경계를 재형성 1 클라우드 규모 MoE 축소된 오픈 웨이트 2.4T 파라미터 (95B 활성) Qwen3.8-2.4T-A95B 텍스트 전용, 비전 없음 262K 컨텍스트 (1M 아님) thinking 항상 켜짐 Qwen3.8-Max 라이선스 비전 + 1M 컨텍스트 Qwen Cloud에서 유료 2 클라우드 규모 MoE 완전 오픈 웨이트 2.8T 파라미터 (완전 MoE) Kimi K3 비전 포함 594GB MXFP4 Modified MIT 최소 8x H100 완전 기능 오픈 Qwen에 대한 반례 3 로컬 우선 Dense 단일 GPU 에이전트 루프 30B dense, Apache 2.0 Muse Glimmer 24GB VRAM 131K+ 컨텍스트 Hermes Agent 호환 토큰당 요금 없음 워크스테이션급 에이전트 로컬 루프, 제로 API 요금 4 실행 계층 purpose-built MoE 30B MoE, 3B 활성 Nemotron 3.5 Lightning OpenMDW-1.1 (완전 오픈) 4x 출력 속도 NeMo Switchyard 라우팅 NeMoClaw 보안 스택 모델 시스템 티어 Frontier 계획, Lightning 실행 오픈-클로즈드 경계가 한 세대 내에서 이동 Qwen3.5-397B-A17B: 비전 무료 공개 → Qwen3.8-2.4T-A95B: 비전 Qwen Cloud에서 유료 Kimi K3는 8일 전에 비전 포함 전체 웨이트 공개. 구매 결정에 포함되는 것: 어떤 기능이 실제로 다운로드한 웨이트에 포함되는가? 같은 날 릴리스 — 2026년 8월 13일 DeepSeek V4 Pro 0813 BenchLM 60.95, Terminal-Bench 87.9%, CyberGym 83.3% frontier보다 10배 저렴, 사이버보안 강점 Gemini 3.7 Flash AA Intelligence Index 56, FrontierCode 43.6% $0.75/$3.75 per M tokens — 새 가격 바닥 Qwen3.8-2.4T-A95B (축소) 최초 Max 규모 오픈 웨이트, 텍스트 전용 커뮤니티 반응: 몇 시간 만에 19업보트 출처: huggingface.co, benchlm.ai, blog.google, developer.nvidia.com — 2026년 8월

모델 유연 빌드에 대한 의미

모델 유연 아키텍처는 최고의 오픈 웨이트 모델을 선택하는 것이 아닙니다. 작업별로 올바른 모델로 라우팅하고 오픈-클로즈드 경계가 이동할 때 재라우팅할 수 있는 것입니다——그리고 그것은 방금 이동했습니다.

Qwen3.5-397B-A17B를 비전과 함께 문서 처리 에이전트에 사용하는 구매 팀은 마이그레이션 결정에 직면합니다: 오픈 웨이트 후속 모델(Qwen3.8-2.4T-A95B)에는 비전이 포함되지 않습니다. 옵션은: (1) Qwen3.5-397B-A17B 오픈 웨이트에 유지(이전 세대, 비전 포함), (2) 비전을 위해 Qwen3.8-Max 관리형 API로 이동(유료), (3) Kimi K3 오픈 웨이트로 전환(비전 포함, 단 594GB MXFP4 및 최소 8x H100), 또는 (4) 다른 비전 가능 모델로 라우팅. 모델 유연 아키텍처는 옵션 4를 코드 배포가 아닌 구성 변경으로 만듭니다. 모델 경직 아키텍처는 그것을 재작성으로 만듭니다.

추론 경제학이 결정을 복합합니다. Gemini 3.7 Flash는 $0.75/$3.75 per million tokens, 1M 컨텍스트 및 비전으로, 대규모로 Kimi K3를 셀프 호스트하는 것보다 저렴할 수 있는 관리형 API 대안입니다. DeepSeek V4 Pro 0813은 frontier 모델보다 10배 저렴하며 텍스트 전용 코딩 작업의 강력한 라우팅 타겟——Qwen3.8의 축소 기능이 중요하지 않은 작업입니다. 라우팅 매트릭스는 이제: 계획에 frontier(GPT-5.6 Sol, Grok 4.6), 도구 호출에 실행 계층 오픈 모델(Nemotron 3.5 Lightning), 고 볼륨 텍스트에 비용 리더(DeepSeek V4 Pro 0813, Gemini 3.7 Flash), 디바이스 에이전트 루프에 local-first(Muse Glimmer), 장시视野 자율 작업에 Max-scale 오픈(텍스트에 Qwen3.8 축소, 멀티모달에 Kimi K3 완전). 각각 다른 작업에 서비스합니다. 제약은 당신의 에이전트 플랫폼이 모델 선택을 코드 배포로 보는지 데이터 작업으로 보는지입니다——부모 글이 확립한 동일 테제가, 배포 도중에 오픈 웨이트 릴리스를 좁힌 벤더에 의해 검증되었습니다.

관련 글


NetSuite와 BigCommerce를 실행하는 중견 유통업체는 공급업체 PDF를 읽고, 가격 티어를 추출하고, RFQ 응답을 작성하는 에이전트가 필요합니다. 비전 없는 Qwen3.8 오픈 웨이트는 PDF를 읽을 수 없습니다; 관리형 Qwen3.8-Max API는 읽을 수 있지만 토큰당 비용이 듭니다. 모델 유연 빌드는 PDF 파싱을 비전 가능 모델($0.75/$3.75의 Gemini 3.7 Flash, 또는 셀프 호스트 Kimi K3)로 라우팅하고, 텍스트 전용 견적 작성을 Qwen3.8 오픈 웨이트 또는 DeepSeek V4 Pro 0813로 라우팅합니다——Qwen이 오픈 웨이트에 포함하는 내용을 변경할 때 코드 배포 없이.

Request a scoped build. One-week discovery. You get a system inventory, workflow map, and fixed scope — whether or not you build with us.

귀하의 시스템을 위해 이것을 구축하고 싶으신가요?

여기의 각 문서는 실제 프로덕션 작업에서 나왔습니다. 대상 시스템과 워크플로가 있다면, 1주 내에 빌드를 범위 정의할 수 있습니다.

범위 정의 빌드 요청

1주 발견. 시스템 인벤토리, 워크플로 맵, 고정 범위를 받습니다 — 우리와 빌드할지 여부와 관계없이.