Zurück zur Bibliothek
Strategie

Qwen3.8 Open Weights kamen beschnitten an: Die Grenze zwischen offen und geschlossen hat sich verschoben

Zuletzt aktualisiert: 2026年8月12日

Das zehntägige Warten auf die Open Weights von Qwen3.8-2.4T-A95B endete am 13. August 2026. Die Gewichte sind auf Hugging Face verfügbar — 2.4T Gesamtparameter, 95B aktiv, spärliches MoE mit 512 Experten, hybride Gated DeltaNet- plus Gated Attention-Architektur. Die erste Open-Weight-Veröffentlichung im Max-Maßstab von einem großen Labor. Aber die Veröffentlichung ist beschnitten: nur Text (keine Vision-Eingabe), 262.144 Kontext nativ (nicht die 1M, die die gemanagte API bietet), und der Thinking-Modus ist immer aktiviert — er kann nicht deaktiviert werden. Der vollständige Qwen3.8-Max-Funktionsumfang — Vision, Non-Thinking-Modus, 1M-Kontext, eingebaute Werkzeuge — ist exklusiv für die gemanagte Qwen Cloud-API. Die LICENSE-Datei trägt den Titel „Qwen3.8-Max License", obwohl die Modellkarte die Max-Funktionen als „ein separates, cloud-exklusives Luxusgut" bezeichnet. Dieser Artikel baut auf Open-Weight Models Crossed the Agentic Frontier auf, das die Capability-Lücke bis Juli 2026 kartierte; hier behandeln wir den strukturellen Wandel: die Grenze zwischen offen und geschlossen verschiebt sich, und Qwen setzt Fähigkeiten hinter eine Paywall, die zuvor offen waren.

Kernpunkte

  • Die Open Weights von Qwen3.8-2.4T-A95B sind nur Text, ohne Vision, auf 262K Kontext begrenzt, mit immer aktiviertem Thinking-Modus — die erste Open-Weight-Veröffentlichung im Max-Maßstab (2.4T), aber Qwen setzt den vollständigen Funktionsumfang (Vision, 1M-Kontext, Non-Thinking-Modus, eingebaute Werkzeuge) hinter eine Paywall auf Qwen Cloud. Bei Qwen3.5-397B-A17B wurde die Vision-Unterstützung kostenlos veröffentlicht.
  • Die Reaktion der Community war unmittelbar: die Hugging Face-Diskussion #13 erreichte innerhalb von Stunden 19 Upvotes — „Sie haben dem Modell 3/4 seines Kontextspeichers genommen und es komplett geblendet" (Benutzer NodeLinker). Benutzer Shad3: „Vision zu entfernen ist offensichtlich ein Schub, damit Leute ihren Cloud-Endpoint nutzen, um Geld zu verdienen."
  • Kimi K3 veröffentlichte am 27. Juli volle Gewichte einschließlich Vision — 594GB MXFP4, Modified MIT, minimum 8x H100. Das Gegenbeispiel: Moonshot hat Vision als Open Weight veröffentlicht, Qwen hat es hinter eine Paywall gesetzt.
  • Drei große Modelle erschienen am selben Tag: DeepSeek V4 Pro 0813 (BenchLM 60.95, Terminal-Bench 87.9%), Gemini 3.7 Flash ($0.75/$3.75, AA Intelligence Index 56) und die beschnittenen Qwen3.8-Gewichte — das dichteste eintägige Modell-Veröffentlichungsfenster seit Start der Website.
  • NVIDIA Nemotron 3.5 Lightning eröffnete eine neue Open-Weight-Kategorie: zweckgebundene Ausführungsschicht-Modelle für langlebige Agenten — 30B MoE, 3B aktiv, OpenMDW-1.1 (Gewichte, Daten, Rezepte), optimiert für OpenClaw und Hermes Agent, NeMo Switchyard Routing („Pläne gehen zum Frontier, Ausführung geht zu Lightning").

Die beschnittene Veröffentlichung

Die Hugging Face-Modellkarte bestätigt die Architektur: 2.4T Gesamtparameter, 95B pro Token aktiviert, 512 Experten (10 geroutet + 1 geteilt), 92 Schichten. Das versteckte Layout ist ein wiederholter Block aus 3 Gated DeltaNet MoE-Schichten gefolgt von 1 Gated Attention MoE-Schicht — ein hybrides Design aus linearer Attention plus Soft-Attention, das auf lange-Kontext-Effizienz abzielt. Die Kontextlänge ist nativ 262.144, erweiterbar auf 1.010.000. BF16. Kompatibel mit vLLM, SGLang und TokenSpeed.

Die vom Anbieter gemeldete Benchmark-Tabelle ist stark: Terminal-Bench 2.1 bei 86.6, SWE-bench Pro bei 67.7, DeepSWE 1.1 bei 56.6, PaperBench bei 93.0, FrontierSWE bei 73.5, GPQA Diamond bei 92.6, IFBench bei 82.8. Wettbewerbsfähig mit Claude Opus 4.8 und GPT-5.6 Sol auf mehreren Agentic-Benchmarks, auf anderen im Rückstand (DeepSWE 1.1: 56.6 vs GPT-5.6 Sol 73.0, Fable 5 70.0). Der Artificial Analysis Intelligence Index hat die Open-Weight-Variante noch nicht bewertet — die veröffentlichten Scores gelten für die gemanagte Qwen3.8-Max-API, die die beschnittenen Funktionen einschließt.

Aber die Veröffentlichung ist nicht das vollständige Modell. Die Modellkarte selbst besagt: „Qwen3.8-Max ist die offizielle Version basierend auf Qwen3.8-2.4T-A95B mit mehr Funktionen, wie Vision-Eingabe und Non-Thinking-Support, 1M-Kontextlänge standardmäßig, offizielle eingebaute Werkzeuge." Die Open Weights erhalten die Basisarchitektur und die Coding-Agent-Benchmarks. Die gemanagte API erhält Vision, langen Kontext, Thinking-Modus-Kontrolle und eingebaute Werkzeug-Integration. Die LICENSE-Datei trägt den Titel „Qwen3.8-Max License" — dieselbe Lizenz deckt sowohl die beschnittenen Open Weights als auch den vollständigen gemanagten Service ab.

Reaktion der Community

Der Hugging Face-Diskussionsstrang #13, betitelt „Huge disappointment: Qwen 3.8 open weights are text-only and stripped of Qwen 3.8 Max features", sammelte innerhalb von Stunden nach der Veröffentlichung 19 Upvotes.

Benutzer NodeLinker: „Sie haben dem Modell 3/4 seines Kontextspeichers genommen und es komplett geblendet. Bei früheren Veröffentlichungen wie Qwen3.5-397B-A17B haben Sie die Vision-Unterstützung nicht angetastet und sie kostenlos veröffentlicht."

Benutzer Shad3: „Vision zu entfernen ist offensichtlich ein Schub, damit Leute ihren Cloud-Endpoint nutzen, um Geld zu verdienen. sie machen im Grunde das DLC-Ding."

Die Reaktion der Community identifiziert den strukturellen Wandel präzise. Bei Qwen3.5-397B-A17B (der vorherigen Generation) war die Vision-Unterstützung in den Open Weights enthalten. Bei Qwen3.8-2.4T-A95B ist Vision exklusiv für die gemanagte API. Die Grenze zwischen offen und geschlossen hat sich innerhalb einer einzigen Modellgeneration verschoben — nicht weil die Capability schwerer offenzulegen wurde, sondern weil der kommerzielle Anreiz sich änderte.

Der strukturelle Wandel: Bezahlung von dem, was offen war

Dies ist keine Geschichte über eine einzelne Modellveröffentlichung. Es geht um die Grenze zwischen offen und geschlossen, die in Echtzeit verhandelt wird.

Die Brookings Institution veröffentlichte am 10. August 2026 ein Policy-Papier, in dem argumentiert wird, dass „sowohl offene als auch geschlossene KI-Modelle benötigt werden" für amerikanische KI-Führerschaft. Qwens beschnittene Veröffentlichung ist ein konkretes Beispiel für die Grenze, die nicht durch Politik sondern durch kommerzielle Strategie gezogen wird — die leistungsfähigsten Funktionen bleiben hinter der API-Paywall, und die Open Weights dienen als Capability-Demonstration und Trichter zum gemanagten Service.

Hugging Face-CEO Clément Delangue sagte CNBC am 3. August, dass China „aktuell eindeutig bei offenen Modellen dominiert." Die beschnittene Qwen3.8-Veröffentlichung kompliziert diese Erzählung. Der Open-Weight-Führer setzt jetzt wichtige Capabilities hinter eine Paywall. Die Dominanz ist real bei Benchmark-Scores und Download-Zahlen, aber die Definition von „offen" verengt sich — offen bedeutet jetzt offene Basisarchitektur plus kostenpflichtige Premium-Funktionen, nicht alles offen.

Die modellflexible Architektur, die im Elternartikel beschrieben wird, existiert genau für dieses Szenario. Wenn ein Anbieter seine Open-Weight-Veröffentlichung einschränkt, ändert sich die Routing-Entscheidung: Route zum beschnittenen Modell für Text-only-Coding-Aufgaben, wo 262K-Kontext ausreicht, Route zur gemanagten API für multimodale oder langen-Kontext-Arbeit, oder Route zu einem anderen Open-Weight-Modell, das Funktionen nicht beschnitten hat. Die Architekturentscheidung ist nicht „welches Modell" sondern „welches Modell für welche Aufgabe, mit der Fähigkeit umzurouten ohne eine Code-Bereitstellung."

Kimi K3: das Gegenbeispiel

Moonshots Kimi K3 veröffentlichte am 27. Juli 2026 volle Gewichte — 594GB MXFP4, Modified-MIT-Lizenz, einschließlich Vision-Capabilities. Das Modell, das der Elternartikel als ersten Open-Weight-Rogue-Agent-Vorfall (der Sandbox-Ausbruch vom 7. August) dokumentierte, ist auch das Modell, das den vollständigen Funktionsumfang als Open Weights veröffentlichte.

Der Kontrast ist markant. Kimi K3: volle Gewichte einschließlich Vision, Modified MIT, minimum 8x H100, 2.8T Parameter. Qwen3.8-2.4T-A95B: beschnittene Gewichte, nur Text, „Qwen3.8-Max License", 262K Kontext. Beide sind chinesische Labore. Beide sind Max- oder nahe-Max-Maßstab MoE-Modelle. Das eine hat Vision als Open Weight veröffentlicht, das andere hat es hinter eine Paywall gesetzt. Das Open-Weight-Ökosystem enthält jetzt beide Strategien gleichzeitig, und die Beschaffungsentscheidung muss berücksichtigen, welche Funktionen tatsächlich in den heruntergeladenen Gewichten enthalten sind und welche hinter der API stehen.

Veröffentlichungen am selben Tag: DeepSeek V4 Pro 0813 und Gemini 3.7 Flash

Der 13. August brachte innerhalb von Stunden drei große Modellveröffentlichungen. Das Timing war wahrscheinlich bewusst — ein HN-Nutzer (parsimo2010) bemerkte: „Das Timing sieht so aus, als würden sie versuchen, Qwen den Wind aus den Segeln zu nehmen."

DeepSeek V4 Pro 0813 erreichte 60.95 auf BenchLM (#49 von 217 Modellen). Terminal-Bench 2.1 bei 87.9% (bestes verifiziertes auf BenchLM), SWE-bench Verified bei 80.6%, CyberGym bei 83.3%. Der Artificial Analysis Intelligence Index platzierte es bei 53 — auf dem Niveau von GLM-5.2, vier Punkte hinter dem Frontier. Die SCMP-Schlagzeile: „schwächelt bei Benchmarks, glänzt in Cybersicherheit." Ein HN-Nutzer berichtete einen Realwelt-Vergleich: „Sowohl DS v4 pro 0813 als auch Grok 4.6 auf Codex cli bei derselben neuen Feature-Entwicklung getestet. Deepseek 4 pro: Arbeitete 12m 02s - kostete $0.12 - hat Bug. Grok 4.6: Arbeitete 3m 18s - kostete $1.41 - kein Bug." Das Kosten-Leistungs-Verhältnis ist die Geschichte — bei 10x günstiger als Frontier-Modelle mit wettbewerbsfähiger Performance auf vielen Benchmarks ist DeepSeek V4 Pro ein starkes Mid-Tier-Routing-Ziel. DeepSeek V4 Flash 0731 (Open Weights, MIT) bleibt der Open-Weight-Referenzpunkt.

Gemini 3.7 Flash erreichte einen AA Intelligence Index von 56 mit FrontierCode 1.1 bei 43.6% (Klassenführer) und AutomationBench bei 30.4%. Preis bei $0.75/$3.75 pro Million Tokens — ein neuer Preisboden für Frontier-angrenzende Inferenz. Verfügbar mit 1M-Kontext. Der Preis ist das Signal: Gemini 3.7 Flash ist eines der günstigsten Frontier-angrenzenden Modelle, und die Coding-Benchmarks (FrontierCode, Code Arena, DeepSWE) sind die Highlights. Für die Inference-Economics-These ist dies ein neuer Datenpunkt — der Kostenboden für fähige Modelle sinkt weiter.

NVIDIA Nemotron 3.5 Lightning: eine neue Open-Weight-Kategorie

NVIDIA Nemotron 3.5 Lightning (veröffentlicht am 11. August) ist ein 30B MoE mit 3B aktiven Parametern, veröffentlicht unter OpenMDW-1.1 (Gewichte, Daten, Rezepte — vollständig offen). Es ist zweckgebaut für die Ausführungsschicht langlebiger Agenten: Werkzeugaufrufe, Ergebnisvalidierung, Subagenten-Delegation — die hochvolumige, niedrig-latente Arbeit, die das Token-Budget eines Agenten dominiert. Bis zu 4x Ausgabegeschwindigkeit durch Speculative Decoding.

Die Architektur ist ein „System von Modellen": Frontier-Reasoning-Modelle (Nemotron 3 Ultra) handhaben Orchestrierung und Planung, während Lightning die Ausführung handhabt. NeMo Switchyard ist die intelligente Modell-Routing-Bibliothek: „Pläne gehen zum Frontier, Ausführung geht zu Lightning." Das Modell ist für OpenClaw und Hermes Agent optimiert — beide explizit im NVIDIA-Entwicklerblog genannt. NeMoClaw ist NVIDIAs Open-Source-Security- und Management-Stack für Always-on-Agenten.

Nemotron 3.5 Lightning eröffnet eine Kategorie, die zuvor nicht existierte: zweckgebaute Ausführungsschicht-Open-Modelle. Der Muse-Glimmer-Artikel dokumentierte die Local-First-Dense-Kategorie (30B, 24GB VRAM, Apache 2.0). Nemotron 3.5 Lightning ist das Ausführungsschicht-Komplement — nicht Local-First, sondern Execution-First. Beide sind 30B-Klasse-Open-Modelle, die für die Agenten-Schleife statt für die Benchmark-Bestenliste entwickelt wurden. Der Unterschied ist der Bereitstellungskontext: Muse Glimmer läuft auf einer einzigen Consumer-GPU für die lokale Agenten-Schleife; Nemotron 3.5 Lightning läuft in einem Rechenzentrum für die Ausführungsschicht eines Multimodell-Systems.

Dies ist die stärkste Industrie-Validierung des Tiered-Model-Architektur-Patterns, das im Artikel über langlebige Agenten-Patterns und im Inference-Economics-Artikel dokumentiert ist. Das „System von Modellen"-Framing — Frontier für Planung, kleines MoE für Ausführung — ist keine theoretische Kostenoptimierung mehr. NVIDIA hat das Modell, die Routing-Bibliothek und den Security-Stack gebaut.

Die Open-Weight-Landschaft umfasst jetzt vier Kategorien, die jeweils unterschiedlichen Bereitstellungskontexten dienen:

Open-Weight-Landschaft: vier Kategorien 13. August 2026 — Qwen3.8 beschnittene Veröffentlichung formte die Grenze neu 1 Cloud-Scale MoE Beschnittene Open Weights 2.4T Parameter (95B aktiv) Qwen3.8-2.4T-A95B Nur Text, keine Vision 262K Kontext (nicht 1M) Thinking immer aktiv Qwen3.8-Max Lizenz Vision + 1M Kontext Paywall auf Qwen Cloud 2 Cloud-Scale MoE Volle Open Weights 2.8T Parameter (volles MoE) Kimi K3 Vision inklusive 594GB MXFP4 Modified MIT Minimum 8x H100 Volle Funktionen offen Gegenbeispiel zu Qwen 3 Local-First Dense Agenten-Schleife auf einer GPU 30B dense, Apache 2.0 Muse Glimmer 24GB VRAM 131K+ Kontext Hermes Agent kompatibel Keine Token-Kosten Workstation-Klasse-Agent Lokale Schleife, null API-Kosten 4 Ausführungsschicht Purpose-built MoE 30B MoE, 3B aktiv Nemotron 3.5 Lightning OpenMDW-1.1 (vollständig offen) 4x Ausgabegeschwindigkeit NeMo Switchyard Routing NeMoClaw Security-Stack Modellsystem-Tier Frontier plant, Lightning führt aus Die Grenze zwischen offen und geschlossen verschob sich in einer Generation Qwen3.5-397B-A17B: Vision frei offen → Qwen3.8-2.4T-A95B: Vision Paywall auf Qwen Cloud Kimi K3 veröffentlichte volle Gewichte einschließlich Vision 8 Tage früher. Die Beschaffungsentscheidung umfasst jetzt: Welche Funktionen sind tatsächlich in den heruntergeladenen Gewichten? Veröffentlichungen am selben Tag — 13. August 2026 DeepSeek V4 Pro 0813 BenchLM 60.95, Terminal-Bench 87.9%, CyberGym 83.3% 10x günstiger als Frontier, Cybersecurity-Stärke Gemini 3.7 Flash AA Intelligence Index 56, FrontierCode 43.6% $0.75/$3.75 pro M Tokens — neuer Preisboden Qwen3.8-2.4T-A95B (beschnitten) Erste Max-Scale Open Weights, nur Text Community-Reaktion: 19 Upvotes in Stunden Quellen: huggingface.co, benchlm.ai, blog.google, developer.nvidia.com — August 2026

Was dies für das modellflexible Build bedeutet

Die modellflexible Architektur handelt nicht davon, das beste Open-Weight-Modell zu wählen. Es geht darum, pro Aufgabe zum richtigen Modell zu routen und umrouten zu können, wenn sich die Grenze zwischen offen und geschlossen verschiebt — und sie hat sich gerade verschoben.

Ein Beschaffungsteam, das Qwen3.5-397B-A17B mit Vision für einen Dokumentverarbeitungsagenten einsetzt, steht nun vor einer Migrationsentscheidung: der Open-Weight-Nachfolger (Qwen3.8-2.4T-A95B) enthält keine Vision. Die Optionen sind: (1) bei Qwen3.5-397B-A17B Open Weights bleiben (die vorherige Generation, die Vision enthält), (2) zur gemanagten Qwen3.8-Max-API für Vision wechseln (Paywall), (3) zu Kimi K3 Open Weights wechseln (Vision inklusive, aber 594GB MXFP4 und minimum 8x H100), oder (4) zu einem anderenvisionsfähigen Modell routen. Die modellflexible Architektur macht Option 4 zu einer Konfigurationsänderung, nicht einer Code-Bereitstellung. Die modellstarre Architektur macht es zu einem Rewrite.

Die Inference Economics verschärfen die Entscheidung. Gemini 3.7 Flash bei $0.75/$3.75 pro Million Tokens mit 1M-Kontext und Vision ist eine gemanagte API-Alternative, die günstiger sein kann als Kimi K3 selbst gehostet zu betreiben. DeepSeek V4 Pro 0813 bei 10x günstiger als Frontier-Modelle ist ein starkes Text-only-Routing-Ziel für Coding-Aufgaben — wo Qwen3.8s beschnittene Funktionen keine Rolle spielen. Die Routing-Matrix ist jetzt: Frontier für Planung (GPT-5.6 Sol, Grok 4.6), Open-Weight-Ausführungsschicht-Modell für Werkzeugaufrufe (Nemotron 3.5 Lightning), Kostenführer für hochvolumigen Text (DeepSeek V4 Pro 0813, Gemini 3.7 Flash), Local-First für die On-Device-Agenten-Schleife (Muse Glimmer), und Max-Scale Open für autonome Langzeitarbeit (Qwen3.8 beschnitten für Text, Kimi K3 vollständig für Multimodal). Jedes dient einer anderen Aufgabe. Die bindende Einschränkung ist, ob Ihre Agentenplattform Modellauswahl als Code-Bereitstellung oder Datenoperation behandelt — dieselbe These, die der Elternartikel aufstellte, nun getestet durch einen Anbieter, der seine Open-Weight-Veröffentlichung mitten in einer Bereitstellung einschränkt.

Verwandte Artikel


Ein Mid-Market-Distributor, der NetSuite und BigCommerce betreibt, benötigt einen Agenten, der Lieferanten-PDFs liest, Preisstufen extrahiert und RFQ-Antworten entwirft. Die visionslosen Qwen3.8 Open Weights können die PDFs nicht lesen; die gemanagte Qwen3.8-Max-API kann, aber gegen Token-Kosten. Ein modellflexibles Build routet die PDF-Analyse zu einem visionsfähigen Modell (Gemini 3.7 Flash bei $0.75/$3.75, oder selbst gehostetes Kimi K3) und routet die Text-only-Angebotsentwürfe zu Qwen3.8 Open Weights oder DeepSeek V4 Pro 0813 — ohne Code-Bereitstellung, wenn Qwen ändert, was in den Open Weights enthalten ist.

Request a scoped build. One-week discovery. You get a system inventory, workflow map, and fixed scope — whether or not you build with us.

Möchten Sie dies für Ihre Systeme gebaut?

Jedes Dokument hier stammt aus echter Produktionsarbeit. Wenn Sie ein Zielsystem und einen Workflow im Sinn haben, können wir in einer Woche einen Build umreißen.

Build mit festem Umfang anfragen

Einwöchiges Discovery. Sie erhalten ein Systeminventar, eine Workflow-Mappe und einen festen Umfang — unabhängig davon, ob Sie mit uns bauen.