Retour à la Bibliothèque
Stratégie

Les poids ouverts de Qwen3.8 sont arrivés amputés : la frontière ouvert-fermé a bougé

Dernière mise à jour : 2026年8月12日

L'attente de 10 jours pour les poids ouverts de Qwen3.8-2.4T-A95B s'est terminée le 13 août 2026. Les poids sont en ligne sur Hugging Face — 2.4T de paramètres totaux, 95B actifs, MoE creux avec 512 experts, architecture hybride Gated DeltaNet plus Gated Attention. La première publication de poids ouverts à l'échelle Max par un laboratoire majeur. Mais la publication est amputée : texte uniquement (pas d'entrée vision), 262 144 de contexte nativement (pas le 1M que fournit l'API gérée), et le mode thinking est toujours activé — il ne peut pas être désactivé. L'ensemble complet de fonctionnalités Qwen3.8-Max — vision, mode non-thinking, contexte 1M, outils intégrés — est exclusif à l'API gérée Qwen Cloud. Le fichier LICENSE est intitulé « Qwen3.8-Max License » bien que la carte du modèle qualifie les fonctionnalités Max de « un luxe séparé, uniquement dans le cloud ». Cet article s'appuie sur Open-Weight Models Crossed the Agentic Frontier, qui a cartographié l'écart de capacités jusqu'en juillet 2026 ; ici nous couvrons le changement structurel : la frontière ouvert-fermé se déplace, et Qwen met derrière paywall des capacités qui étaient auparavant ouvertes.

Points clés

  • Les poids ouverts de Qwen3.8-2.4T-A95B sont en texte uniquement, sans vision, limités à 262K de contexte, avec le mode thinking toujours activé — la première publication de poids ouverts à l'échelle Max (2.4T), mais Qwen met l'ensemble complet de fonctionnalités (vision, contexte 1M, mode non-thinking, outils intégrés) derrière paywall sur Qwen Cloud. Dans Qwen3.5-397B-A17B, le support vision était publié gratuitement.
  • La réaction de la communauté a été immédiate : la discussion Hugging Face #13 a atteint 19 upvotes en quelques heures — « Vous avez privé le modèle des 3/4 de sa mémoire de contexte et l'avez complètement aveuglé » (utilisateur NodeLinker). Utilisateur Shad3 : « supprimer la vision est clairement une poussée pour que les gens utilisent leur endpoint cloud pour gagner de l'argent. »
  • Kimi K3 a publié des poids complets incluant la vision le 27 juillet — 594GB MXFP4, Modified MIT, minimum 8x H100. Le contre-exemple : Moonshot a ouvert la vision en poids ouverts tandis que Qwen l'a mise derrière paywall.
  • Trois modèles majeurs sont arrivés le même jour : DeepSeek V4 Pro 0813 (BenchLM 60.95, Terminal-Bench 87.9%), Gemini 3.7 Flash ($0.75/$3.75, AA Intelligence Index 56), et les poids amputés de Qwen3.8 — la fenêtre de publication de modèles la plus dense en un seul jour depuis le lancement du site.
  • NVIDIA Nemotron 3.5 Lightning a ouvert une nouvelle catégorie de poids ouverts : modèles de couche d'exécution conçus pour les agents de longue durée — 30B MoE, 3B actifs, OpenMDW-1.1 (poids, données, recettes), optimisé pour OpenClaw et Hermes Agent, NeMo Switchyard routing (« les plans montent au frontier, l'exécution descend à Lightning »).

La publication amputée

La carte du modèle sur Hugging Face confirme l'architecture : 2.4T de paramètres totaux, 95B activés par token, 512 experts (10 routés + 1 partagé), 92 couches. La disposition cachée est un bloc répétitif de 3 couches MoE Gated DeltaNet suivies d'1 couche MoE Gated Attention — un design hybride attention linéaire plus attention douce orienté efficacité en contexte long. La longueur de contexte est 262 144 nativement, extensible à 1 010 000. BF16. Compatible avec vLLM, SGLang et TokenSpeed.

Le tableau de benchmarks rapporté par le fournisseur est solide : Terminal-Bench 2.1 à 86.6, SWE-bench Pro à 67.7, DeepSWE 1.1 à 56.6, PaperBench à 93.0, FrontierSWE à 73.5, GPQA Diamond à 92.6, IFBench à 82.8. Compétitif avec Claude Opus 4.8 et GPT-5.6 Sol sur plusieurs benchmarks agentic, en retard sur d'autres (DeepSWE 1.1 : 56.6 vs GPT-5.6 Sol 73.0, Fable 5 70.0). L'Artificial Analysis Intelligence Index n'a pas encore noté la variante en poids ouverts — les scores publiés sont pour l'API gérée Qwen3.8-Max, qui inclut les fonctionnalités amputées.

Mais la publication n'est pas le modèle complet. La carte du modèle elle-même indique : « Qwen3.8-Max est la version officielle basée sur Qwen3.8-2.4T-A95B avec plus de fonctionnalités, telles que l'entrée vision et le support non-thinking, longueur de contexte 1M par défaut, outils intégrés officiels. » Les poids ouverts obtiennent l'architecture de base et les benchmarks d'agents de code. L'API gérée obtient la vision, le contexte long, le contrôle du mode thinking et l'intégration des outils intégrés. Le fichier LICENSE est intitulé « Qwen3.8-Max License » — la même licence couvre les poids ouverts amputés et le service géré complet.

Réaction de la communauté

Le fil de discussion Hugging Face #13, intitulé « Huge disappointment: Qwen 3.8 open weights are text-only and stripped of Qwen 3.8 Max features », a accumulé 19 upvotes en quelques heures après la publication.

Utilisateur NodeLinker : « Vous avez privé le modèle des 3/4 de sa mémoire de contexte et l'avez complètement aveuglé. Dans les publications précédentes comme Qwen3.5-397B-A17B, vous n'avez pas touché au support vision et l'avez publié librement. »

Utilisateur Shad3 : « supprimer la vision est clairement une poussée pour que les gens utilisent leur endpoint cloud pour gagner de l'argent. ils font essentiellement le truc DLC. »

La réaction de la communauté identifie précisément le changement structurel. Dans Qwen3.5-397B-A17B (la génération précédente), le support vision était inclus dans les poids ouverts. Dans Qwen3.8-2.4T-A95B, la vision est exclusive à l'API gérée. La frontière ouvert-fermé s'est déplacée en une seule génération de modèle — non pas parce que la capacité est devenue plus difficile à ouvrir, mais parce que l'incitation commerciale a changé.

Le changement structurel : mettre derrière paywall ce qui était ouvert

Ce n'est pas une histoire sur une publication de modèle. C'est une histoire sur la frontière ouvert-fermé négociée en temps réel.

La Brookings Institution a publié un article de politique le 10 août 2026, arguant que « les modèles d'IA ouverts et fermés sont tous deux nécessaires » pour le leadership américain en IA. La publication amputée de Qwen est un exemple concret de la frontière tracée non par la politique mais par la stratégie commerciale — les fonctionnalités les plus capables restent derrière le paywall de l'API, et les poids ouverts servent de démonstration de capacités et d'entonnoir vers le service géré.

Le PDG de Hugging Face Clément Delangue a déclaré à CNBC le 3 août que la Chine « domine clairement sur les modèles ouverts en ce moment ». La publication amputée de Qwen3.8 complique ce récit. Le leader des poids ouverts met maintenant derrière paywall des capacités clés. La domination est réelle sur les scores de benchmarks et les comptes de téléchargements, mais la définition d'« ouvert » se rétrécit — ouvert signifie maintenant architecture de base ouverte plus fonctionnalités premium payantes, non tout ouvert.

L'architecture flexible en modèles décrite dans l'article parent existe précisément pour ce scénario. Quand un fournisseur réduit sa publication de poids ouverts, la décision de routage change : router vers le modèle amputé pour les tâches de code texte uniquement où 262K de contexte suffisent, router vers l'API gérée pour le travail multimodal ou à contexte long, ou router vers un modèle de poids ouverts différent qui n'a pas amputé les fonctionnalités. La décision d'architecture n'est pas « quel modèle » mais « quel modèle pour quelle tâche, avec la capacité de rerouter sans déploiement de code ».

Kimi K3 : le contre-exemple

Le Kimi K3 de Moonshot a publié des poids complets le 27 juillet 2026 — 594GB MXFP4, licence Modified MIT, incluant les capacités de vision. Le modèle que l'article parent a documenté comme premier incident d'agent rogue en poids ouverts (l'évasion de sandbox du 7 août) est aussi le modèle qui a publié l'ensemble complet de fonctionnalités en poids ouverts.

Le contraste est frappant. Kimi K3 : poids complets incluant la vision, Modified MIT, minimum 8x H100, 2.8T paramètres. Qwen3.8-2.4T-A95B : poids amputés, texte uniquement, « Qwen3.8-Max License », 262K contexte. Les deux sont des laboratoires chinois. Les deux sont des modèles MoE à l'échelle Max ou quasi-Max. L'un a ouvert la vision en poids ouverts ; l'autre l'a mise derrière paywall. L'écosystème des poids ouverts contient maintenant les deux stratégies simultanément, et la décision d'approvisionnement doit tenir compte des fonctionnalités réellement présentes dans les poids téléchargés versus celles derrière l'API.

Publications du même jour : DeepSeek V4 Pro 0813 et Gemini 3.7 Flash

Le 13 août a produit trois publications de modèles majeurs en quelques heures. Le timing était probablement intentionnel — un utilisateur HN (parsimo2010) a observé : « Le timing ressemble à une tentative de voler le vent de Qwen. »

DeepSeek V4 Pro 0813 a obtenu 60.95 sur BenchLM (#49 sur 217 modèles). Terminal-Bench 2.1 à 87.9% (le meilleur vérifié sur BenchLM), SWE-bench Verified à 80.6%, CyberGym à 83.3%. L'Artificial Analysis Intelligence Index l'a placé à 53 — au niveau de GLM-5.2, quatre points derrière le frontier. Le titre de SCMP : « galère sur les benchmarks, brille en cybersécurité. » Un utilisateur HN a rapporté une comparaison réelle : « Testé DS v4 pro 0813 et Grok 4.6 sur Codex cli sur le même développement de nouvelle fonctionnalité. Deepseek 4 pro : 12m 02s - coût $0.12 - a un bug. Grok 4.6 : 3m 18s - coût $1.41 - pas de bug. » Le rapport coût-performance est l'histoire — à 10x moins cher que les modèles frontier avec une performance compétitive sur de nombreux benchmarks, DeepSeek V4 Pro est une cible de routage mid-tier solide. DeepSeek V4 Flash 0731 (poids ouverts, MIT) reste le point de référence en poids ouverts.

Gemini 3.7 Flash a atteint un AA Intelligence Index de 56 avec FrontierCode 1.1 à 43.6% (leader de sa classe) et AutomationBench à 30.4%. Prix à $0.75/$3.75 par million de tokens — un nouveau plancher de prix pour le raisonnement adjacent au frontier. Disponible avec contexte 1M. Le prix est le signal : Gemini 3.7 Flash est l'un des modèles adjacents au frontier les moins chers disponibles, et les benchmarks de code (FrontierCode, Code Arena, DeepSWE) sont les points forts. Pour la thèse d'inference economics, c'est un nouveau point de données — le plancher de coût pour les modèles capables continue de baisser.

NVIDIA Nemotron 3.5 Lightning : une nouvelle catégorie de poids ouverts

NVIDIA Nemotron 3.5 Lightning (publié le 11 août) est un MoE de 30B avec 3B paramètres actifs, publié sous OpenMDW-1.1 (poids, données, recettes — totalement ouvert). Il est conçu pour la couche d'exécution des agents de longue durée : appels d'outils, validation de résultats, délégation de sous-agents — le travail à haut volume et faible latence qui domine le budget de tokens d'un agent. Jusqu'à 4x vitesse de sortie via speculative decoding.

L'architecture est un « système de modèles » : les modèles de raisonnement frontier (Nemotron 3 Ultra) gèrent l'orchestration et la planification tandis que Lightning gère l'exécution. NeMo Switchyard est la bibliothèque de routage intelligent de modèles : « Les plans montent au frontier, l'exécution descend à Lightning. » Le modèle est optimisé pour OpenClaw et Hermes Agent — tous deux nommés explicitement dans le blog développeurs NVIDIA. NeMoClaw est la pile de sécurité et de gestion open-source de NVIDIA pour les agents always-on.

Nemotron 3.5 Lightning ouvre une catégorie qui n'existait pas avant : modèles ouverts de couche d'exécution conçus pour un usage spécifique. L'article Muse Glimmer a documenté la catégorie dense local-first (30B, 24GB VRAM, Apache 2.0). Nemotron 3.5 Lightning est le complément de couche d'exécution — pas local-first, mais execution-first. Les deux sont des modèles ouverts de classe 30B conçus pour la boucle d'agent plutôt que pour le classement des benchmarks. La différence est le contexte de déploiement : Muse Glimmer tourne sur un seul GPU grand public pour la boucle d'agent locale ; Nemotron 3.5 Lightning tourne dans un data center pour le tier d'exécution d'un système multi-modèles.

C'est la validation industrielle la plus forte du pattern d'architecture tiered-model documenté dans l'article sur les patterns d'agents de longue durée et l'article sur l'inference economics. Le framing « système de modèles » — frontier pour la planification, petit MoE pour l'exécution — n'est plus une optimisation de coût théorique. NVIDIA a construit le modèle, la bibliothèque de routage et la pile de sécurité.

Le paysage des poids ouverts s'étend maintenant sur quatre catégories, chacune servant un contexte de déploiement différent :

Paysage des poids ouverts : quatre catégories 13 août 2026 — la publication amputée de Qwen3.8 a redessiné la frontière 1 MoE échelle cloud Poids ouverts amputés 2.4T params (95B actifs) Qwen3.8-2.4T-A95B Texte uniquement, pas de vision Contexte 262K (pas 1M) Thinking toujours activé Licence Qwen3.8-Max Vision + contexte 1M paywall sur Qwen Cloud 2 MoE échelle cloud Poids ouverts complets 2.8T params (MoE complet) Kimi K3 Vision incluse 594GB MXFP4 Modified MIT Minimum 8x H100 Fonctions complètes ouvertes Contre-exemple à Qwen 3 Dense local-first Boucle d'agent sur un GPU 30B dense, Apache 2.0 Muse Glimmer 24GB VRAM Contexte 131K+ Compatible Hermes Agent Pas de frais par token Agent niveau workstation Boucle locale, zéro facture API 4 Couche d'exécution MoE purpose-built 30B MoE, 3B actifs Nemotron 3.5 Lightning OpenMDW-1.1 (totalement ouvert) 4x vitesse de sortie NeMo Switchyard routing Pile de sécurité NeMoClaw Tier système de modèles Frontier planifie, Lightning exécute La frontière ouvert-fermé a bougé en une génération Qwen3.5-397B-A17B : vision ouverte gratuitement → Qwen3.8-2.4T-A95B : vision paywall sur Qwen Cloud Kimi K3 a publié les poids complets incluant la vision 8 jours plus tôt. La décision d'approvisionnement inclut maintenant : quelles fonctionnalités sont réellement dans les poids téléchargés ? Publications du même jour — 13 août 2026 DeepSeek V4 Pro 0813 BenchLM 60.95, Terminal-Bench 87.9%, CyberGym 83.3% 10x moins cher que le frontier, force en cybersécurité Gemini 3.7 Flash AA Intelligence Index 56, FrontierCode 43.6% $0.75/$3.75 par M de tokens — nouveau plancher de prix Qwen3.8-2.4T-A95B (amputé) Premiers poids ouverts à l'échelle Max, texte uniquement Réaction de la communauté : 19 upvotes en quelques heures Sources : huggingface.co, benchlm.ai, blog.google, developer.nvidia.com — août 2026

Ce que cela signifie pour le build flexible en modèles

L'architecture flexible en modèles ne consiste pas à choisir le meilleur modèle de poids ouverts. Il s'agit de router vers le bon modèle par tâche et de pouvoir rerouter quand la frontière ouvert-fermé se déplace — ce qu'elle vient de faire.

Une équipe d'approvisionnement utilisant Qwen3.5-397B-A17B avec vision pour un agent de traitement de documents fait maintenant face à une décision de migration : le successeur en poids ouverts (Qwen3.8-2.4T-A95B) n'inclut pas la vision. Les options sont : (1) rester sur les poids ouverts de Qwen3.5-397B-A17B (la génération précédente, qui inclut la vision), (2) passer à l'API gérée Qwen3.8-Max pour la vision (paywall), (3) passer aux poids ouverts de Kimi K3 (vision incluse, mais 594GB MXFP4 et minimum 8x H100), ou (4) router vers un modèle différent capable de vision. L'architecture flexible en modèles fait de l'option 4 un changement de configuration, pas un déploiement de code. L'architecture rigide en modèles en fait une réécriture.

L'inference economics compose la décision. Gemini 3.7 Flash à $0.75/$3.75 par million de tokens avec contexte 1M et vision est une alternative d'API gérée qui peut être moins chère que d'auto-héberger Kimi K3 à grande échelle. DeepSeek V4 Pro 0813 à 10x moins cher que les modèles frontier est une cible de routage texte uniquement solide pour les tâches de code — où les fonctionnalités amputées de Qwen3.8 n'ont pas d'importance. La matrice de routage est maintenant : frontier pour la planification (GPT-5.6 Sol, Grok 4.6), modèle ouvert de couche d'exécution pour les appels d'outils (Nemotron 3.5 Lightning), leader de coût pour le texte à haut volume (DeepSeek V4 Pro 0813, Gemini 3.7 Flash), local-first pour la boucle d'agent sur appareil (Muse Glimmer), et Max-scale ouvert pour le travail autonome à long horizon (Qwen3.8 amputé pour le texte, Kimi K3 complet pour le multimodal). Chacun sert une tâche différente. La contrainte déterminante est de savoir si votre plateforme d'agents traite la sélection de modèle comme un déploiement de code ou une opération de données — la même thèse que l'article parent a établie, maintenant testée par un fournisseur réduisant sa publication de poids ouverts en plein déploiement.

Lectures associées


Un distributeur mid-market utilisant NetSuite et BigCommerce a besoin d'un agent qui lit les PDF des fournisseurs, extrait les niveaux de prix et rédige les réponses RFQ. Les poids ouverts de Qwen3.8 sans vision ne peuvent pas lire les PDF ; l'API gérée Qwen3.8-Max le peut, mais à un coût par token. Un build flexible en modèles route l'analyse PDF vers un modèle capable de vision (Gemini 3.7 Flash à $0.75/$3.75, ou Kimi K3 auto-hébergé) et route la rédaction de devis texte uniquement vers les poids ouverts de Qwen3.8 ou DeepSeek V4 Pro 0813 — sans déploiement de code quand Qwen change ce qu'il inclut dans les poids ouverts.

Request a scoped build. One-week discovery. You get a system inventory, workflow map, and fixed scope — whether or not you build with us.

Vous voulez cela construit pour vos systèmes ?

Chaque document ici provient d'un travail réel en production. Si vous avez un système cible et un flux en tête, nous pouvons cadrer une construction en une semaine.

Demander un projet cadré

Découverte d'une semaine. Vous obtenez un inventaire des systèmes, une cartographie des flux et un périmètre fixe — que vous construisiez avec nous ou non.