Qwen3.8-27B et DeepSeek Harness : la pile d'agents véritablement ouverte arrive
Les poids ouverts de Qwen3.8-2.4T arrivés le 13 août étaient amputés — texte uniquement, sans vision, thinking verrouillé, contexte 262K au lieu de 1M. La communauté a qualifié cela de mettre la frontière derrière un paywall. Deux jours plus tard, Alibaba a publié Qwen3.8-27B avec tout ce que la version 2.4T avait retiré : compréhension native vision-langage (images et vidéo), contrôle flexible de la pensée (désactivation par requête, ajustement de la profondeur de raisonnement, préservation de la pensée entre les messages), contexte 262K extensible à 1M. Et le même jour, DeepSeek a open-sourcé le Harness — un runtime d'agents sous licence MIT où « tout est un plugin, » récoltant 33 000+ étoiles GitHub en quelques heures. Cet article s'appuie sur Open-Weight Models Crossed the Agentic Frontier, qui a cartographié l'écart de capacités jusqu'en juillet 2026 ; ici nous couvrons les deux développements qui complètent la pile d'agents véritablement ouverte : un modèle qui ne retient rien et un runtime qui traite chaque capacité comme interchangeable.
Points clés
- Qwen3.8-27B inclut la vision, le contrôle flexible de la pensée et un contexte 262K extensible à 1M — le frère véritablement ouvert du 2.4T amputé — Terminal-Bench 2.1 à 73.0 surpasse Muse Glimmer 30B à 51.7, et SWE-bench Pro à 61.7 bat Muse Glimmer à 51.2. Le 27B est le modèle que la plupart des équipes exécuteront réellement en local (Hugging Face).
- DeepSeek Harness : licence MIT, « tout est un plugin, » 33 000+ étoiles GitHub en quelques heures — modèles, outils, compétences, sessions, sandboxes, stockage, boucles, planification et UI sont tous des plugins interchangeables avec « aucun cœur privilégié à patcher » (DeepSeek ; The New Stack).
- Quatre stratégies de poids ouverts désormais visibles : Z.ai (poids après durcissement de sécurité), Qwen 2.4T amputé (capacités derrière paywall), Qwen 27B (véritablement ouvert), Kimi K3 (poids complets avec vision) — la frontière des poids ouverts est un portefeuille de philosophies de publication, pas une stratégie unique. Chacune retient ou expose différentes capacités.
- Le journal de session append-only est le pattern d'observabilité le plus concret trouvé : chaque entrée visible par le modèle est reconstructible à partir d'un seul flux d'événements — reprise, fork, replay, transcriptions, télémétrie et UI web fonctionnent tous sur le même journal (DeepSeek).
- Le sandboxing au niveau OS (Linux Landlock, macOS Seatbelt, Windows ACL) est livré dans le harness — un pattern de confinement concret qui valide l'architecture kill-switch sans nécessiter de produit de sécurité séparé.
Qwen3.8-27B : le modèle véritablement ouvert
La carte du modèle sur Hugging Face confirme l'architecture : 27B paramètres, 64 couches, hybride Gated DeltaNet plus Gated Attention (16 blocs répétés de 3 couches DeltaNet suivies d'1 couche Attention), 262 144 contexte nativement extensible à 1 000 000. C'est un modèle natif vision-langage — il comprend les images et les vidéos, des diagrammes STEM et documents aux vidéos d'une heure. Le mode thinking est activé par défaut mais peut être désactivé par requête ; la profondeur de raisonnement est réglable via reasoning_effort ; et le contexte de raisonnement des messages historiques est conservé via preserve_thinking. Ce sont exactement les fonctionnalités que la version amputée 2.4T a mises derrière un paywall : la vision, le mode non-thinking et le contexte flexible sont ouverts dans le 27B et réservés au cloud dans le Max.
Le tableau de benchmarks est solide pour un modèle dense de 27B. Terminal-Bench 2.1 à 73.0 — 21 points au-dessus de Muse Glimmer à 51.7. SWE-bench Pro à 61.7, DeepSWE 1.1 à 42.2, QwenSWEBench à 79.0, CoWorkBench à 70.7. Sur les benchmarks vision-langage : OSWorld-Verified à 84.3, WebArena-Verified à 64.8, AndroidWorld à 81.9. Le 27B surpasse le Muse Glimmer 30B sur chaque benchmark de codage où les deux sont évalués — un modèle dense de 27B avec vision est une catégorie de déploiement différente d'un modèle dense de 30B sans vision.
La réception de la communauté a été immédiate. Le 27B a été qualifié de « la version locale d'IA la plus importante de 2026 » — le modèle que la plupart des équipes exécuteront réellement en local sur du matériel grand public avec une faible latence et une confidentialité totale. Le 2.4T Max est le spectacle technologique ; le 27B est la cible de déploiement. Une représentation 4 bits du modèle 2.4T nécessite environ 1,2 téraoctet pour les poids seuls — un déploiement en cluster. Le 27B tient sur du matériel de classe workstation.
Le spectre des quatre stratégies de poids ouverts
Le 27B complète une comparaison à quatre voies que l'article parent documentait comme trois stratégies. Chaque laboratoire chinois représente désormais une philosophie de publication de poids ouverts distincte :
| Stratégie | Laboratoire | Modèle | Ce qui est ouvert | Ce qui est retenu |
|---|---|---|---|---|
| Poids après durcissement de sécurité | Z.ai | GLM-5.3 | Poids complets (en attente 2 semaines pour évaluation de sécurité) | Rien (poids publiés après durcissement) |
| Amputé, capacités derrière paywall | Alibaba | Qwen3.8-2.4T-A95B | Poids texte uniquement, contexte 262K, thinking verrouillé | Vision, mode non-thinking, contexte 1M, outils intégrés |
| Véritablement ouvert, exécutable en local | Alibaba | Qwen3.8-27B | Vision, pensée flexible, contexte 262K, déploiement local | Rien (ensemble complet de fonctionnalités dans les poids ouverts) |
| Poids complets avec vision | Moonshot | Kimi K3 | Poids complets y compris vision (594GB MXFP4) | Rien (mais minimum 8x H100 — échelle cluster) |
Le spectre va de « amputé pour vous pousser vers le cloud » (Qwen 2.4T) à « véritablement ouvert, exécutable sur une workstation » (Qwen 27B) à « poids complets mais échelle cluster » (Kimi K3). La construction model-flexible existe précisément pour qu'une équipe d'approvisionnement puisse peser la capacité cyber post-durcissement de Z.ai, la vision exécutable en local du Qwen 27B et la capacité multimodale à poids complets du Kimi K3 — et router par tâche sans déploiement de code.
DeepSeek Harness : le runtime plugin-first
Le modèle véritablement ouvert a besoin d'un runtime véritablement ouvert. DeepSeek Harness a été publié les 13-14 août en tant que developer preview sous licence MIT — la publication de runtime d'agents open-source la plus significative depuis Claude Code et Codex.
Le principe de conception central est « tout est un plugin. » Construit sur le méta-framework Cordis pour la « composabilité spatio-temporelle, » le harness traite l'adaptateur de modèle, le registre d'outils, le journal de session, le sandbox, le système de fichiers, la boucle d'agent, la planification et l'UI comme des plugins interchangeables. Il n'y a pas de cœur privilégié à patcher — étendre le harness signifie monter un plugin à côté des autres. Le kernel Cordis gère le montage, le démontage et les dépendances des plugins ; les capacités de l'agent vivent dans les plugins ; et les développeurs sélectionnent, échangent ou étendent n'importe quelle capacité en configuration sans changer le code source du harness (The New Stack).
Quatre presets sont livrés : Standard (agent de codage complet avec outils de système de fichiers, accès shell, recherche web, sous-agents, mode plan), Minimal (deux outils uniquement — bash et str_replace_editor), Code (génère un SDK TypeScript pour que le modèle combine des opérations multi-étapes en un programme — une séquence qui prendrait cinq allers-retours s'exécute en un seul appel), et Creator (inspection du runtime, expériences de plugins, création de presets).
Journal de session append-only
Tout ce que le modèle voit est enregistré dans un journal de session append-only : prompts système, raisonnement, appels d'outils et résultats, planification de sous-agents, et chaque injection de contexte. Reprise, fork, recherche et replay fonctionnent tous sur le même flux d'événements. Ajouter une nouvelle entrée visible par le modèle signifie ajouter un nouvel événement de session. C'est le pattern d'observabilité le plus concret trouvé dans tout runtime d'agents open-source — tout ce qui atteint une requête de modèle doit être reconstructible depuis le journal. Pour l'architecture des patterns d'agents de longue durée, le journal append-only est l'implémentation de production du pattern checkpoint/reprise : un agent qui fonctionne pendant des heures ou des jours peut être mis en pause, inspecté, forké et rejoué depuis un seul flux d'événements.
Sandboxing au niveau OS
Le harness enveloppe les sous-processus dans Linux Landlock (via un addon Node), macOS Seatbelt, ou un runner Windows ACL à jeton restreint. C'est un pattern de confinement concret — pas une couche de politique ou un guardrail au niveau prompt, mais une limite d'application au niveau système d'exploitation qui restreint ce que les appels d'outils de l'agent peuvent accéder. Pour l'architecture kill-switch, le sandboxing au niveau OS est la base du circuit breaker de runtime : l'agent ne peut pas s'échapper de son sandbox même si le modèle produit un appel d'outil malveillant, car le système d'exploitation applique la limite.
Agnostique du fournisseur avec client MCP intégré
Le catalogue de fournisseurs couvre Anthropic, OpenAI, AWS Bedrock, Microsoft Azure, Google Gemini Enterprise Agent Platform et le propre endpoint de DeepSeek. Les passerelles compatibles OpenAI personnalisées sont prises en charge. Deux fournisseurs de sous-agents délèguent à Claude Code et Codex. Un client MCP est intégré, et le support d'Agent Client Protocol est inclus. Le harness lit les fichiers AGENTS.md et CLAUDE.md. The Register a qualifié la publication de « les laboratoires chinois d'IA continuent d'avancer tandis que les laboratoires américains jouent la défense. »
La conception agnostique du fournisseur valide la thèse de construction model-flexible de l'article parent : le harness ne vous lie pas aux modèles de DeepSeek. Une équipe peut router la planification vers un modèle frontier, l'exécution vers un modèle open-weight local-first comme Qwen3.8-27B ou Muse Glimmer, et les appels d'outils via des modules MCP — le tout dans le même runtime, le tout comme des échanges de plugins.
Ce que l'architecture de plugins valide
La conception « tout est un plugin » est la validation industrielle la plus forte à ce jour du MCP Module Code Standard. Le standard de code définit une structure de répertoire, un pattern d'enregistrement d'outils, un contrat de gestion d'erreurs, une limitation de débit, une journalisation d'audit et des règles de limite PII pour que chaque connecteur se présente de la même manière. DeepSeek Harness applique le même principe au niveau du runtime : modèles, outils, compétences, sessions, sandboxes et boucles suivent tous le même contrat de plugin. Une équipe qui construit des modules MCP selon le standard de code peut les monter dans le client MCP du harness en tant que plugins — le pattern de module et le pattern de harness sont complémentaires, pas concurrents.
La pile d'agents véritablement ouverte
Les deux développements ensemble complètent une pile qui n'était pas possible il y a une semaine. Une équipe B2B de taille intermédiaire peut désormais assembler un agent de production à partir de :
- Couche de modèle : Qwen3.8-27B (27B, vision, pensée flexible, contexte 262K, exécutable en local) ou Muse Glimmer (30B, Apache 2.0, 24GB VRAM, compatible Hermes Agent) — les deux véritablement ouverts, les deux déployables sur workstation
- Couche de runtime : DeepSeek Harness (MIT, plugin-first, journal de session append-only, sandboxing au niveau OS, agnostique du fournisseur, client MCP intégré)
- Couche d'intégration : modules MCP suivant le standard de code — connecteurs NetSuite, HubSpot, BigCommerce, ShipStation en tant que plugins interchangeables
- Couche de gouvernance : journal de session append-only pour l'observabilité, sandboxing au niveau OS pour le confinement, scoping des capacités par plugin pour la gouvernance proportionnelle
Aucun composant de cette pile ne nécessite d'API gérée, de facturation par token ou d'autorisation de fournisseur pour modifier. Les poids du modèle sont téléchargeables. Le runtime est sous licence MIT. Les modules MCP suivent un standard ouvert. Les patterns de gouvernance sont livrés dans le runtime, pas en tant que produit séparé.
La contrainte reste ce que l'article parent a identifié : pas le modèle, mais la couche d'intégration. La pile d'agents véritablement ouverte n'élimine pas le besoin de modules MCP qui se connectent à NetSuite, HubSpot et BigCommerce — elle rend les couches de modèle et de runtime ouvertes pour que la couche d'intégration soit là où l'effort de construction se concentre. Une équipe qui possède ses modules MCP, les monte dans un runtime plugin-first, et route entre un modèle local 27B et une API frontier par tâche a un agent de production qu'aucun fournisseur ne peut révoquer, mesurer ou amputer.
Lecture associée
- Open-Weight Models Crossed the Agentic Frontier — l'article parent, cartographiant l'écart de capacités entre les modèles open-weight et les modèles frontier fermés jusqu'en juillet 2026, incluant la thèse de construction model-flexible et la comparaison des trois stratégies de poids ouverts que cet article étend à quatre
- Qwen3.8 Open Weights Arrived Stripped — la version amputée 2.4T dont Qwen3.8-27B est la contre-narration véritablement ouverte, couvrant la réaction de la communauté et l'ensemble de fonctionnalités derrière paywall
- MCP Module Code Standard — le pattern structurel que l'architecture de plugins de DeepSeek Harness valide au niveau du runtime — chaque connecteur se présente de la même manière car chaque plugin suit le même contrat
Un distributeur de taille intermédiaire utilisant NetSuite et BigCommerce a besoin d'un agent qui lit les PDF des fournisseurs (vision), extrait les niveaux de prix, vérifie les stocks et rédige les réponses RFQ. Le Qwen3.8 2.4T amputé ne peut pas lire les PDF. Le 27B le peut — il est livré avec la vision dans les poids ouverts. Le runtime de l'agent a besoin d'un journal de session append-only pour la piste d'audit et d'un sandboxing au niveau OS pour le confinement. DeepSeek Harness fournit les deux. Les modules MCP qui se connectent à NetSuite et BigCommerce suivent le standard de code et se montent en tant que plugins. Le modèle route vers Qwen3.8-27B pour l'analyse PDF et l'exécution locale, et vers un modèle frontier pour la négociation stratégique — le tout dans le même harness, le tout en configuration, pas en déploiement de code. Aucun fournisseur ne peut amputer la capacité de vision, mesurer l'inférence ou révoquer le runtime.
Vous voulez cela construit pour vos systèmes ?
Chaque document ici provient d'un travail réel en production. Si vous avez un système cible et un flux en tête, nous pouvons cadrer une construction en une semaine.
Demander un projet cadréDécouverte d'une semaine. Vous obtenez un inventaire des systèmes, une cartographie des flux et un périmètre fixe — que vous construisiez avec nous ou non.