Zurück zur Bibliothek
Strategie

Qwen3.8-27B und DeepSeek Harness: Der genuinely-open Agenten-Stack trifft ein

Zuletzt aktualisiert: 2026年8月14日

Die Qwen3.8-2.4T Open Weights, die am 13. August eintrafen, waren beschnitten — nur Text, keine Vision, Thinking festgelegt, 262K-Kontext statt 1M. Die Community nannte es Paywalling der Frontier. Zwei Tage später veröffentlichte Alibaba Qwen3.8-27B mit allem, was die 2.4T-Version entfernt hatte: natives Vision-Language-Verständnis (Bilder und Video), flexible Thinking-Steuerung (deaktivierbar pro Anfrage, Reasoning-Tiefe einstellbar, Thinking über Nachrichten hinweg erhalten), 262K-Kontext erweiterbar auf 1M. Und am selben Tag open-sourcte DeepSeek das Harness — eine MIT-lizenzierte Agenten-Runtime, in der „alles ein Plugin ist" und die innerhalb von Stunden 33.000+ GitHub-Sterne sammelte. Dieser Artikel baut auf Open-Weight Models Crossed the Agentic Frontier auf, das die Capability-Lücke bis Juli 2026 kartierte; hier behandeln wir die zwei Entwicklungen, die den genuinely-open Agenten-Stack vervollständigen: ein Modell, das nichts zurückhält, und eine Runtime, die jede Fähigkeit als austauschbar behandelt.

Kernpunkte

  • Qwen3.8-27B umfasst Vision, flexible Thinking-Steuerung und 262K-Kontext erweiterbar auf 1M — das genuinely-open Geschwistermodell zum beschnittenen 2.4T — Terminal-Bench 2.1 bei 73.0 übertrifft Muse Glimmer 30B bei 51.7, und SWE-bench Pro bei 61.7 schlägt Muse Glimmer bei 51.2. Das 27B ist das Modell, das die meisten Teams tatsächlich lokal ausführen werden (Hugging Face).
  • DeepSeek Harness: MIT-lizenziert, „alles ist ein Plugin," 33.000+ GitHub-Sterne in Stunden — Modelle, Tools, Skills, Sessions, Sandboxes, Storage, Loops, Scheduling und UI sind alle austauschbare Plugins mit „keinem privilegierten Kern zu patchen" (DeepSeek; The New Stack).
  • Vier Open-Weight-Strategien nun sichtbar: Z.ai (Weights nach Safety-Hardening), Qwen beschnittene 2.4T (Fähigkeiten hinter Paywall), Qwen 27B (genuinely open), Kimi K3 (volle Weights mit Vision) — die Open-Weight-Frontier ist ein Portfolio von Release-Philosophien, keine einzelne Strategie. Jede behält oder exposes unterschiedliche Fähigkeiten.
  • Das append-only-Sitzungslog ist das konkreteste Observability-Pattern, das gefunden wurde: jede modellsichtbare Eingabe ist aus einem einzigen Event-Stream rekonstruierbar — Resume, Fork, Replay, Transkripte, Telemetrie und Web-UI arbeiten alle auf demselben Log (DeepSeek).
  • OS-Level-Sandboxing (Linux Landlock, macOS Seatbelt, Windows ACL) wird im Harness mitgeliefert — ein konkretes Containment-Pattern, das die Kill-Switch-Architektur validiert, ohne ein separates Sicherheitsprodukt zu benötigen.

Qwen3.8-27B: das genuinely-open Modell

Die Hugging Face Modellkarte bestätigt die Architektur: 27B Parameter, 64 Schichten, Gated DeltaNet plus Gated Attention Hybrid (16 wiederholende Blöcke aus 3 DeltaNet-Schichten gefolgt von 1 Attention-Schicht), 262.144 Kontext nativ erweiterbar auf 1.000.000. Es ist ein natives Vision-Language-Modell — es versteht Bilder und Videos, von STEM-Diagrammen und Dokumenten bis zu stundenlangen Videos. Thinking-Modus ist standardmäßig aktiviert, kann aber pro Anfrage deaktiviert werden; Reasoning-Tiefe ist über reasoning_effort einstellbar; und Reasoning-Kontext aus historischen Nachrichten wird über preserve_thinking erhalten. Dies sind genau die Features, die die beschnittene 2.4T-Version hinter eine Paywall setzte: Vision, Non-Thinking-Modus und flexibler Kontext sind im 27B offen und im Max nur in der Cloud.

Die Benchmark-Tabelle ist stark für ein 27B Dense-Modell. Terminal-Bench 2.1 bei 73.0 — 21 Punkte über Muse Glimmer bei 51.7. SWE-bench Pro bei 61.7, DeepSWE 1.1 bei 42.2, QwenSWEBench bei 79.0, CoWorkBench bei 70.7. Bei Vision-Language-Benchmarks: OSWorld-Verified bei 84.3, WebArena-Verified bei 64.8, AndroidWorld bei 81.9. Das 27B übertrifft das 30B Muse Glimmer bei jedem Coding-Benchmark, wo beide bewertet werden — ein 27B Dense-Modell mit Vision ist eine andere Deployment-Kategorie als ein 30B Dense-Modell ohne Vision.

Die Community-Reaktion war unmittelbar. Das 27B wurde als „der wichtigste lokale AI-Release von 2026" bezeichnet — das Modell, das die meisten Teams tatsächlich lokal auf Consumer-Hardware mit niedriger Latenz und vollständiger Privatsphäre ausführen werden. Das 2.4T Max ist das technologische Spektakel; das 27B ist das Deployment-Ziel. Eine 4-Bit-Repräsentation des 2.4T-Modells erfordert ungefähr 1,2 Terabyte allein für die Weights — ein Cluster-Deployment. Das 27B passt auf Workstation-Klasse-Hardware.

Das Vier-Strategien Open-Weight-Spektrum

Das 27B vervollständigt einen Vier-Wege-Vergleich, den der Elternartikel als drei Strategien dokumentierte. Jedes chinesische Labor repräsentiert nun eine eigene Open-Weight-Release-Philosophie:

Strategie Labor Modell Was offen ist Was zurückbehalten wird
Weights nach Safety-Hardening Z.ai GLM-5.3 Volle Weights (ausstehend 2 Wochen für Safety-Evaluation) Nichts (Weights nach Hardening veröffentlicht)
Beschnitten, Fähigkeiten hinter Paywall Alibaba Qwen3.8-2.4T-A95B Text-only Weights, 262K-Kontext, Thinking festgelegt Vision, Non-Thinking-Modus, 1M-Kontext, integrierte Tools
Genuinely open, lokal ausführbar Alibaba Qwen3.8-27B Vision, flexibles Thinking, 262K-Kontext, lokales Deployment Nichts (vollständiges Feature-Set in Open Weights)
Volle Weights mit Vision Moonshot Kimi K3 Volle Weights inklusive Vision (594GB MXFP4) Nichts (aber mindestens 8x H100 — Cluster-Skala)

Das Spektrum reicht von „beschnitten, um dich in die Cloud zu drängen" (Qwen 2.4T) über „genuinely open, auf einer Workstation ausführbar" (Qwen 27B) bis zu „volle Weights aber Cluster-Skala" (Kimi K3). Der Model-flexible Build existiert genau dafür, damit ein Beschaffungsteam die Post-Hardening-Cyber-Fähigkeit von Z.ai, die lokal-ausführbare Vision des Qwen 27B und die Multimodal-Fähigkeit der vollen Weights des Kimi K3 abwägen — und pro Task routen kann, ohne ein Code-Deployment.

The Genuinely-Open Agent Stack Four open-weight strategies + plugin-first runtime = production agent with no vendor lock-in FOUR OPEN-WEIGHT STRATEGIES Z.ai GLM-5.3 Weights after hardening Open: full weights (pending 2wk) Withheld: nothing CyberGym 84.5% (leading) 2,436 vulns disclosed Qwen 2.4T-A95B Stripped, paywalled Open: text-only, 262K ctx Withheld: vision, 1M ctx, thinking off Community backlash Cluster-scale deployment Qwen 3.8-27B Genuinely open Open: vision, thinking ctrl, 262K+ Withheld: nothing Terminal-Bench 73.0 Workstation-deployable Kimi K3 Full weights, cluster-scale Open: full weights + vision Withheld: nothing 594GB MXFP4 8x H100 minimum GENUINELY-OPEN AGENT STACK Model Layer Qwen3.8-27B (27B, vision, flexible thinking) or Muse Glimmer (30B, Apache 2.0, 24GB VRAM) Genuinely open, workstation-deployable, no per-token charge, no vendor can strip capabilities Runtime Layer DeepSeek Harness (MIT, plugin-first, append-only session log, OS-level sandboxing) 33K+ GitHub stars, provider-agnostic, MCP client built in, Landlock/Seatbelt/Windows ACL Integration Layer MCP modules (NetSuite, HubSpot, BigCommerce, ShipStation) following the code standard Open standard, swappable plugins, same directory structure and error contract across connectors Governance Layer Append-only session log (observability) + OS-level sandboxing (containment) + per-plugin scoping Ships in the runtime, not as a separate product. Resume, fork, replay from a single event stream. No managed API required. No per-token charge. No vendor permission to modify. The binding constraint is the integration layer — where the build effort concentrates. Sources: Hugging Face Qwen3.8-27B model card, DeepSeek Harness, The New Stack, The Register

DeepSeek Harness: die Plugin-first-Runtime

Das genuinely-open Modell braucht eine genuinely-open Runtime. DeepSeek Harness wurde am 13.-14. August als Developer Preview unter MIT-Lizenz veröffentlicht — das bedeutendste Open-Source-Agenten-Runtime-Release seit Claude Code und Codex.

Das Kern-Design-Prinzip ist „alles ist ein Plugin." Aufgebaut auf dem Cordis Meta-Framework für „spatiotemporal Composability" behandelt das Harness den Modell-Adapter, die Tool-Registry, das Session-Log, die Sandbox, das Dateisystem, die Agenten-Schleife, das Scheduling und die UI als austauschbare Plugins. Es gibt keinen privilegierten Kern zu patchen — das Harness zu erweitern bedeutet, ein Plugin neben den anderen zu mounten. Der Cordis-Kernel verwaltet Plugin-Mounting, -Unmounting und -Abhängigkeiten; Agenten-Fähigkeiten leben in den Plugins; und Entwickler wählen, tauschen oder erweitern jede Fähigkeit in der Konfiguration, ohne den Harness-Quellcode zu ändern (The New Stack).

Vier Presets werden mitgeliefert: Standard (vollständiger Coding-Agent mit Dateisystem-Tools, Shell-Zugriff, Web-Suche, Sub-Agenten, Plan-Modus), Minimal (nur zwei Tools — bash und str_replace_editor), Code (generiert ein TypeScript-SDK, sodass das Modell Multi-Step-Operationen in einem Programm kombinieren kann — eine Sequenz, die fünf Round-Trips erfordern würde, läuft als einzelner Aufruf), und Creator (Runtime-Inspektion, Plugin-Experimente, Preset-Authoring).

Append-only-Sitzungslog

Alles, was das Modell sieht, wird in einem append-only-Sitzungslog aufgezeichnet: System-Prompts, Reasoning, Tool-Aufrufe und -Ergebnisse, Sub-Agenten-Scheduling und jeder Kontext-Injection. Resume, Fork, Search und Replay arbeiten alle auf demselben Event-Stream. Das Hinzufügen jeder neuen modellsichtbaren Eingabe bedeutet das Hinzufügen eines neuen Session-Events. Dies ist das konkreteste Observability-Pattern, das in jeder Open-Source-Agenten-Runtime gefunden wurde — alles, was eine Modell-Anfrage erreicht, muss aus dem Log rekonstruierbar sein. Für die Long-Running-Agenten-Patterns-Architektur ist das append-only-Log die Produktionsimplementierung des Checkpoint/Resume-Patterns: ein Agent, der Stunden oder Tage läuft, kann aus einem einzigen Event-Stream pausiert, inspiziert, geforkt und replays werden.

OS-Level-Sandboxing

Das Harness umschließt Sub-Prozesse in Linux Landlock (durch ein Node-Addon), macOS Seatbelt, oder einen Windows ACL Restricted-Token-Runner. Dies ist ein konkretes Containment-Pattern — keine Policy-Schicht oder ein Prompt-Level-Guardrail, sondern eine Operating-System-Enforcement-Grenze, die einschränkt, worauf die Tool-Aufrufe des Agenten zugreifen können. Für die Kill-Switch-Architektur ist OS-Level-Sandboxing die Grundlage des Runtime-Circuit-Breakers: der Agent kann seiner Sandbox nicht entkommen, selbst wenn das Modell einen bösartigen Tool-Aufruf erzeugt, weil das Betriebssystem die Grenze durchsetzt.

Provider-agnostisch mit integriertem MCP-Client

Der Provider-Katalog umfasst Anthropic, OpenAI, AWS Bedrock, Microsoft Azure, Google Gemini Enterprise Agent Platform und DeepSeeks eigenen Endpoint. Custom OpenAI-kompatible Gateways werden unterstützt. Zwei Sub-Agent-Provider delegieren an Claude Code und Codex. Ein MCP-Client ist integriert, und Agent Client Protocol-Unterstützung ist enthalten. Das Harness liest AGENTS.md- und CLAUDE.md-Dateien. The Register rahmte den Release als „chinesische AI-Labore bewegen sich weiter voran, während US-Labore in der Defensive spielen."

Das Provider-agnostische Design validiert die Model-flexible-Build-These des Elternartikels: das Harness bindet dich nicht an DeepSeeks Modelle. Ein Team kann Planung an ein Frontier-Modell, Ausführung an ein Local-First-Open-Weight-Modell wie Qwen3.8-27B oder Muse Glimmer und Tool-Aufrufe über MCP-Module routen — alles innerhalb derselben Runtime, alles als Plugin-Swaps.

Was die Plugin-Architektur validiert

Das „alles ist ein Plugin"-Design ist die bisher stärkste Industrie-Validierung des MCP Module Code Standard. Der Code-Standard definiert eine Verzeichnisstruktur, ein Tool-Registrierungs-Pattern, einen Error-Handling-Vertrag, Rate-Limiting, Audit-Logging und PII-Boundary-Regeln, sodass jeder Connector gleich aussieht. DeepSeek Harness wendet dasselbe Prinzip auf Runtime-Ebene an: Modelle, Tools, Skills, Sessions, Sandboxes und Loops folgen alle demselben Plugin-Vertrag. Ein Team, das MCP-Module nach dem Code-Standard baut, kann sie im MCP-Client des Harness als Plugins mounten — das Modul-Pattern und das Harness-Pattern sind komplementär, nicht konkurrierend.

Der genuinely-open Agenten-Stack

Die zwei Entwicklungen zusammen vervollständigen einen Stack, der vor einer Woche nicht möglich war. Ein mittelständisches B2B-Team kann nun einen Produktions-Agenten zusammenstellen aus:

  1. Modell-Schicht: Qwen3.8-27B (27B, Vision, flexibles Thinking, 262K-Kontext, lokal ausführbar) oder Muse Glimmer (30B, Apache 2.0, 24GB VRAM, Hermes-Agent-kompatibel) — beide genuinely open, beide Workstation-deploybar
  2. Runtime-Schicht: DeepSeek Harness (MIT, Plugin-first, append-only-Sitzungslog, OS-Level-Sandboxing, Provider-agnostisch, MCP-Client integriert)
  3. Integration-Schicht: MCP-Module nach dem Code-Standard — NetSuite-, HubSpot-, BigCommerce-, ShipStation-Connectors als austauschbare Plugins
  4. Governance-Schicht: append-only-Sitzungslog für Observability, OS-Level-Sandboxing für Containment, per-Plugin-Capability-Scoping für proportionale Governance

Keine Komponente in diesem Stack erfordert eine Managed API, eine Per-Token-Gebühr oder die Erlaubnis eines Anbieters zur Modifikation. Die Modell-Weights sind herunterladbar. Die Runtime ist MIT-lizenziert. Die MCP-Module folgen einem offenen Standard. Die Governance-Patterns werden im Runtime mitgeliefert, nicht als separates Produkt.

Die Bindung bleibt, was der Elternartikel identifizierte: nicht das Modell, sondern die Integration-Schicht. Der genuinely-open Agenten-Stack eliminiert nicht die Notwendigkeit für MCP-Module, die sich mit NetSuite, HubSpot und BigCommerce verbinden — er macht die Modell- und Runtime-Schichten offen, sodass die Integration-Schicht dort ist, wo sich die Build-Anstrengung konzentriert. Ein Team, das seine MCP-Module besitzt, sie in einer Plugin-first-Runtime mountet und zwischen einem lokalen 27B-Modell und einer Frontier-API pro Task routet, hat einen Produktions-Agenten, den kein Anbieter widerrufen, abrechnen oder beschneiden kann.

Weiterführende Literatur

  • Open-Weight Models Crossed the Agentic Frontier — der Elternartikel, der die Capability-Lücke zwischen Open-Weight- und geschlossenen Frontier-Modellen bis Juli 2026 kartiert, einschließlich der Model-flexible-Build-These und des Drei-Strategien-Open-Weight-Vergleichs, den dieser Artikel auf vier erweitert
  • Qwen3.8 Open Weights Arrived Stripped — die beschnittene 2.4T-Version, zu der Qwen3.8-27B die genuinely-open Gegen-Erzählung ist, die die Community-Reaktion und das Paywall-Feature-Set abdeckt
  • MCP Module Code Standard — das Struktur-Pattern, das die DeepSeek-Harness-Plugin-Architektur auf Runtime-Ebene validiert — jeder Connector sieht gleich aus, weil jedes Plugin demselben Vertrag folgt

Ein mittelständischer Distributor, der NetSuite und BigCommerce betreibt, braucht einen Agenten, der Lieferanten-PDFs liest (Vision), Preis-Tiers extrahiert, Bestände prüft und RFQ-Antworten entwirft. Das beschnittene Qwen3.8 2.4T kann die PDFs nicht lesen. Das 27B kann es — es wird mit Vision in den Open Weights geliefert. Die Agenten-Runtime braucht ein append-only-Sitzungslog für den Audit-Trail und OS-Level-Sandboxing für Containment. DeepSeek Harness liefert beides. Die MCP-Module, die sich mit NetSuite und BigCommerce verbinden, folgen dem Code-Standard und mounten als Plugins. Das Modell routet zu Qwen3.8-27B für das PDF-Parsing und die lokale Ausführung und zu einem Frontier-Modell für die strategische Verhandlung — alles innerhalb desselben Harness, alles als Konfiguration, nicht als Code-Deployment. Kein Anbieter kann die Vision-Fähigkeit beschneiden, die Inferenz abrechnen oder die Runtime widerrufen.

Möchten Sie dies für Ihre Systeme gebaut?

Jedes Dokument hier stammt aus echter Produktionsarbeit. Wenn Sie ein Zielsystem und einen Workflow im Sinn haben, können wir in einer Woche einen Build umreißen.

Build mit festem Umfang anfragen

Einwöchiges Discovery. Sie erhalten ein Systeminventar, eine Workflow-Mappe und einen festen Umfang — unabhängig davon, ob Sie mit uns bauen.