Zurück zur Bibliothek
Strategie

Der 0,10-$-Subagent: Claude Haiku 5.5 kollabiert die Kostenlücke zwischen Frontier- und Open-Weight-Modellen

Zuletzt aktualisiert: 2026年10月7日

Kernaussagen

  • Claude Haiku 5.5 ist für Prompts unter 100K mit 0,10/0,50 $ pro Million Tokens bepreist — 90 % unter Haiku 4.5 und exakt zum Preis von GPT-6 Luna — was die Subagent-Schicht für 90 % der Anfragen bei drei Anbietern faktisch kostenlos macht (Anthropic, 7. Okt).
  • OSWorld 2.1 sprang von 15,7 % (Haiku 4.5) auf 72,4 % (Haiku 5.5) — eine 4,6-fache Verbesserung, die das günstige Modell auf weniger als 12 Punkte an Sonnet 5.5s 83,9 % heranbringt (Anthropic, 7. Okt).
  • Sonnet 5.5 Cache-Reads wurden von 0,20 auf 0,10 $ pro Million Tokens halbiert und senken die agentischen Kosten von Sonnet 5.5 um ~20 % — das Mid-Tier-Modell wurde am selben Tag günstiger, an dem die Subagent-Schicht startete (Anthropic, 7. Okt).
  • GLM-5.3-Flash für 0,15/0,50 $ und GPT-6 Luna für 0,10/0,50 $ bedeuten: Die Input-Kostenlücke zwischen frontier closed und Open-Weight in der Small-Model-Schicht beträgt nun 0,05 $/M — eine Zahl, die für die meisten Workloads gegen null rundet (Z.AI; Anthropic).
  • Die Wettbewerbsachse hat sich von Preis zu Fähigkeiten, Sicherheitsposture und Ökosystem-Integration verlagert — die Subagent-Schicht ist keine Kostenentscheidung mehr, sondern eine Architekturentscheidung (Yahoo Finance, 7. Okt).

Dieser Artikel baut auf 30 % günstiger pro Aufgabe kostet das 7-Fache an Tokens: Sonnet 5.5s Effizienzfalle auf, der die drei Release-Strategien kartierte, die auf dem Flagship-Niveau um Kosten pro Aufgabe konkurrieren. Hier geht es eine Ebene tiefer: die Subagent-Schicht — das Modell, das Kompression, Klassifikation, Datenbankabfragen und Coding-Sidekick-Arbeit übernimmt — hat gerade ein vor sechs Monaten undenkbares Preisminimum erreicht. Die Halbierung der Sonnet-5.5-Cache-Reads — in derselben Ankündigung — ist der direkte Begleitdatapunkt: Die Token-Effizienz-These des Artikels gewinnt eine Preisänderung, die das Mid-Tier-Modell auf agentischen Workloads, in denen Cache-Reads dominieren, 20 % günstiger macht.

Die Subagent-Schicht ist nun ein Dreianbieter-Markt zu einem Preis

Die Preistabelle der Small-Model-Schicht zum 8. Oktober 2026:

Modell Input $/M Output $/M Typ Anbieter
GPT-6 Luna $0.10 $0.50 Frontier closed OpenAI
Claude Haiku 5.5 $0.10 $0.50 Frontier closed Anthropic
GLM-5.3-Flash $0.15 $0.50 Open-weight Z.ai

Der Output-Preis ist bei allen drei identisch. Der Input-Abstand zwischen dem Frontier-closed-Duo und dem Open-Weight-Modell beträgt 0,05 $ pro Million Tokens — für einen Subagenten, der einen 50.000-Token-Konversationskontext komprimiert, sind das 0,0025 $. Die Kosten für die Wahl des falschen Subagenten messen sich jetzt in Bruchteilen eines Cents pro Aufgabe, nicht in Dollar pro Tag.

Die Preislandschaft der Subagent-Schicht zum 8. Oktober 2026:

Die 0,10-$-Subagent-Schicht Drei Anbieter. Ein Preis. Die Kostenlücke frontier-vs-open-weight beträgt nun 0,05 $/M Input. L GPT-6 Luna OpenAI · Frontier closed $0.10 /M Input $0.50 /M Output OSWorld 2.1: 48.9% H Claude Haiku 5.5 Anthropic · Frontier closed · NEU $0.10 /M input $0.50 /M output OSWorld 2.1: 72,4 % (vorher 15,7 %) G GLM-5.3-Flash Z.ai · Open-weight $0.15 /M input $0.50 /M output 320B/18B MoE · MIT-weight Input-Kostenlücke frontier-vs-open-weight: 0,05 $/M Tokens Für eine 50K-Token-Kompression: 0,0025 $ Unterschied. Die Subagent-Schicht ist keine Kostenentscheidung mehr. Das 10:1-Verhältnis hält 10 $ Integration + Governance pro 1 $ Modell-Ausgaben $1 Modell $10 Integration MCP-Module, Wissens- graphen, Audit-Trails, Governance Sonnet 5.5 Cache-Reads halbiert Gleiche Ankündigung · ~20 % günstigere agentische Arbeit 0,20 $/M Cache-Reads 0,10 $/M Cache-Reads Cache-Reads dominieren den agentischen Tokenverbrauch — die Position, die mit jedem Turn wächst Das Modell wurde 90 % günstiger. Die Integrationsebene nicht. Quellen: Anthropic (7. Okt 2026) · Z.AI · Yahoo Finance · IdeaBosque ideabosque.com/library/haiku-5-5-subagent-tier-cost-collapse

Yahoo Finance rahmte den Haiku-5.5-Launch als „KI-Preiskrieg verschärft sich" (Yahoo Finance, 7. Okt). Der Rahmen ist zutreffend, unterschätzt aber, was tatsächlich geschah. Ein Preiskrieg bedeutet, dass Margen auf demselben Produkt komprimiert werden. Was geschah: Die Subagent-Schicht — die Ebene, in der der Großteil des agentischen Tokenverbrauchs entsteht — kollabierte auf ein Preisniveau, das zuvor nur das günstigste Open-Weight-Modell anbot. Das Frontier-closed-Modell und das Open-Weight-Modell sitzen nun beim Output-Preis auf demselben Punkt. Die Frage „Soll ich einen Frontier- oder einen Open-Weight-Subagenten einsetzen?" ist keine Kostenfrage mehr.

Was sich änderte: Der Subagent wurde fähig

Der Preis ist nur die halbe Geschichte. Der Benchmark-Sprung von Haiku 5.5 ist der Teil, der Architekturentscheidungen verändert:

  • OSWorld 2.1 (Offline-Subset): 72,4 % — gegenüber 15,7 % bei Haiku 4.5, eine 4,6-fache Verbesserung. GPT-6 Luna liegt bei 48,9 %. Der Subagent kann nun einen Computer bedienen, um Multi-Step-Aufgaben auf einem Niveau zu erledigen, das vor zwölf Monaten Flagship-Niveau war (Anthropic).
  • Terminal-Bench 4.0: 39,2 % — gegenüber 0,0 % bei Haiku 4.5. GPT-6 Luna liegt bei 16,4 %. Der Subagent kann komplexe Kommandozeilen-Aufgaben erledigen, die die vorherige Generation nicht einmal versuchen konnte (Anthropic).
  • FrontierCode 1.1 (Main): 46,4 % — über GPT-6 Lunas 42,4 %, unter Sonnet 5.5s 52,1 % bei xhigh. Der Subagent schreibt Produktionscode gut genug, um als Coding-Sidekick zu dienen — Cognition liefert ihn als Sidekick in Devin Fusion aus und hält bei reduzierten Kosten und Latenz einen Top-Tier-FrontierCode-Score von 66,2 (Anthropic).
  • HubSpot-CRM-Task-Suite: 92,8 % — der beste Score, den HubSpot auf seiner simulierten Portal-CRM-Evaluation gemessen hat. Der Subagent identifiziert veraltete, aber mehrdeutige Datensätze mit der höchsten Trefferquote und der niedrigsten False-Positive-Rate aller getesteten Modelle (Anthropic).

Der HubSpot-Datenpunkt zählt über den Benchmark hinaus. HubSpot ist eine große CRM-Plattform, die Frontier-Kleinmodelle für CRM-Automatisierungsaufgaben evaluiert — genau der Anwendungsfall, den ein Custom-MCP-Modul anspricht. Wenn die Subagent-Schicht veraltete CRM-Datensätze mit 92,8 % Genauigkeit für 0,10 $/M Input identifizieren kann, fällt der Betrieb eines Agenten, der eine Deal-Pipeline 24/7 überwacht, von Budgetposition auf Rundungsfehler.

Verstellbarer Effort: dasselbe Modell, fünf Preisstufen

Haiku 5.5 ist das erste Haiku-Klasse-Modell mit verstellbaren Effort-Stufen: low, medium, high, xhigh, max. Das ist dasselbe konfigurierbare Kostenmuster, das die DeepSeek-Auto-Routing-Analyse als Beschaffungsrisiko markierte, wenn das Routing unsichtbar ist — aber hier liegt die Kontrolle beim Operator. Ein Subagent, der Konversationskontext komprimiert, kann mit low Effort für 0,002 $ pro Aufgabe laufen; dasselbe Modell kann mit max Effort eine schwerere Datenbankabfrage fahren. Die Kosten-pro-Aufgabe-Kurve ist nun ein Drehknopf, kein Festtarif.

Die Konsequenz für die Inferenz-Beschaffung ist direkt: Ein Vertrag, der nur Modell und Tarifkarte nennt, kontrolliert die Effort-Stufe nicht. Ein Agent mit max Effort verbrennt mehr Tokens als derselbe Agent mit medium — und der Operator sieht nur die Rechnung. Die vier Vertragsklauseln, die der Sonnet-5.5-Artikel empfahl (Effort-Level-Pinning, Substitutions-Disclosure, Cache-Read-Preisuntergrenzen, Token-Volumen-Deckel), gelten nun gleichermaßen für die Subagent-Schicht — der Effort-Drehknopf existiert dort jetzt ebenfalls.

Die Sonnet-5.5-Cache-Read-Halbierung: Auch das Mid-Tier wurde günstiger

Die Ankündigung halbierte die Sonnet-5.5-Cache-Reads von 0,20 auf 0,10 $ pro Million Tokens. Cache-Reads machen einen großen Anteil des agentischen Tokenverbrauchs aus — ein Agent, der bei jedem Turn denselben System-Prompt, Tool-Definitionen und Gesprächsverlauf erneut liest, trifft die Cache-Read-Position öfter als die Input- oder Output-Positionen. Ein 50-%-Cut auf der Position, die den agentischen Ausgaben dominiert, entspricht ~20 % Reduktion der totalen agentischen Kosten von Sonnet 5.5 (Anthropic).

Das ist für die Agent-Architekturentscheidung relevant. Die Subagent-Schicht bei 0,10/0,50 $ übernimmt Kompression, Klassifikation und Sidekick-Arbeit. Das Mid-Tier bei 2/10 $ — nun mit halbierten Cache-Reads — übernimmt komplexes agentisches Coding und Multi-Step-Reasoning. Das Flagship-Tier bei 4/20 $ übernimmt die schwersten Aufgaben. Der Drei-Tier-Stack ist nun sauber bepreist: günstiger Subagent, fähiges Mid-Tier mit günstigem Cache, mächtiges Flagship. Der Betrieb des kompletten Stacks für einen always-on-Produktionsagenten wurde am 7. Oktober deutlich günstiger.

Was das für den Build bedeutet

Die Inferenz-Ökonomie-Analyse etablierte das 10:1-Verhältnis: 10 $ Prozess-, Governance- und Integrationsarbeit für jeden 1 $ Modell-Ausgaben. Der Haiku-5.5-Release weitet das Verhältnis weiter. Das Modell wurde 90 % günstiger; die Integrationsebene nicht. Ein MCP-Modul, das einen Agenten an NetSuite anbindet, ein Wissensgraph, der Ersatzteile auflöst, ein Audit-Trail, der jeden Tool-Call protokolliert — diese Kosten ändern sich nicht. Das Modell macht nun einen kleineren Anteil der Gesamtkosten des Builds aus als vor einer Woche.

Das ist der Beschaffungs-Insight. Der Preisverfall der Subagent-Schicht macht Agentensysteme nicht billiger zu bauen. Er macht sie billiger zu betreiben — das heißt, Teams, die die Integrationsebene bereits gebaut haben, erhalten eine größere Kostenreduktion als Teams, die es nicht haben. Ein Team, das einen Produktions-RFQ-Agenten mit typisierten MCP-Modulen, Wissensgraph und Human-in-the-Loop-Checkpoints betreibt, sieht seine monatliche Inferenz-Rechnung über Nacht um 75 % sinken. Ein Team ohne die Integrationsebene sieht keine Änderung — denn die Kosten liegen in der Integrationsebene.

Weiterlesen

Ein regionaler Distributor mit NetSuite, BigCommerce und drei Lieferantenkatalogen verarbeitet 200 RFQs pro Woche. Der Quote-Agent setzt Haiku 5.5 als Subagenten für Katalogsuche und Preistier-Klassifikation ein, Sonnet 5.5 mit halbierten Cache-Reads für den Entwurfsschritt und einen Wissensgraphen für die Ersatzteil-Auflösung. Die monatlichen Inferenzkosten des kompletten Stacks fielen am 7. Oktober um 75 % — von rund 4.000 $ auf unter 1.000 $ — ohne eine einzige Zeile Integrationscode zu ändern. Die MCP-Module, der Wissensgraph und der Audit-Trail machen die Kostenreduktion real. Der Modellpreis ist der einfache Teil.

Fordern Sie einen Build mit definiertem Scope an

Discovery in einer Woche. Sie erhalten ein Systeminventar, einen Workflow-Plan und einen festen Scope — ob Sie mit uns bauen oder nicht.

Möchten Sie dies für Ihre Systeme gebaut?

Jedes Dokument hier stammt aus echter Produktionsarbeit. Wenn Sie ein Zielsystem und einen Workflow im Sinn haben, können wir in einer Woche einen Build umreißen.

Build mit festem Umfang anfragen

Einwöchiges Discovery. Sie erhalten ein Systeminventar, eine Workflow-Mappe und einen festen Umfang — unabhängig davon, ob Sie mit uns bauen.