30 % günstiger pro Aufgabe, 7x so viele Tokens: Die Effizienzfalle von Sonnet 5.5
Kernpunkte
- Sonnet 5.5s Schlagzeile „bis zu 30 % weniger pro Aufgabe" hält bei niedriger und mittlerer Aufwandsstufe, kippt aber bei Max: Anthropic berechnete dieselbe Preisliste von 2 $/10 $, während das Modell ~193.000 Output-Tokens pro Index-Aufgabe verbrauchte — der schwerste Token-Verbrauch, den Artificial Analysis je gemessen hat — mit gemessenen Kosten von 7,60 $ pro Aufgabe, rund 50 % über Sonnet 5 und ~27 % über Opus 5.5 mit 5,98 $ (Anthropic, 28. Sep; Artificial Analysis, 28. Sep).
- Dasselbe Release-Fenster produzierte zwei entgegengesetzte Strategien: OpenAI senkte am 22. September die Preise für GPT-6 Sol/Luna um 50 % auf 2 $/10 $ bzw. 0,10 $/0,50 $ pro Million Tokens — GPT-6 Sol max bei 1,06 $ pro Intelligence-Index-Aufgabe, rund 50 % unter dem Vorgänger — während Anthropic Sonnets Preisliste konstant hielt und die Token-Rechnung steigen ließ (OpenAI; Artificial Analysis).
- Opus 5.5 (22. September) ging einen dritten Weg: 20 % Rabatt auf den Listenpreis und 60 % Rabatt auf Cache-Lesezugriffe (0,50 $ → 0,20 $ pro Million) — gezielt auf die Position, die agentische Workloads dominieren. Deshalb unterbietet sein gemessener Wert von 5,98 $ pro Aufgabe bei maximaler Stufe sogar den eigenen jüngeren Bruder (Anthropic; Finout).
- Bei hoher bis maximaler Aufwandsstufe liegt Sonnet 5.5 außerhalb der Kosten-Effizienz-Grenze: GPT-6 Sol liefert nahezu gleiche Intelligenz zu „effektiv denselben Kosten pro Aufgabe", und GPT-6 Luna max erledigt gleichwertige Intelligenzarbeit für 0,07 $ pro Aufgabe — rund ein Hundertstel der Rechnung von Sonnet 5.5 max (Artificial Analysis, 28. Sep).
- Rund 180 der 672 verfolgten Modelle hatten im September eine Preisänderung — die Preisliste ist inzwischen ein monatliches Risiko, und ein Agent, dessen Vertrag nur Token-Preisführung nennt, hat keine Verteidigung gegen einen Tausch, den er nie genehmigt hat (pricepertoken, 28. Sep; die DeepSeek-Auto-Routing-Umkehrung ist das durchgearbeitete Beispiel).
Anthropic veroeffentlichte Claude Sonnet 5.5 am 28. September mit der saubersten Kostenbehauptung am Markt: „Es ist ein klares Upgrade gegenueber Claude Sonnet 5, laeuft 30 %+ schneller und kostet bis zu 30 % weniger fuer die meisten Arbeiten." Jedes Wort ist verteidigbar — und der Mechanismus ist nicht der, den die Schlagzeile nahelegt. Die Preisliste bewegte sich nicht: 2 $ pro Million Input-Tokens, 10 $ Output, 0,20 $ Cache-Lesezugriffe, identisch mit Sonnet 5. Was sich veraenderte, war die Token-Rechnung — und sie bewegte sich entgegengesetzt zur Behauptung, auf der Aufwandsstufe, auf der agentische Arbeit tatsaechlich laeuft. Artificial Analysis fuhr das Modell am Erscheinungstag: Bei max schuf Sonnet 5.5 ~193.000 Output-Tokens pro Intelligence-Index-Aufgabe — den hoechsten Stand, den ihre Tests je verzeichneten, rund 60 % ueber Opus 5.5 max und etwa siebenmal GPT-6 Astra — mit gemessenen Kosten von 7,60 $ pro Aufgabe (Artificial Analysis, 28. Sep; zuerst vom Team bei kingy.ai verzeichnet: „Sonnet 5.5 ist pro Token guenstig, kann pro Aufgabe aber teuer sein").
Fuer sich genommen ist das eine Eigenart eines Modells. Gelesen gegen dasselbe Zwei-Wochen-Fenster ist es der Scheideweg der Branche. Am 22. September senkte OpenAI die Preise fuer GPT-6 Sol und Luna um 50 % (OpenAI), und Anthropic senkte die Cache-Lesezugriffe von Opus 5.5 um 60 % (Anthropic). Sechs Tage spaeter pricegt Anthrops „30 % guenstiger"-Einstieg dasselbe Token-Volumen zum vollen Preis, das Konkurrenten zum halben verkaufen — und kauft den Platz #2 auf dem Index, indem es Tokens verbraucht statt sie herunten zu kaufen. Drei Release-Strategien konkurrieren jetzt auf derselben Metrik, den Kosten pro Aufgabe, und weichen genau dort am staerksten ab, wo Inferenz-Beschaffungsfuehrung lebt. Dieser Artikel ordnet die drei Strategien gegen die gemessenen Zahlen von Artificial Analysis ein, rechnet die Token-Effizienz-Arithmetik durch, die eine Token-Preisliste verbirgt, und schliesst mit den vier Vertragsklauseln, die verhindern, dass der naechste Modellwechsel die Rechnung Ihres Agenten still neu bepreist.
Die Behauptung, der Mechanismus und die Messung
Anthrops Behauptung betrifft Effizienz, und die Launch-Seite ist explizit zum Mechanismus: das Modell „braucht in der Regel deutlich weniger Tokens fuer dieselbe Arbeit. In unseren Tests kostet es bis zu 30 % weniger pro Aufgabe als sein Vorgaenger." Das gilt auf Anthrops eigener Testverteilung mit Anthrops gewaehlten Einstellungen — das Unternehmen berichtet, Sonnet 5.5 uebertrifft Sonnet 5s beste Benchmark-Scores „fuer etwa ein Zehntel der Kosten pro Aufgabe" bei niedriger und mittlerer Aufwandsstufe (zusammengefasst durch kingy.ai). Wenn Ihr Workload leichtgewichtig und Anthropic-foermig laeuft — kurze Entwuerfe, Klassifikation, begrenzte Lookups — wird die Behauptung auf Ihrer Rechnung wahrscheinlich halten.
Agentische Workloads sind nicht diese Verteilung. Der Artificial Analysis Intelligence Index faehrt Mehrschritt-Aufgaben ueber fuenf Aufwandsstufen aus, und die adaptive Reasoning des Modells eskaliert den Aufwand bei schweren Aufgaben. Am oberen Ende dieser Skala explodiert die Token-Rechnung: 193k Output-Tokens pro Aufgabe bei max, gegen ~120k bei Sonnet 5 max und Opus 5.5 max (+60 %) und 27k bei GPT-6 Astra max (7x). Das Token-Volumen ist der Punkt — Sonnet 5.5 (max) erreicht 56 auf dem Index, 2 Punkte hinter Opus 5.5s 58, mit Terminal-Bench 4.0 bei 64 %, knapp ueber Opus 5.5 und GPT-6 Astra. Er erreicht diese Faehigkeit, indem er pro Schritt laenger denkt, und Output-Tokens werden mit 10 $ pro Million berechnet, egal wie vertretbar jeder einzelne war. Eine Fallback-Fussnote komplettiert die Mechanik: Anthrops Standard-Adaptive-Routing „faellt in ~0,1 % der Aufgaben zurueck... mit Fallback auf Sonnet 5 in allen Faellen" — eine weitere preislisten-neutrale Substitution, die ein Operator erst auf der Rechnung sieht (Artificial Analysis).
Kosten pro Aufgabe ist die einzige Metrik, die diese Struktur ueberlebt, weil sie Preisliste und Token-Rechnung komponiert. Dieselbigen Messungen, alle Kosten pro Aufgabe auf dem Intelligence Index bei maximaler Aufwandsstufe:
| Modell (max) | Listenpreis ($/M in/out) | Output-Tokens/Aufgabe | Gemessene Kosten/Aufgabe | Release-Strategie |
|---|---|---|---|---|
| Claude Sonnet 5.5 | 2 $ / 10 $ | ~193k | 7,60 $ | Capability-led: flache Preisliste, Token-Rechnung steigt |
| Claude Opus 5.5 | 4 $ / 20 $ (Cache 0,20 $) | ~120k | 5,98 $ | Cache-led: Listenpreis −20 %, agentische Position −60 % |
| Claude Sonnet 5 | 2 $ / 10 $ | ~120k | ~5,00 $ | Baseline |
| GPT-6 Sol | 2 $ / 10 $ | ~31k | 1,06 $ | Price-led: Listenpreis −50 % |
| GPT-6 Luna | 0,10 $ / 0,50 $ | ~51k | 0,07 $ | Price-led: Floor-Preis |
(AA Intelligence Index v4.x: Sonnet 5.5 56 auf #2; Opus 5.5 58 auf #1; GPT-6 Sol ~56-Klassen-Aequivalent bei Coding-Agent-Arbeit. Scores tragen einen Lineage-Hinweis — AA hat seinen Index in diesem Jahr zweimal neu gerechnet; Scores nur gegen Publikationen derselben Quelle zitieren.)
Die Falle liegt in der ersten und dritten Zeile: identische Listenpreise, 7,6x auseinander bei den gemessenen Kosten. Eine Beschaffungsentscheidung auf der Preisliste — „Sonnet 5.5 entspricht Sonnet 5s Preisen, ist also das wirtschaftliche Upgrade" — erzeugt das exakte Gegenteil der Rechnung. Und das gemessene Ranking dreht die Intuition ein zweites Mal um: das teurere Listenpreis-Angebot auf dem Tisch (Opus 5.5 mit 4 $/20 $) ist die guenstigere Aufgabe, weil seine Cache-Lese-Kuerzung genau die Position angreift, die agentische Workloads tatsaechlich dominieren — das tausendfache Wiederlesen langer Kontexte pro Aufgabe (Anthropic: „Cache-Lesungen (die den Grossteil der agentischen und Coding-Work-Kosten ausmachen) liegen bei 0,20 $ pro Million Tokens").
Drei Release-Strategien, ein Schlachtfeld
Das September-Fenster hat formalisiert, was der Preiswettbewerb seit Juni durchklingen liess: Der Pro-Token-Preis ist nicht mehr der Ort, an dem Anbieter konkurrieren, denn der Pro-Token-Preis ist nahezu gratis geworden. Das Schlachtfeld hat sich zu den Kosten pro Aufgabe verlagert, und jedes Labor hat eine andere Waffe gewaehlt.
Capability-led (Anthropic, Sonnet-Linie). Ein quasi-Frontier-Modell auf der alten Preisliste ausliefern und die Benchmark-Tabelle gewinnen. Sonnet 5.5 auf #2 mit 60 % schwererer Token-Rechnung ist die reinste Form: der Intelligenzgewinn ist real (+18 Indexpunkte ueber Sonnet 5 bei max), und seine Kosten landen auf der Token-Position der Rechnung, wobei „30 % guenstiger" und „7,60 $" beide technisch wahr bleiben. Die Strategie wettet, dass Kaeufer Schlagzeilen und Benchmarks lesen und Token-Volumen als Freigut behandeln — und nach Gartners Prognose vom 16. September, dass die weltweiten AI-Ausgaben 2026 um 49,5 % auf 2,7 T $ wachsen, mit dem Agents-and-Assistants-Segment auf einem Pfad von 16,5 → 29,2 → 65,5 Mrd. $, hat die Wette ein echtes Publikum.
Price-led (OpenAI, Sol/Luna-Linie). Den Listenpreis halbieren und die Pro-Task-Mathematik selbst publizieren. OpenAIs Release-Tabelle ist beschaffungsreif wie kein Modellstart zuvor: GPT-6 Sol (xhigh) erzielt 33,2 % bei 0,27 $ pro Aufgabe gegen Claude Opus 5 (max) mit 26,9 % fuer das 11,1fache der Kosten. Auf Artificial-Analysis-Seite halbierte GPT-6 Sol max die 1,99 $ des eigenen Vorgaengers auf 1,06 $ und gewann dabei 2 Punkte im Coding Agent Index (Artificial Analysis). Die Strategie wettet, dass gemessene, publizierte Kosten pro Aufgabe die kuenftige Kaufmetrik sind — und dass ein Anbieter, der auf seine Effizienz vertraut, Beschaffung gewinnt, indem er Kostenvergleiche muehelos macht.
Cache-led (Anthropic, Opus-Linie). Den Frontier-Listenpreis halten, den agentischen Kostentreiber aushoehlen. Opus 5.5s Cache-Lesen-Kuerzung von 0,50 $ auf 0,20 $ zielt exakt auf die Workload-Form, in der agentische Tokens leben — wiederholtes Lesen grosser, stabiler Kontexte. Anthropic schaetzt ~40 % geringere Gesamtkosten bei typischer Arbeit (Fello AI fasst die Launch-Angaben zusammen), und die gemessenen 5,98 $/Aufgabe gegenueber 7,60 $ bestaetigen die Richtung unabhaengig.
Der Punkt des Diagramms ist der Arithmetik-Kasten, nicht die Balken: Eine Preisliste ist ein Preis pro Million; ein Kosten-pro-Aufgabe-Vertrag ist ein Preis pro Ergebnis. Auf einem 200-Schritte-Workload, der 1.200-mal pro Woche laeuft, verbraucht Sonnet 5.5 max 193k Output-Tokens pro Schritt und stellt etwa 2.316 $ pro Woche in Rechnung, wo GPT-6 Sol 121 $ fuer nahezu gleiche gemessene Intelligenz berechnet (beide liegen auf dem Index im Bereich 55; Sols Coding-Agent-Oekonomie bei 2,99 $/Task liegt laut AAs Coding-Index-Analyse auf der Pareto-Frontier). Die Wochendifferenz zwischen dem „30 % guenstiger"-Modell und seinem eigenen Vorgaenger betraegt rund 1.100 $ — die Behauptung „bis zu 30 % weniger" und eine Kostenverdopplung sind zugleich wahr, unterschieden nur durch die Aufwandsverteilung. Deshalb zaehlt der Vertrag mehr als der Launchpost.
Das Beschaffungsproblem, das September gerade schwerer gemacht hat
Zwei strukturelle Fakten machen daraus mehr als einen Kommentar — naemlich Vertragssprache. Erstens ist das Preislisten-Risiko inzwischen monatlich: pricepertoken liest rund 180 von 672 verfolgten Modellen mit einer Septembers-Preisänderung (die Drift des Zaehlers im Laufe des Monats: 178/672 → 181/671), und LLM Gateways Timeline listet in diesem Monat 23 neue Modelle von 15 Anbietern — die Rechnung, die Ihr Agent im August fuhr, ist nicht die Rechnung, die er im Oktober faehrt. Zweitens wird die Substitutionsschicht bereits als Produkt ausgeliefert: LLM Gateways Smart Route, am 25. September veroeffentlicht, macht anbieterseitiges Routing zu einer kaufbaren Funktion, und Anthrops adaptiven Fallback („faellt in ~0,1 % der Aufgaben zurueck, hauptsaechlich bei Terminal-Bench, mit Fallback auf Sonnet 5 in allen Faellen" laut AA-Tests) ist derselbe Mechanismus innerhalb des Modellaufrufs. Beides ist kein Fehlverhalten — die DeepSeek-Episode zeigte, dass Anbieter sogar eine flotteweite Modellsubstitution ankuendigen und 45 Stunden spaeter unter Userdruck wieder zuruecknehmen koennen. Die Routing-Entscheidung ist real und gehoert demjenigen, der das Runtime haelt.
Vor diesem Hintergrund hat der Kauf auf der Preisliste drei konkrete Fehlermodi:
- Der Benchmark-Schlagzeilen-Fehler. Sonnet 5.5 fuehrt dieselbe Launch-Episode in der Faehigkeitsgeschichte (Index #2, Terminal-Bench 4.0 bei 64 %) und der Kostengeschichte (30 % weniger pro Aufgabe) an — beide wahr, komponiert gegen unterschiedliche Baselines. Ein Beschaffungsdurchlauf, der den Launchpost und die Benchmark-Tabelle liest, aber nicht die Token-Spalte, genehmigt die teuerste Kosten-pro-Aufgabe-Konfiguration auf dem Tisch.
- Die aufwandsblinde Prognose. Die meisten veroeffentlichten Kostenrechnungen nehmen veroeffentlichte Einstellungen an. AAs Durchlauf zeigt, dass Sonnt 5.5s Rechnung nach Aufwand schwingt (max 7,60 $ vs Sonnet 5 ~5,00 $; niedrige/mittlere Stufen, auf denen die „30 % guenstiger"-Behauptung lebt); eine auf den API-Standard gebaute Prognose erbt die Stufe, die die SDK-Eskalationslogik des Anbieters pro Aufgabe waehlt.
- Der cache-blinde Stueckpreis. Zwei Anthropic-Modelle 30 Tage auseinander waehlten entgegengesetzte Achsen — Sonnet 5.5 liess Tokens teuer, Opus 5.5 machte das Cache-Lesen billig. Die tatsaechliche Cache-Trefferquote einer agentischen Workload (lange, stabile Systemprompts; wiederholte Tool-Schemata; grosse abgerufene Kontexte) ist inzwischen der groesste Einzelbestimmer dafuer, welches von beiden billiger ist — eine Zahl, die die meisten RFQ-Prozesse nie erfragen.
Keine davon ist Anbietertaeuschung. Alle drei sind das normale Ergebnis eines Marktes, dessen Stueckokonomie unter seiner eigenen Preissprache verschoben hat — derselbe Schluss, den AA in einer Zeile erreichte: „Sonnet 5.5 ist pro Token billig, kann pro Aufgabe aber teuer sein."
Der Vertrag: vier Klauseln, die das naechste Release ueberleben
Die Loesung ist nicht, das gewinnende Labor zu waehlen; bei den Kosten pro Aufgabe wechselt der Gewinner woechentlich (der pricepertoken-Zaehler bewegt sich monatlich). Sie besteht darin, die Entscheidung zu instrumentieren, sodass der naechste Wechsel eine gemessene Konfigurationsaenderung ist statt einer Rechnungsuberraschung. Die vier Klauseln entsprechen demselben Runtime, das diese Website in jeden Agenten einbaut:
1. Modell-IDs pro Schritt fixieren und das servierte Modell loggen, nicht das angefragte. Die Routing-Schicht ist Operator-Infrastruktur. model-Felder leben in Ihrer Agentenkonfiguration — in unserem Referenz-Runtime referenzieren Agenten registrierte Modellressourcen ueber Provider + Name, und ein Modellwechsel ist eine Datenoperation, kein Redeploy. Die Audit-Trails protokollieren das tatsaechlich servierte Modell pro Tool-Aufruf (der DeepSeek-Artikel deckt das vollstaendige Incident-Muster ab). Ein Anbieter, der Ihr Modell still austauscht, produziert jetzt ein sichtbares Diff.
2. Auf Kosten pro Aufgabe mit Wochenobergrenze vertraglich sichern, nicht pro Token mit Monatsrechnung. Pro-Task-Preise werden zu einer publizierten Erstpartei-Metrik (OpenAI publiziert sie in Release-Tabellen; AA messst alle auf denselben Aufgaben). Ein gescoped Vertrag benennt den Workload (Schritte, Kontextform, erwartete Cache-Trefferquote), Modell und Aufwandsstufe pro Schritt-Klasse und eine gemessene Obergrenze pro Aufgabe — mit der publizierten Pro-Task-Preisliste des Anbieters als Benchmark-Zeile. Das Sechs-Kostenvektoren-Framework liefert die Audit-Checkliste; der fuenfte Vektor (Anbieter-Substitutionsrisiko) ist die Klausel, die dieser Abschnitt operationalisiert.
3. Tokens budgetieren, indem der Effort-Regler als Beschaffungsflaeche behandelt wird, nicht als Entwicklereinstellung. Sonnt 5.5s 30x-Rechnungsschwanken ueber die Effort-Stufen ist der konkrete Fall. Die Routing-Schicht sollte Reasoning-Effort als typisiertes Konfigurationsfeld pro Schritt-Klasse behandeln — Eskalationsschwellen explizit, Obergrenzen hart am Runtime gestoppt (das Kosten-Obergrenzen-Muster fuer langlebige Agenten), die Eskalationspolitik sichtbar in der Audit-Trail. Ein „maximaler Aufwand"-Standard ueber 1.200 taegliche Schritte ist eine Beschaffungsentscheidung, die nie getroffen wurde.
4. Die behauptete Effizienz auf Ihrem Workload testen, bevor Sie eine Flotte darauf festschreiben. Anthrops „bis zu 30 % weniger" ist ehrlich, abgesteckt und workload-conditional — und AAs Gegenmessung von 7,60 $ ist ebenso ehrlich, abgesteckt und workloadspezifisch. Keines sagt Ihnen Ihre Rechnung. Der 30-Minuten-Pilot: nehmen Sie eine Woche echter Agentenlaeufe, spielen Sie diese gegen das Kandidatenmodell bei jeder Aufwandsstufe zurueck, messen Sie Tokens und Cache-Trefferquote pro Schritt, und legen Sie die drei Zahlen (Preisliste, Token-Rechnung, Kosten pro Aufgabe gemessen) in das Beschaffungs-Einseitige. Der TypeSafe-Jev-Dreischicht-Stack macht dies kontinuierlich — ein kalibrierter Decision-Layer-Klassifikator beobachtet die Rechnung pro Schritt-Klasse, denn der Wchter ist pro Aufruf beinahe gratis.
Ein Ehrlichkeitsvermerk gilt fuer alles Obige, einschliesslich Arithmetik-Kasten: Alle gemessenen Pro-Task-Zahlen stammen aus zwei unabhaengigen Testquellen am selben Tag (AA, kingy.ai) plus anbieterpublizierte Tabellen, auf Benchmark-Aufgaben, nicht Ihrem Workload. AAs Intelligence Index wurde in diesem Jahr ebenfalls zweimal neu gerechnet; die hier zitierten Scores und Kosten sind Vergleichswerte desselben Publikationsdatums und koennen sich beim naechsten Rebase veraendern. Behandeln Sie all dies als die Start-Baseline, die ein Pilot ersetzt — die Richtung (Preisliste ≠ Rechnung; Token sind die Variable) ist stabil, die exakten Konstanten nicht.
Das Ergebnis auf einem realen Profil
Rechnen Sie die Zahlen auf das Mid-Market-Build-Profil, um das diese Website schreibt: der Angebots-Agent eines Distributors, 200 RFQs pro Woche, rund 1.200 Modell-Schritte pro Woche ueber Katalogabfrage, Staffelpreislisten, Wissensgraph-Substituten und Entwurfsgenerierung. Bei Sonnet 5.5 max stellt dieses Profil rund 2.300 $/Woche in Rechnung. Bewusst gerouted — Frontier-Aufwand nur auf verhandlungsrelevanten Schritten, ein Mid-Tier-Modell auf Abfragen, ein nahe-Floor-Modell auf Klassifikation, cache-intensive Kontexte shared ueber Schritte — faehrt derselbe Workload unter 300 $/Woche, mit der Qualitaet konzentriert dort, wo das Geschaeftergebnis wirklich lebt: das Angebot, das der Kunde sieht. Die 87-%-Differenz ist keine Modell-Auswahlkunst; es ist der Runtime, der eine Kostenentscheidung durchsetzt, die der Launchpost nie fuer Sie getroffen hat. Bei diesen Volumina bleibt die Integrationsschicht — MCP-Module, Routing-Richtlinie, Audit-Trail — die 90 % des Builds, die eine Token-Preisliste nicht bepreisen kann; die Modellrechnung ist das Rauschen, und das obige Muster ist die Art, wie man sie Rauschen statt Signal bleiben laesst.
Weiterführende Literatur
- Inferenz-Oekonomie: Warum Always-on-Produktions-Agenten jetzt bezahlbar sind — der Mutterartikel: der 1.000-fache Pro-Token-Kostencollaps, der Jevons-Paradox-Rahmen und der Hyperscaler-CapEx-Kontext hinter den Preissenkungen dieses Zeitfensters
- Ueber den Token-Preis hinaus: Sechs Kostenvektoren, die die Inferenz-Beschaffung umgestalten — der Beschaffungsrahmen, in den sich die vier Klauseln dieses Artikels einpassen; Token-Effizienz ist das Gegenstueck auf Modellebene zu seinem Anbieter-Kontinuitaetsvektor
- DeepSeek V4.1-Flash und der stille Modellwechsel — der Substitutionsvorfall, der das Loggen des servierten Modells und den fixierten-ID-Vertrag von „klug" zu „noetig" macht
Ein Mid-Market-Distributor mit NetSuite und BigCommerce quotet 200 RFQs pro Woche ueber einen gouvernierten Agenten-Stack: MCP-Module fuer die ERP und drei Lieferantenkataloge, ein Wissensgraph fuer Teile-Substituten, eine RFQ-Engine fuer Verfuegbarkeitsholds — und eine Routing-Schicht, die Modell-IDs pro Schritt-Klasse fixiert, Tokens pro Aufgabe deckelt und das servierte Modell bei jedem Aufruf loggt. Wenn der naechste Launchpost „30 % guenstiger" behauptet, laeuft die Schicht eine einwoechige Pilot-Wiederholung und die Beschaffungs-Seite kriegt drei Zahlen statt eines Adjektivs. Erster Agent live in 5–8 Wochen.
Einen abgesteckten Build anfordern. Eine Woche Discovery. Sie erhalten ein Systeminventar, eine Workflow-Map und einen festen Scope — unabhaengig davon, ob Sie mit uns bauen.
Möchten Sie dies für Ihre Systeme gebaut?
Jedes Dokument hier stammt aus echter Produktionsarbeit. Wenn Sie ein Zielsystem und einen Workflow im Sinn haben, können wir in einer Woche einen Build umreißen.
Build mit festem Umfang anfragenEinwöchiges Discovery. Sie erhalten ein Systeminventar, eine Workflow-Mappe und einen festen Umfang — unabhängig davon, ob Sie mit uns bauen.