Von Pilot-Zersplitterung zur Produktion: Warum 56 % der CEOs null KI-ROI sehen
Die Zahlen
Die PwC 2026 Global CEO Survey befragte 4.454 CEOs in 82 Territorien. Sechsundfünfzig Prozent berichten keinen signifikanten finanziellen Nutzen aus KI in den letzten 12 Monaten — weder erhöhte Einnahmen noch gesenkte Kosten. Nur 12 % berichten beides. Die globalen KI-Ausgaben erreichten 2,6 Billionen Dollar im Jahr 2026, und mehr als die Hälfte davon brachte keine messbare Rendite.
Die WRITER 2026 AI Adoption Survey (2.400 Unternehmen) ergab, dass 59 % mindestens 1 Million Dollar jährlich in KI investieren, aber nur 29 % signifikante Renditen aus generativer KI sehen und nur 23 % signifikanten ROI speziell aus KI-Agenten. Fünfundachtzig Prozent der Führungskräfte geben zu, dass ihre KI-Strategie „eher Show" als tatsächliche Anleitung ist. Siebenundneunzig Prozent setzten im vergangenen Jahr KI-Agenten ein, dennoch kann die Mehrheit das Deployment keinem finanziellen Ergebnis zuordnen.
PwCs AI Performance Study ergänzt die Verteilung: 20 % der Unternehmen erzielen 75 % aller KI-getriebenen finanziellen Vorteile. Die Lücke besteht nicht zwischen KI-Adoptern und Nicht-Adoptern. Sie besteht zwischen Organisationen, die Piloten deployt haben, und Organisationen, die Produktionssysteme deployt haben.
Die Diagnose: Pilot-Zersplitterung
Die Konvergenz über PwC, WRITER, Anthropic, OpenAI und Google ist klar: Das Problem sind nicht die Modelle. Das Problem ist, dass der Werkzeugzugang demokratisiert wurde, das Workflow-Redesign aber nicht.
Pilot-Zersplitterung ist das Muster: Eine Abteilung erhält Zugang zu einem KI-Werkzeug, führt einen Proof of Concept durch, demonstriert, dass das Modell eine Aufgabe ausführen kann, und dann stoppt der Pilot. Die Demo wird nie zu einer Produktionsintegration. Das Werkzeug ist verfügbar, aber der Workflow, den es verbessern sollte, bleibt unverändert. Die Organisation hat eine ChatGPT-Lizenz und eine Foliensammlung, kein System, das in NetSuite schreibt, Bestand reserviert oder das angenommene Angebot zurück ins ERP schreibt.
WRITERs Daten machen den Mechanismus sichtbar: 78 % der Organisationen berichten Spannungen zwischen IT und anderen Geschäftsbereichen wegen KI. Die IT sieht ungewartete Prototypen ohne Governance. Die Business-Teams sehen die IT als Flaschenhals. Die Piloten vermehren sich, weil niemand den Produktivierungs-Schritt besitzt — die Arbeit, das Modell mit dem System of Record zu verbinden, Audit-Logs, Ratenbegrenzungen, Fehlerbehandlung und das Operator-Runbook hinzuzufügen, das den Agenten sicher im Betrieb und sicher bei der Außerbetriebnahme macht.
Update — 2026-10-01: beide Frontier-Labore gehen nun an die öffentlichen Märkte — die Uhr läuftDas Kapitalumfeld um die Buy-vs-Build-Mathematik dieses Artikels hat sich am 1. Oktober 2026 weiter verengt: Bloomberg/LinkedIn-Berichte setzen Anthropics IPO-Ziel auf Mitte November, mit formellem Marketing womöglich ab der Woche des 9. November und Handelsbeginn vor Thanksgiving (möglicherweise verschoben auf die Zeit nach den Midterms). OpenAIs ~$1T-Bewertungssignal kam zuerst; Anthropics ~$2T-Ziel bei einer ~$65B Run-Rate folgt. Die Marktstruktur-Lesart für einen Mid-Market-Käufer ist nicht „sollen wir Frontier-Aktien kaufen“ — sie ist, dass beide Anbieter, die die Frontier-Erzählung tragen, bald Quartalsmarkt-Druck beantworten müssen, während die Liste der Agenten-Fehlverhaltens-Vorfälle weiter wächst. An der Deployment-Mathematik ändert das nichts: Pilot-Zersplitterung bleibt das dominante Fehlermuster, und der Produktions-Integrationsweg bleibt der sich zusammensetzende. An der Governance-Mathematik ändert sich etwas: Anbieter-Sicherheitsclaims stehen bald vor einem Markt, der Narrative ebenso belohnt wie Evidenz — die unabhängige Verifikation des Käufers, die Deployment-Kontrollen, die die Vier-Schritte-Methode dieses Artikels als Nebenprodukt hervorbringt, wird zur Diligence-Fläche, die sich nicht mit dem News-Zyklus der Anbieter bewegt.
Der Messungswechsel
Der Januar 2026 brachte einen koordinierten Wechsel von „Nutzern" zu „Ergebnissen" als Metrik für KI-Wert.
Der Economic Index von Anthropic führte „ökonomische Primitive" ein — ein Framework, das KI-Wert über fünf Dimensionen misst: Aufgabenkomplexität, menschliche und KI-Fähigkeiten, Arbeits- vs. Privatkontext, Autonomiegrad und Erfolgsraten. Das Framework unterscheidet niederwertige Aufgaben (eine E-Mail zusammenfassen) von höherwertigen (ein mehrstufiger Code-Workflow, der im Durchschnitt 3,3 Stunden menschenäquivalenter Arbeit spart). Der Punkt ist: „Wir haben jedem eine KI-Lizenz gegeben" ist keine Wertaussage. Die Wertaussage lautet: Welche Aufgaben hat die KI ausgeführt, bei welcher Komplexität, mit welcher Erfolgsrate und bei welchem Autonomiegrad.
OpenAIs Analyse des „Capability Overhang" ergab, dass Power-User 7× häufiger auf erweiterte Reasoning-Fähigkeiten zurückgreifen als Durchschnittsuser, mit einer 3×-Lücke in der Nutzungintensität über 70+ Länder. Die Implikation: Die meisten Organisationen nutzen KI zu einem Bruchteil ihrer Fähigkeit, nicht weil die Fähigkeit fehlt, sondern weil niemand den Workflow gebaut hat, der sie ausübt.
Der Messungswechsel ist wichtig, weil er die ROI-Frage umrahmt. Die Frage lautet nicht „hat KI Einnahmen generiert?". Die Frage lautet „welche Produktionsaufgaben führt die KI aus, bei welcher Komplexität und Erfolgsrate, und was verdrängt das in menschlichem Aufwand oder Zykluszeit?".
Was die 12 % anders machen
PwC stellte fest, dass CEOs, die finanzielle Renditen berichten, 2–3× häufiger KI extensiv in die Entscheidungsfindung eingebettet haben — nicht in isolierten Piloten, sondern in den Systemen, in denen Entscheidungen getroffen und aufgezeichnet werden.
Das Muster über die Vorreiter-Organisationen hinweg ist konsistent: Sie begannen nicht mit einem Werkzeug. Sie begannen mit einem Workflow, der einen messbaren Flaschenhals hatte, bauten eine Produktionsintegration, die ihn adressierte, und maßen das Ergebnis. Die KI ist in das System of Record eingebettet, nicht daneben schwebend.
Das ist das Gegenteil von Pilot-Zersplitterung. Es ist Produktions-Deployment: der Agent empfängt die RFQ, löst Produkte gegen den Katalog auf, legt Preise nach Kundensebene fest, reserviert Bestand mit einer Frist, schreibt das angenommene Angebot zurück nach NetSuite und protokolliert jeden Schritt. Das Ergebnis ist messbar, weil die Arbeit im System ist — Angebots-Bearbeitungszeit, Angebots-Genauigkeit, gesparte Stunden pro RFQ, Präzision der Bestandsreservierung. Der Pilot produziert keine dieser Metriken, weil der Pilot das System of Record nie berührt.
Warum Produktions-Agenten jetzt erschwinglich sind
Der wirtschaftliche Einwand gegen Produktions-Deployments — dass Always-on-Agenten zu teuer im Betrieb sind — brach 2025–2026 zusammen. Die Inferenzkosten für GPT-4-Äquivalent fielen von 20 Dollar pro Million Tokens Ende 2022 auf 0,40 Dollar im Jahr 2026, eine 1.000×-Reduktion, angetrieben durch Hardware-Effizienz, Software-Optimierung, Modellarchitektur-Verbesserungen und Quantisierung. Inferenz macht nun 67 % der gesamten KI-Rechenleistung aus, gegenüber 33 % im Jahr 2023 — die Industrie optimiert für Serving, nicht nur für Training.
Für ein mittelständisches B2B-Unternehmen bedeutet dies: ein 24/7-Produktions-Agent, der RFQs verarbeitet, Bestand überwacht oder Support-Eskalationen behandelt, kostet Dollar pro Tag an Inferenz, nicht Tausende. Die Kostenbarriere für Produktions-Deployments ist verschwunden. Die verbleibende Barriere ist die Integrationsarbeit — die MCP-Module zu bauen, ERP- und E-Commerce-Plattformen anzubinden, die Governance-Schicht hinzuzufügen — was genau die Arbeit ist, die Pilot-Zersplitterung überspringt.
Die Produktionsalternative
Ein Produktions-Agenten-Deployment ist kein größerer Pilot. Es ist eine andere Kategorie von Arbeit mit einem anderen Deliverable.
Fester Umfang vor Code. Eine einwöchige Discovery produziert das Systeminventar, die Workflow-Karte und den Build-Plan. Der Umfang ist festgelegt, bevor eine Zeile Code geschrieben wird. Das Pilotenmuster überspringt diesen Schritt — jemand demonstriert eine Fähigkeit, und der Umfang ist, was auch immer die Demo zufällig abdeckte.
Phasige Lieferung. Der Build ist in Phasen unterteilt: Umgebung und Modul-Gerüst (Phase 1), Kern-MCP-Module und Agenten-Verdrahtung (Phase 2-3), Produktionshärtung und Operator-Runbook (Phase 4). Jede Phase hat eine Demo. Das Pilotenmuster hat eine Demo, am Ende, und dann stoppt es.
Code, der in das System of Record schreibt. Der Agent schreibt zurück nach NetSuite, BigCommerce oder die Plattform, die die Transaktion hält. Das Ergebnis ist messbar, weil die Arbeit im System ist. Das Pilotenmuster produziert eine Foliensammlung.
Governance-Schicht. Jeder Werkzeugaufruf wird protokolliert mit Zeitstempel, Agent-ID, Werkzeugname, Ausgabestatus und Dauer. Ratenbegrenzungen werden pro Werkzeug und pro Zeitfenster durchgesetzt. Fehler sind typisiert — der Agent unterscheidet ein vorübergehendes Timeout von einem dauerhaften Validierungsfehler und antwortet entsprechend. Ein Kill-Switch deaktiviert jedes Modul per Konfigurationsänderung, nicht per Code-Deployment. Das Pilotenmuster hat nichts davon — und die 200.000 verwundbaren MCP-Instanzen, die 2026 offengelegt wurden, zeigen, was passiert, wenn Governance übersprungen wird.
Gemessene Ergebnisse. Das Deployment wird mit den Metriken ausgeliefert, die Erfolg definieren: Angebots-Bearbeitungszeit, Auftragsgenauigkeit, verdrängte Stunden pro Woche, Präzision der Bestandsreservierung. Dies sind die ökonomischen Primitive, angewendet auf einen realen Workflow. Das Pilotenmuster hat „Nutzer" — eine Zahl, die Ihnen nichts über den Wert sagt.
Die Vier-Schritte-Methode
Das Produktions-Deployment-Muster ist nicht theoretisch. Es ist die Methode, die einen ersten Agenten in 5–8 Wochen in Produktion bringt:
- Discovery (1 Woche). Systeminventar, Workflow-Karte, fester Umfang. Sie erhalten den Plan, ob Sie mit uns bauen oder nicht.
- Umgebung und Gerüst (1–2 Wochen). MCP-Modul-Struktur, Agenten-Handler, Observability-Pipeline, Authentifizierung und Tenant-Isolation.
- Kernmodule und Agenten-Verdrahtung (2–3 Wochen). Die MCP-Module, die sich mit dem System of Record verbinden — NetSuite, BigCommerce, Lieferantenkataloge, Preis-Engines. Der Agent empfängt die Anfrage, ruft die Module auf und schreibt das Ergebnis zurück.
- Produktionshärtung (1–2 Wochen). Operator-Runbook, Kill-Switch-Konfiguration, Fehlerpfad-Tests, Ratenlimit-Tuning, Deployment in die Produktionsumgebung.
Das Deliverable am Ende der Woche 8 ist keine Demo. Es ist ein funktionierender Agent, der echte Anfragen gegen echte Systeme verarbeitet, mit jedem Schritt protokolliert und jedem Modul deaktivierbar. Das ist der Unterschied zwischen einem Piloten und einem Produktionssystem — und es ist der Unterschied zwischen den 56 %, die keinen ROI sehen, und den 12 %, die es tun.
Update — 2026-10-02: Anthropics IPO-Fenster verengt sich — Mitte-November-Ziel, Handel vor Thanksgiving
Der Marktstruktur-Datenpunkt, den dieser Artikel bisher mitführt, hat nun ein genaues Datum: Reuters und Bloomberg berichteten am 1. Oktober 2026, dass Anthropic einen Mitte-November-IPO anpeilt — mit formellem Marketing womöglich ab der Woche des 9. November, Handelsbeginn vor Thanksgiving, möglicherweise verschoben auf die Zeit nach den Midterms. In Kombination mit OpenAIs ~$1T-Bewertungssignal gehen beide Labore, die die Frontier-Erzählung tragen, auf die öffentlichen Märkte zu, während die Liste der Agenten-Fehlverhaltens-Vorfälle weiter wächst (100+ Organisationen alarmiert, 50 Petabyte in forensischer Durchsuchung). An der Buy-vs-Build-Mathematik, die dieser Artikel verteidigt, ändert das Marktfenster nichts; was sich ändert, ist die Haltbarkeit von Anbieter-Sicherheitsclaims unter Quartalsmarkt-Druck. Die unabhängige Verifikation des Käufers — die Deployment-Kontrollen, die die Vier-Schritte-Methode dieses Artikels als Nebenprodukt hervorbringt — ist die Diligence-Fläche, die sich nicht mit dem News-Zyklus eines der beiden Labore bewegt, und die Ereignisliste der beiden Labore ist nun lang genug, dass diese Verifikation keine hypothetische Diligence mehr ist.
Ein Distributor, der NetSuite, BigCommerce und drei Lieferantenkataloge betreibt, erhält einen Agenten, der eine RFQ per E-Mail oder Portal empfängt, Produkte und Substitute gegen den Katalog-Graphen auflöst, Preise nach Kundensebene festlegt, Bestand mit einer Frist reserviert und das angenommene Angebot zurück nach NetSuite schreibt — mit jedem Schritt protokolliert, jedem Werkzeug ratenbegrenzt und jedem Modul per Konfiguration deaktivierbar. Die Angebots-Bearbeitungszeit sinkt von Tagen auf Minuten. Dieser Build ist Phase 2-3 der Vier-Schritte-Methode und ist typischerweise in 5-8 Wochen live.
Angebot für ein abgegrenztes Build anfordern. Einwöchige Discovery. Sie erhalten ein Systeminventar, eine Workflow-Karte und einen festen Umfang — ob Sie mit uns bauen oder nicht.
Update — 2026-10-06: Mistral Large 4s Cyber-Souveränitäts-These ergänzt die Build-Spalte um einen Governance-Datenpunkt: ein Open-Weight-MoE mit 1T Parametern / 49B aktiv (Public Preview 6. Oktober 2026, trainiert auf 3.800 NVIDIA Grace Blackwell GPUs in Mistrals eigenen europäischen Rechenzentren, Series D über €3 Mrd.) liefert 82% bei reproduce-and-patch — die höchste Cybersecurity-Wertung aller gemessenen Modelle, bei einer Aufgabe, bei der Claude Opus 5.5 und GPT-6 Astra nahezu null erreichen, weil sie sie verweigern. Mistrals Argument — Provider-level Refusals können legitime Schwachstellenforschung und Incident Response blockieren; der Verlust des Zugriffs auf eine Fähigkeit mitten im Vorfall kann selbst zu einem kritischen Sicherheitsrisiko werden — ist das Modell-Ebenen-Analogon der leitenden These dieses Artikels: die Kontrollen, die Sie besitzen, schlagen die Garantien, die Sie kaufen. Ein Käufer, der die Deployment-Schicht hinter governed MCP-Modulen aufbaut, kann die am höchsten bewertete Sicherheitsfähigkeit jetzt aus einem Deployment-Pfad beziehen (Open Weights, Self-Host), den die Refusal-Schicht keines Anbieters nicht einschränkt — souveränes Deployment ist von der Compliance-Präferenz zur Governance-Kontrolle migriert. Der Reflection AI Beam-Datenpunkt (501B / 23B aktiv bei 3–4× weniger Inferenz-Compute, Apache 2.0 diesen Monat) und Kolibri-1 von Aleph Alpha (78,1B / 3,46B aktiv, gebaut und trainiert in Deutschland und Finnland) vervollständigen das Drei-Regionen-Bild: USA, Europa und China haben jetzt Open-Weight-Champions, und die Build-Option wird unabhängig von der Policy eines einzelnen Anbieters bewertet. Die Pilot-Sprawl-Arithmetik bleibt unangetastet: 56% der CEOs sehen weiterhin null ROI — das unterscheidende Merkmal bleibt, ob der Käufer die Integrations- und Governance-Schicht besitzt — egal welche Gewichte deployed sind.
Update — 2026-10-07: die Budgets trocknen aus — die ROI-Lücke erzeugt sichtbare Erschöpfung
Die ROI-Lücke, die dieser Artikel dokumentiert, hat nun ihre sichtbare Konsequenz auf Unternehmensebene. MarketScale berichtet, dass die KI-Budgets großer US-Unternehmen in 1–2 Monaten austrocknen, während die Token-Kosten steigen — das CFO-Überdenken hat den Horizont desselben Quartals erreicht (MarketScale). AI Business Weeklys 2026-Aggregation bepreist den Buildout: Die AI-Infrastrukturausgaben wachsen 2026 um 62,5 % auf 822B$, während nur 6 % der Adopters messbaren unternehmensweiten Profit erfassen (AI Business Weekly). InformationWeek rahmt es als „der KI-Infrastruktur-Boom kommt für Unternehmensbudgets", und witness.ai's 2026-CFO-Breakdown itemisiert die versteckten Kosten. Die drei Datapoints verketten sich zu der Fehlersequenz, die dieser Artikel diagnostiziert: Adoption gibt mehr aus als sie zurückbringt (56 % der CEOs ohne finanziellen Nutzen), die Ausgaben sind in die Infrastruktur vorverlagert (62,5 % Wachstum), die Wertabschöpfung ist selten (6 %), und das Budgetfenster ist monatlich (1–2 Monate). Pilot-Sprawl ist nicht mehr nur ein strategischer Fehler — er ist der Grund, warum das Geld ausgeht, bevor die Workflow-Neugestaltung passiert. Der konstruktive Kontrapunkt bleibt derselbe: das Build-Muster mit festem Scope (die Vier-Schritt-Methode unten) — gemessene Outcomes, Integrationen ins System of Record, und Governance, die die Beschaffung übersteht.
Update — 2026-10-07: Q4-2026-Finanzierung — der Agentenmarkt beschleunigt, während die Budgets sich verengen
Der Marktstruktur-Datapoint schlägt in die Gegenrichtung aus. Q4 2026 eröffnete mit offengelegten AI-Agenten-Finanzierungsrunden von insgesamt 260M$ — angeführt von Armadins 255,5M$-Serie B (1. Oktober, a16z + Accel, Bewertung 2,5B$+), einem von Kevin Mandia gegründeten KI-nativen Cybersicherheits-Unternehmen, das „Agenten-Schwarm"-Sicherheit baut, und Instincts 1B$-Serie C (28. September, Sequoia/Benchmark/Coatue) mit einer Bewertung von 10B$ für ein ein Jahr altes Personal-AI-Assistent-Startup. Zwei Signale — eines für den Käufer, eines für den Erbauer. Für den Käufer: Agenten-Fähigkeiten konsolidieren sich in finanzierte Vendor-Kategorien — darunter die Security-Agent-Kategorie, die die Governance-Checklist dieses Artikels kartiert — was bedeutet, dass die Kaufoption Fähigkeit schneller gewinnt, als die Build-Option an Schliff gewinnt. Für den Erbauer: Die finanzierte Welle beschleunigt derselbe Pilot-Sprawl-Dynamik, die dieser Artikel diagnostiziert (mehr Tools, mehr Piloten, mehr unvermessene Ausgaben), während sie bestätigt, dass produktionsreife Agenten-Integration dort ist, wo der Markt glaubt, dass dauerhafter Wert sitzt. Die Pilot-Sprawl-Arithmetik bleibt: Der Differenzierer ist weiterhin, ob der Käufer die Integrations- und Governance-Schicht besitzt — aus welchen Vendors er sie auch zusammensetzt.
Möchten Sie dies für Ihre Systeme gebaut?
Jedes Dokument hier stammt aus echter Produktionsarbeit. Wenn Sie ein Zielsystem und einen Workflow im Sinn haben, können wir in einer Woche einen Build umreißen.
Build mit festem Umfang anfragenEinwöchiges Discovery. Sie erhalten ein Systeminventar, eine Workflow-Mappe und einen festen Umfang — unabhängig davon, ob Sie mit uns bauen.