Wie man den ROI von KI-Agenten wirklich misst
56 % der CEOs sehen laut PwC weder mehr Umsatz noch weniger Kosten durch KI. Der Grund ist meist nicht fehlender Wert, sondern die falsche Metrik. Ein Framework, das mit dem Finance-Blick auf das Problem funktioniert.
Im letzten Artikel ging es um die Frage, warum die meisten KI-Agenten-Projekte scheitern. Die naheliegende nächste Frage: Woran misst man das eigentlich? Wer als CFO oder Gründer beurteilen will, ob ein Agent funktioniert, braucht mehr als das Bauchgefühl "fühlt sich produktiver an". Und genau hier zeigt sich, wenn man die aktuellen Umfragen liest, ein eigenständiges Problem, unabhängig davon, ob der Agent selbst gut funktioniert.
Die Zahl, die man zweimal lesen muss
PwC hat für seinen 29th Global CEO Survey 4.454 CEOs in 95 Ländern befragt (veröffentlicht im Januar 2026 in Davos). 56 % berichten weder von mehr Umsatz noch von weniger Kosten durch KI im letzten Jahr. Auf den ersten Blick liest sich das wie eine Bestätigung von "KI bringt nichts". Der zweite Blick zeigt etwas anderes: 30 % der CEOs berichten sehr wohl von Umsatzsteigerungen, 26 % von Kostensenkungen, nur eben selten dieselben Unternehmen gleichzeitig. Nur 12 % schaffen beides. PwC nennt diese Gruppe die "Vanguard", und sie unterscheidet sich nicht durch bessere Modelle, sondern durch definierte Roadmaps und eine Technologie-Umgebung, die für Integration gebaut ist.
Das ist die erste Auffälligkeit: KI ist bei diesen 56 % der Unternehmen nicht wertlos. Wert und Kostenersparnis fallen einfach in unterschiedlichen Abteilungen unterschiedlich an, und kaum jemand trackt beides gemeinsam.
Die Metrik, die tatsächlich gemessen wird
Eine von Appian gesponserte, aber redaktionell von Harvard Business Review Analytic Services durchgeführte Befragung von 385 Entscheidern (Frühjahr 2026) liefert die Erklärung dazu. 59 % der Organisationen haben KI bereits in Produktion. Schaut man sich aber an, was tatsächlich gemessen wird, kippt das Bild: 64 % tracken Produktivitätsgewinne, 58 % operative Effizienz, aber nur 30 % neue Umsatzquellen und nur 35 % ROI. (Wichtiger Hinweis zur Einordnung: Die Studie wurde von Appian, einem Automatisierungs-Anbieter, in Auftrag gegeben. Das schmälert nicht zwangsläufig die Zahlen, ist aber bei einer gesponserten Erhebung immer erwähnenswert.)
Die meisten Unternehmen messen also genau die Metriken, die sich am leichtesten positiv darstellen lassen ("fühlt sich produktiver an"), und meiden die Metriken, die tatsächlich zeigen würden, ob sich die Investition gelohnt hat.
Der Denkfehler, den Gartner beim Namen nennt
Die vielleicht schärfste Diagnose kommt von Gartner. Twisha Sharma, Senior Principal Research in der Gartner-Finance-Praxis, bringt es in einer aktuellen Analyse so auf den Punkt: "AI does not follow one cost curve, and it does not produce one uniform type of value. CFOs need to stop looking for a single ROI formula and instead build a balanced portfolio that includes productivity use cases, targeted process improvements, and selective transformational bets." — Gartner Says CFOs Need to Rethink the ROI of AI Investments
Ein Kundensupport-Agent, der Anfragen vorsortiert, ein Analyse-Agent, der Entscheidungsgrundlagen aufbereitet, und ein Agent, der komplett neue Produktfunktionen ermöglicht: Das sind drei unterschiedliche Wettarten mit drei unterschiedlichen Zeithorizonten und drei unterschiedlichen Erfolgsmaßstäben. Sie alle mit derselben ROI-Formel zu messen, unterschätzt systematisch die einen und überschätzt die anderen. Passend dazu zeigt eine weitere aktuelle Gartner-Erhebung unter 204 Finance-Verantwortlichen: 45 % der KI-Investitionen im Finance-Bereich zielen auf Produktivität, nur 20 % auf bessere Entscheidungsqualität. Ein weiterer Beleg dafür, dass die meisten Unternehmen im "leicht messbaren" Bereich hängen bleiben, statt dorthin zu investieren, wo der eigentliche Hebel liegt.
Die Verbindung zum letzten Artikel
Hier schließt sich der Kreis zum vorherigen Artikel: MIT und BCG fanden dort unabhängig voneinander dieselbe 5-%-Erfolgsquote für substanziellen KI-Wert im Unternehmen. Beide Studien zeigen dabei noch etwas: Die erfolgreichen 5 % zeichnen sich nicht durch bessere Modelle aus, sondern durch eng umrissene, in echte Workflows eingebettete Anwendungsfälle. Messdisziplin und enger Scope sind zwei Seiten derselben Medaille. Wer von Anfang an eine einzige, klar definierte Kennzahl an eine einzige, eng umrissene Aufgabe koppelt, merkt fast zwangsläufig früh, ob der Agent trägt. Wer breit startet und "Produktivität" misst, kann Monate investieren, ohne je zu wissen, ob es sich gelohnt hat.
Ein Framework, das mit dem Finance-Blick funktioniert
Aus meiner Erfahrung mit über 30 Gründern und aus der Forschung oben lässt sich ein einfaches Prinzip ableiten, bewusst kein 7-Punkte-Rahmenwerk, sondern drei Fragen, die vor dem ersten Prompt beantwortet sein sollten:
- Welche Wettart ist das? Routine-Automatisierung (harte Kosten-/Zeitersparnis, in Wochen messbar), Prozessverbesserung (Qualität/Fehlerquote, in Monaten messbar) oder Transformations-Wette (neue Umsatzquelle oder Fähigkeit, erst in Quartalen sichtbar)? Jede braucht ihre eigene Metrik, Gartners Kernpunkt von oben, nur eine Ebene tiefer heruntergebrochen.
- Welche eine Zahl entscheidet, ob es funktioniert hat? Nicht drei, nicht "gefühlte Produktivität", sondern eine konkrete, mit einer P&L-Zeile verknüpfte Zahl (Kosten pro Vorgang, Stunden pro Woche, Conversion-Rate), die vor dem Start festgelegt wird. Genau der Punkt, an dem laut HBR/Appian-Daten die meisten Unternehmen ausweichen.
- Wer entscheidet, wann "gescheitert" gilt? Ohne vorher festgelegte Abbruchkriterien läuft ein Projekt meist so lange weiter, bis das "Gefühl" kippt, Monate nachdem die Zahlen es längst gezeigt hätten.
Das klingt weniger aufregend als "wir bauen einen KI-Agenten für X". Es ist aber der Unterschied zwischen einem Projekt, das nach einem Quartal eine klare Antwort liefert, ja oder nein, und einem, das einfach weiterläuft, weil niemand definiert hat, wie ein Nein aussehen würde.
Quellen:
Analysten
- Gartner: Gartner Says CFOs Need to Rethink the ROI of AI Investments (März 2026)
- Gartner: Gartner Survey Shows 45% of CFOs Say Their AI Investments Lean Toward Productivity, While 20% Say These Investments Lean Toward Decision Quality (Juli 2026, n = 204 Finance-Verantwortliche)
Wirtschaftsprüfung & Beratung
- PwC: 29th Global CEO Survey (n = 4.454 CEOs in 95 Ländern, Januar 2026)
Forschung (gesponsert — siehe Hinweis im Text)
- Harvard Business Review Analytic Services, gesponsert von Appian: zitiert nach Appian-Pressemitteilung (n = 385 Entscheider, 2026)
Direkter Anschluss
- Warum die meisten KI-Agenten-Projekte scheitern — der vorherige Artikel in dieser Reihe
- Was ein KI-Agent wirklich kostet — der nächste Artikel in dieser Reihe