Warum die meisten KI-Agenten-Projekte scheitern
Gartner erwartet 40 % Abbrüche bis 2027. MIT und BCG finden über zwei unabhängige Methoden hinweg dieselbe 5-%-Erfolgsquote. Was sechs aktuelle Studien wirklich zeigen, und was ich bei 30+ Gründern beobachte.
Die Schlagzeilen zu KI-Agenten schwanken zwischen zwei Extremen: "Agenten übernehmen jeden Job" auf der einen Seite, "fast alle Projekte scheitern" auf der anderen. Beides ist zu grob, um damit zu arbeiten. Deshalb habe ich sechs der aktuellsten, seriösesten Untersuchungen zum Thema nebeneinandergelegt: Gartner, MIT, S&P Global, Stanford, BCG und McKinsey. Jede Zahl habe ich bis zur Primärquelle zurückverfolgt. Auffällig ist dabei weniger eine einzelne Horrorzahl als die Konsistenz, mit der unabhängige Methoden auf dieselben zwei, drei Muster stoßen.
Was sechs unabhängige Untersuchungen zeigen
Gartner erwartet, dass über 40 % aller Agentic-AI-Projekte bis Ende 2027 abgebrochen werden, wegen steigender Kosten, unklarem Geschäftsnutzen und unzureichender Risikokontrollen. Bemerkenswert ist eine Nebenbemerkung in derselben Analyse: Von den tausenden Anbietern, die sich "Agent" nennen, hält Gartner nur rund 130 für tatsächlich agentenfähig. Der Rest ist, in Gartners eigenen Worten, "Agent Washing" — umetikettierte Chatbots und RPA-Tools.
Am tiefsten gegraben hat MIT mit dem Project-NANDA-Report "The GenAI Divide": 52 Interviews, 153 Führungskräfte-Befragungen, eine Analyse von über 300 öffentlich dokumentierten Projekten. 95 % der untersuchten Pilotprojekte zeigen keinen messbaren P&L-Effekt. Die zentrale Erkenntnis ist dabei interessanterweise nicht "die Technologie funktioniert nicht", sondern ein "Learning Gap": Es scheitert an der Integration in bestehende Arbeitsabläufe, nicht an der Modellqualität.
Ähnlich unbequem ist der Befund von S&P Global Market Intelligence, das über 1.000 Unternehmen in Nordamerika und Europa befragt hat. Der Anteil der Firmen, die den Großteil ihrer KI-Initiativen wieder einstampfen, stieg von 17 % (2024) auf 42 % (2025). Im Schnitt wird fast jeder zweite Proof-of-Concept (46 %) nie in Produktion überführt. Das Muster wird also schlechter, nicht besser, ein Gegentrend zur verbreiteten Annahme, die Branche reife sich einfach ein. Als Hauptgründe nennen die befragten Unternehmen Kosten, Datenschutz und Sicherheitsrisiken.
BCG hat für seinen Report "The Widening AI Value Gap" 1.250 Unternehmen weltweit befragt und vier Reifegrade gebildet: stagnierend, experimentierend, skalierend, "future-built". 2025 waren es 14 % stagnierend, 46 % experimentierend, 35 % skalierend. Substanziellen finanziellen Wert erzielen nur 5 % dieser Unternehmen, dafür mit 1,7-mal mehr Umsatzwachstum und 1,6-mal höheren EBIT-Margen als die restlichen 60 %. Bei Agenten speziell zeigt sich, wohin sich das Geld bewegt: Sie machen aktuell 17 % des gesamten AI-Werts aus, mit erwartetem Anstieg auf 29 % bis 2028. Zugleich berichten 72 % der Unternehmen von ungemanagten KI-Sicherheitsrisiken.
McKinseys "State of AI 2025" zeichnet aus einer anderen Perspektive ein ähnliches Bild: 88 % der Unternehmen nutzen KI regelmäßig in mindestens einer Funktion, aber nur 23 % skalieren ein Agentensystem tatsächlich über eine Funktion hinaus. 39 % experimentieren noch. Selbst dort, wo Agenten laufen, bleibt der Einsatz meist auf ein bis zwei Funktionen begrenzt.
Die technische Gegenperspektive liefert Stanford HAI im 2026 AI Index Report: Auf dem OSWorld-Benchmark, der Agenten bei allgemeinen Computeraufgaben testet, sprang die Erfolgsquote von rund 12 % (2024) auf etwa 66 % (2026). Trotzdem scheitern die Modelle weiterhin an rund jeder dritten Aufgabe. Der Report nennt das die "jagged frontier" von KI: Modelle gewinnen Mathematik-Olympiaden und scheitern an trivial wirkenden Aufgaben wie dem Ablesen einer Analoguhr. Fortschritt und Unzuverlässigkeit liegen dicht beieinander.
Der Treffer, der zweimal fällt
Was diese Zahlen besonders macht, ist eine Übereinstimmung, die zu präzise wirkt, um Zufall zu sein: MIT findet über eine Analyse von 300+ Projekten und Interviews eine Erfolgsquote von 5 %. BCG findet über eine Befragung von 1.250 Unternehmen, mit einer völlig anderen Methodik, ebenfalls 5 %. Zwei unabhängige Institutionen, zwei unterschiedliche Stichproben, zwei unterschiedliche Fragestellungen, und dieselbe Zahl. Das ist ein deutlich stärkeres Signal als jede Einzelstudie: 5 % ist damit weniger eine dramatische Schlagzeile als eine ziemlich verlässliche Schätzung der tatsächlichen Basisrate für substanziellen KI-Wert im Unternehmen, Stand 2025.
Eine zweite Übereinstimmung fällt fast beiläufig auf: Gartner nennt unzureichende Risikokontrollen als Abbruchgrund, S&P Global nennt Sicherheitsrisiken als Top-Hindernis, BCG misst 72 % ungemanagte KI-Sicherheitsrisiken. Drei unabhängige Quellen, derselbe rote Faden: Governance ist kein Nebenschauplatz, sondern einer der größten gemeinsamen Nenner unter gescheiterten Projekten.
Zwei völlig unterschiedliche Scheitern-Arten
Aus alldem ergibt sich etwas, das die meisten Ratgeber-Artikel vermischen: Es gibt zwei getrennte Ursachen für gescheiterte Agenten-Projekte, die jeweils eine andere Antwort brauchen.
Erstens eine echte, aber schrumpfende Fähigkeitsgrenze, deren Tempo Artikel 5 dieser Reihe im Detail vermisst. Stanfords OSWorld-Sprung von 12 % auf 66 % zeigt, wie dramatisch sich die Modelle in zwei Jahren verbessert haben. "TheAgentCompany", ein Benchmark von Forschenden u. a. der Carnegie Mellon University mit 175 realistischen, mehrstufigen Büroaufgaben, zeigt aber: Selbst das beste Modell (Gemini 2.5 Pro) löst nur 30,3 % davon vollständig autonom. Genau diese Diskrepanz ist der Punkt. Allgemeine Computeraufgaben werden schnell besser; lange, kontextreiche Geschäftsprozesse bleiben deutlich schwerer. Wer beides in einen Topf wirft, unterschätzt entweder den Fortschritt oder überschätzt die aktuelle Zuverlässigkeit.
Zweitens ein Organisationsproblem, das laut MIT die deutlich größere Gruppe der Fehlschläge erklärt: Projekte, bei denen die Technologie die Aufgabe könnte, aber niemand definiert hat, wie Fehler auffallen, wer eskaliert, oder wie der Agent in den tatsächlichen Arbeitsablauf eingebettet wird.
Eine Randbemerkung zur Recherche selbst
Bei der Vorbereitung dieses Artikels bin ich zweimal auf dasselbe Muster gestoßen. Ein halbes Dutzend Blogs zitiert eine Zahl wie "88 % aller Agenten-Pilotprojekte erreichen nie die Produktion" — mal 88 %, mal 89 %, mal 67 %, stets vage einer Kombination aus "Forrester und Anaconda" zugeschrieben, ohne dass sich ein konkreter Report dahinter finden lässt. Subtiler wird es, wenn mehrere derselben Blogs eine fast identische Zahl, 89 %, dem Stanford AI Index 2026 zuschreiben. Ich habe den Primärbericht direkt geprüft: Diese Zahl steht dort nicht. Was tatsächlich im Report steht, ist der OSWorld-Befund von oben.
Das ist ein Lehrstück dafür, wie sich im aktuellen KI-Hype Zahlen durch SEO-Content gegenseitig hochschaukeln, teils ganz ohne Quelle, teils durch das Ausleihen der Glaubwürdigkeit eines echten Namens für eine Zahl, die dort nie stand. Ich zitiere deshalb hier nur Zahlen, die ich bis zur Primärquelle zurückverfolgen konnte, im Fall von BCG bis in den PDF-Volltext des Originalreports hinein. Der Rest fliegt raus, so eingängig er auch klingt.
Was das für Gründer und kleine Teams bedeutet
Gartner, MIT, S&P Global, BCG und McKinsey befragen überwiegend große Unternehmen. In den über 30 Projekten, die ich mit Gründern und Unternehmern begleitet habe, sehe ich dieselben Muster, nur kompakter, weil bei kleinen Teams Ursache und Wirkung schneller sichtbar werden:
- Scope zu breit. Genau das MIT/BCG-Muster im Kleinen: Projekte, die "den gesamten Kundensupport" oder "alle Angebote" automatisieren sollen, scheitern fast immer zuerst an der Organisationsfrage, bevor die Modellfrage überhaupt relevant wird. Was stattdessen funktioniert: eine einzige, eng umrissene Aufgabe, deren Ergebnis ein Mensch in unter einer Minute bewerten kann.
- Kein Prozess, der Fehler sichtbar macht. Ohne Eskalationsschwelle, Stichproben-Review und einen niedrigschwelligen Melde-Kanal läuft jeder Agent irgendwann unbemerkt aus dem Ruder. Nicht weil das Modell schlechter wird, sondern weil sich die Realität ändert und niemand es merkt, bevor es teuer wird. Es ist dieselbe Governance-Lücke, die Gartner, S&P Global und BCG unabhängig voneinander als Top-Risiko nennen. Bei einem Fünf-Personen-Team braucht sie nur keinen Namen wie "unmanaged AI-security risk", um wehzutun.
- Die Fähigkeitsgrenze wird ignoriert. Manche Aufgaben liegen jenseits dessen, was aktuelle Modelle zuverlässig autonom lösen, siehe die 30-%-Marke von TheAgentCompany oben. Besseres Prompt-Engineering hilft hier nicht. Was hilft, ist die bewusste Entscheidung, den Menschen im Loop zu behalten, statt auf volle Autonomie hinzuarbeiten.
Was stattdessen funktioniert
Die Muster aus MIT, BCG und meiner eigenen Erfahrung decken sich: klein anfangen, Fehler sichtbar machen, die Fähigkeitsgrenze ehrlich einschätzen, und erst skalieren, wenn die erste Aufgabe zuverlässig läuft. Das ist weniger spektakulär als die große Vision auf der ersten Pitch-Deck-Folie. Es ist aber der Unterschied zwischen einem Agenten, der nach drei Monaten noch läuft, und einem, der Teil der 60 % wird, die laut BCG kaum messbaren Wert erzeugen.
Quellen:
Analysten & Marktforschung
- Gartner: Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027 (Juni 2025)
- S&P Global Market Intelligence: Generative AI shows rapid growth but yields mixed results (2025)
Konsultingfirmen
- BCG: The Widening AI Value Gap — Build for the Future 2025 (n = 1.250 Unternehmen weltweit, September 2025)
- McKinsey: The state of AI in 2025: Agents, innovation, and transformation
Forschung
- MIT NANDA: "The GenAI Divide — State of AI in Business 2025", zitiert nach Fortune (August 2025)
- Stanford HAI: The 2026 AI Index Report
- Carnegie Mellon University u. a.: TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks
Direkter Anschluss