Zum Hauptinhalt springen
Laden …
AS Albert Schaper
  • 01Home
  • 02Über mich
  • 03Expertise
  • 04Projekte
  • 05Kontakt
  • 06Insights
  • 07Tools
AS

Albert Schaper

01Home 02Über mich 03Expertise 04Projekte 05Kontakt 06Insights 07Tools

KI · Finance · Entrepreneur

Home / Insights / Warum die meisten KI-Agenten-Projekte scheitern
Insights

Warum die meisten KI-Agenten-Projekte scheitern

Gartner erwartet 40 % Abbrüche bis 2027. MIT und BCG finden über zwei unabhängige Methoden hinweg dieselbe 5-%-Erfolgsquote. Was sechs aktuelle Studien wirklich zeigen, und was ich bei 30+ Gründern beobachte.

3. September 2026 · 7 Min. Lesezeit KI-AgentenEntrepreneurship Auf Englisch lesen Auf LinkedIn teilenAuf X teilen
Inhalt
  • Was sechs unabhängige Untersuchungen zeigen
  • Der Treffer, der zweimal fällt
  • Zwei völlig unterschiedliche Scheitern-Arten
  • Eine Randbemerkung zur Recherche selbst
  • Was das für Gründer und kleine Teams bedeutet
  • Was stattdessen funktioniert

Die Schlagzeilen zu KI-Agenten schwanken zwischen zwei Extremen: "Agenten übernehmen jeden Job" auf der einen Seite, "fast alle Projekte scheitern" auf der anderen. Beides ist zu grob, um damit zu arbeiten. Deshalb habe ich sechs der aktuellsten, seriösesten Untersuchungen zum Thema nebeneinandergelegt: Gartner, MIT, S&P Global, Stanford, BCG und McKinsey. Jede Zahl habe ich bis zur Primärquelle zurückverfolgt. Auffällig ist dabei weniger eine einzelne Horrorzahl als die Konsistenz, mit der unabhängige Methoden auf dieselben zwei, drei Muster stoßen.

Was sechs unabhängige Untersuchungen zeigen

Gartner erwartet, dass über 40 % aller Agentic-AI-Projekte bis Ende 2027 abgebrochen werden, wegen steigender Kosten, unklarem Geschäftsnutzen und unzureichender Risikokontrollen. Bemerkenswert ist eine Nebenbemerkung in derselben Analyse: Von den tausenden Anbietern, die sich "Agent" nennen, hält Gartner nur rund 130 für tatsächlich agentenfähig. Der Rest ist, in Gartners eigenen Worten, "Agent Washing" — umetikettierte Chatbots und RPA-Tools.

Am tiefsten gegraben hat MIT mit dem Project-NANDA-Report "The GenAI Divide": 52 Interviews, 153 Führungskräfte-Befragungen, eine Analyse von über 300 öffentlich dokumentierten Projekten. 95 % der untersuchten Pilotprojekte zeigen keinen messbaren P&L-Effekt. Die zentrale Erkenntnis ist dabei interessanterweise nicht "die Technologie funktioniert nicht", sondern ein "Learning Gap": Es scheitert an der Integration in bestehende Arbeitsabläufe, nicht an der Modellqualität.

Ähnlich unbequem ist der Befund von S&P Global Market Intelligence, das über 1.000 Unternehmen in Nordamerika und Europa befragt hat. Der Anteil der Firmen, die den Großteil ihrer KI-Initiativen wieder einstampfen, stieg von 17 % (2024) auf 42 % (2025). Im Schnitt wird fast jeder zweite Proof-of-Concept (46 %) nie in Produktion überführt. Das Muster wird also schlechter, nicht besser, ein Gegentrend zur verbreiteten Annahme, die Branche reife sich einfach ein. Als Hauptgründe nennen die befragten Unternehmen Kosten, Datenschutz und Sicherheitsrisiken.

BCG hat für seinen Report "The Widening AI Value Gap" 1.250 Unternehmen weltweit befragt und vier Reifegrade gebildet: stagnierend, experimentierend, skalierend, "future-built". 2025 waren es 14 % stagnierend, 46 % experimentierend, 35 % skalierend. Substanziellen finanziellen Wert erzielen nur 5 % dieser Unternehmen, dafür mit 1,7-mal mehr Umsatzwachstum und 1,6-mal höheren EBIT-Margen als die restlichen 60 %. Bei Agenten speziell zeigt sich, wohin sich das Geld bewegt: Sie machen aktuell 17 % des gesamten AI-Werts aus, mit erwartetem Anstieg auf 29 % bis 2028. Zugleich berichten 72 % der Unternehmen von ungemanagten KI-Sicherheitsrisiken.

McKinseys "State of AI 2025" zeichnet aus einer anderen Perspektive ein ähnliches Bild: 88 % der Unternehmen nutzen KI regelmäßig in mindestens einer Funktion, aber nur 23 % skalieren ein Agentensystem tatsächlich über eine Funktion hinaus. 39 % experimentieren noch. Selbst dort, wo Agenten laufen, bleibt der Einsatz meist auf ein bis zwei Funktionen begrenzt.

Die technische Gegenperspektive liefert Stanford HAI im 2026 AI Index Report: Auf dem OSWorld-Benchmark, der Agenten bei allgemeinen Computeraufgaben testet, sprang die Erfolgsquote von rund 12 % (2024) auf etwa 66 % (2026). Trotzdem scheitern die Modelle weiterhin an rund jeder dritten Aufgabe. Der Report nennt das die "jagged frontier" von KI: Modelle gewinnen Mathematik-Olympiaden und scheitern an trivial wirkenden Aufgaben wie dem Ablesen einer Analoguhr. Fortschritt und Unzuverlässigkeit liegen dicht beieinander.

Der Treffer, der zweimal fällt

Was diese Zahlen besonders macht, ist eine Übereinstimmung, die zu präzise wirkt, um Zufall zu sein: MIT findet über eine Analyse von 300+ Projekten und Interviews eine Erfolgsquote von 5 %. BCG findet über eine Befragung von 1.250 Unternehmen, mit einer völlig anderen Methodik, ebenfalls 5 %. Zwei unabhängige Institutionen, zwei unterschiedliche Stichproben, zwei unterschiedliche Fragestellungen, und dieselbe Zahl. Das ist ein deutlich stärkeres Signal als jede Einzelstudie: 5 % ist damit weniger eine dramatische Schlagzeile als eine ziemlich verlässliche Schätzung der tatsächlichen Basisrate für substanziellen KI-Wert im Unternehmen, Stand 2025.

Eine zweite Übereinstimmung fällt fast beiläufig auf: Gartner nennt unzureichende Risikokontrollen als Abbruchgrund, S&P Global nennt Sicherheitsrisiken als Top-Hindernis, BCG misst 72 % ungemanagte KI-Sicherheitsrisiken. Drei unabhängige Quellen, derselbe rote Faden: Governance ist kein Nebenschauplatz, sondern einer der größten gemeinsamen Nenner unter gescheiterten Projekten.

Zwei völlig unterschiedliche Scheitern-Arten

Aus alldem ergibt sich etwas, das die meisten Ratgeber-Artikel vermischen: Es gibt zwei getrennte Ursachen für gescheiterte Agenten-Projekte, die jeweils eine andere Antwort brauchen.

Erstens eine echte, aber schrumpfende Fähigkeitsgrenze, deren Tempo Artikel 5 dieser Reihe im Detail vermisst. Stanfords OSWorld-Sprung von 12 % auf 66 % zeigt, wie dramatisch sich die Modelle in zwei Jahren verbessert haben. "TheAgentCompany", ein Benchmark von Forschenden u. a. der Carnegie Mellon University mit 175 realistischen, mehrstufigen Büroaufgaben, zeigt aber: Selbst das beste Modell (Gemini 2.5 Pro) löst nur 30,3 % davon vollständig autonom. Genau diese Diskrepanz ist der Punkt. Allgemeine Computeraufgaben werden schnell besser; lange, kontextreiche Geschäftsprozesse bleiben deutlich schwerer. Wer beides in einen Topf wirft, unterschätzt entweder den Fortschritt oder überschätzt die aktuelle Zuverlässigkeit.

Zweitens ein Organisationsproblem, das laut MIT die deutlich größere Gruppe der Fehlschläge erklärt: Projekte, bei denen die Technologie die Aufgabe könnte, aber niemand definiert hat, wie Fehler auffallen, wer eskaliert, oder wie der Agent in den tatsächlichen Arbeitsablauf eingebettet wird.

Eine Randbemerkung zur Recherche selbst

Bei der Vorbereitung dieses Artikels bin ich zweimal auf dasselbe Muster gestoßen. Ein halbes Dutzend Blogs zitiert eine Zahl wie "88 % aller Agenten-Pilotprojekte erreichen nie die Produktion" — mal 88 %, mal 89 %, mal 67 %, stets vage einer Kombination aus "Forrester und Anaconda" zugeschrieben, ohne dass sich ein konkreter Report dahinter finden lässt. Subtiler wird es, wenn mehrere derselben Blogs eine fast identische Zahl, 89 %, dem Stanford AI Index 2026 zuschreiben. Ich habe den Primärbericht direkt geprüft: Diese Zahl steht dort nicht. Was tatsächlich im Report steht, ist der OSWorld-Befund von oben.

Das ist ein Lehrstück dafür, wie sich im aktuellen KI-Hype Zahlen durch SEO-Content gegenseitig hochschaukeln, teils ganz ohne Quelle, teils durch das Ausleihen der Glaubwürdigkeit eines echten Namens für eine Zahl, die dort nie stand. Ich zitiere deshalb hier nur Zahlen, die ich bis zur Primärquelle zurückverfolgen konnte, im Fall von BCG bis in den PDF-Volltext des Originalreports hinein. Der Rest fliegt raus, so eingängig er auch klingt.

Was das für Gründer und kleine Teams bedeutet

Gartner, MIT, S&P Global, BCG und McKinsey befragen überwiegend große Unternehmen. In den über 30 Projekten, die ich mit Gründern und Unternehmern begleitet habe, sehe ich dieselben Muster, nur kompakter, weil bei kleinen Teams Ursache und Wirkung schneller sichtbar werden:

  • Scope zu breit. Genau das MIT/BCG-Muster im Kleinen: Projekte, die "den gesamten Kundensupport" oder "alle Angebote" automatisieren sollen, scheitern fast immer zuerst an der Organisationsfrage, bevor die Modellfrage überhaupt relevant wird. Was stattdessen funktioniert: eine einzige, eng umrissene Aufgabe, deren Ergebnis ein Mensch in unter einer Minute bewerten kann.
  • Kein Prozess, der Fehler sichtbar macht. Ohne Eskalationsschwelle, Stichproben-Review und einen niedrigschwelligen Melde-Kanal läuft jeder Agent irgendwann unbemerkt aus dem Ruder. Nicht weil das Modell schlechter wird, sondern weil sich die Realität ändert und niemand es merkt, bevor es teuer wird. Es ist dieselbe Governance-Lücke, die Gartner, S&P Global und BCG unabhängig voneinander als Top-Risiko nennen. Bei einem Fünf-Personen-Team braucht sie nur keinen Namen wie "unmanaged AI-security risk", um wehzutun.
  • Die Fähigkeitsgrenze wird ignoriert. Manche Aufgaben liegen jenseits dessen, was aktuelle Modelle zuverlässig autonom lösen, siehe die 30-%-Marke von TheAgentCompany oben. Besseres Prompt-Engineering hilft hier nicht. Was hilft, ist die bewusste Entscheidung, den Menschen im Loop zu behalten, statt auf volle Autonomie hinzuarbeiten.

Was stattdessen funktioniert

Die Muster aus MIT, BCG und meiner eigenen Erfahrung decken sich: klein anfangen, Fehler sichtbar machen, die Fähigkeitsgrenze ehrlich einschätzen, und erst skalieren, wenn die erste Aufgabe zuverlässig läuft. Das ist weniger spektakulär als die große Vision auf der ersten Pitch-Deck-Folie. Es ist aber der Unterschied zwischen einem Agenten, der nach drei Monaten noch läuft, und einem, der Teil der 60 % wird, die laut BCG kaum messbaren Wert erzeugen.


Quellen:

Analysten & Marktforschung

  • Gartner: Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027 (Juni 2025)
  • S&P Global Market Intelligence: Generative AI shows rapid growth but yields mixed results (2025)

Konsultingfirmen

  • BCG: The Widening AI Value Gap — Build for the Future 2025 (n = 1.250 Unternehmen weltweit, September 2025)
  • McKinsey: The state of AI in 2025: Agents, innovation, and transformation

Forschung

  • MIT NANDA: "The GenAI Divide — State of AI in Business 2025", zitiert nach Fortune (August 2025)
  • Stanford HAI: The 2026 AI Index Report
  • Carnegie Mellon University u. a.: TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks

Direkter Anschluss

  • Wie man den ROI von KI-Agenten wirklich misst
  • Was an der KI-Singularität wirklich dran ist
  • Was wirklich passiert, wenn KI-Agenten selbst bezahlen
Weitere Insights
  • KI-Agenten

    Wie ein KI-Agent wirklich an sein eigenes Wallet kommt

    Ein Angreifer schenkte einem KI-Agenten im Mai 2026 eine NFT — und bekam damit Vollmacht über sein Wallet. Die Diebstahlanweisung versteckte er als Morsecode. Wie Wallets für autonome Agenten heute wirklich abgesichert werden, und warum die Berechtigung selbst zur Schwachstelle wird.

  • KI-Agenten

    Was wirklich passiert, wenn KI-Agenten selbst bezahlen

    Fünf konkurrierende Zahlungsprotokolle für KI-Agenten sind seit Mai 2025 gestartet. Coinbase feiert 205 Millionen x402-Transaktionen, das tatsächliche Abwicklungsvolumen ist seit Jahresbeginn um 93 % eingebrochen. Was hinter dem Hype tatsächlich Substanz hat, und was als Nächstes kommt.

  • KI-Industrie

    Warum der Altman-Musk-Streit die KI-Branche noch zehn Jahre prägen wird

    Im Mai 2026 brauchte die Jury keine zwei Stunden, um Musks Klage gegen OpenAI abzuweisen, wegen einer Frist, nicht wegen der Sache selbst. Der Rechtsstreit ist vorbei, die eigentliche Machtfrage nicht. Eine Analyse der einzigen Seite des Konflikts, die in zehn Jahren noch zählt.

Albert Schaper
Über den Autor

KI-Experte, Entrepreneur und Gründer — mit Finance-Background und Fokus auf Umsetzung. Ich baue Unternehmen auf, beteilige mich an Ventures und berate Teams beim Einsatz von KI. LinkedIn

← Alle Insights
AS

KI · Finance · Entrepreneur

Navigation

Home Über mich Expertise Projekte Kontakt Insights Tools

Projekte

Best-AI.org BitAutor Geld 2.0 ASCANUS Health

© Albert Schaper. Alle Rechte vorbehalten.

Datenschutz / Impressum