Wo Enterprise-KI tatsächlich etwas bringt: Ein Stahlhersteller und eine Fluggesellschaft

Diesen Monat sind zwei Fallstudien erschienen, und zusammen sagen sie mehr über Enterprise-KI als ein Jahr voller Anbieter-Keynotes. Eine handelt von einem Stahlhersteller, der Hunderte spezialisierte Agenten eingesetzt hat. Die andere von einer Fluggesellschaft, die die Vertragsprüfungszeit halbiert hat. In keiner der beiden ging es um einen Allzweck-Assistenten, der in einer Seitenleiste Fragen beantwortet.
Dreihundert Agenten in einem Stahlwerk
Tata Steel hat laut Google Cloud in neun Monaten mehr als 300 spezialisierte KI-Agenten eingesetzt. Sie kümmern sich um Anlagenwartung, Informationszugriff und schnellere Kundenreaktionen. Das entscheidende Wort in diesem Satz ist „spezialisiert“. Es war nicht ein Agent mit einem breiten Auftrag. Es waren dreihundert eng gefasste Agenten, jeder an eine konkrete operative Aufgabe gebunden.
Das ist eine andere Architektur als die, die die meisten Anbieter verkaufen. Ein allgemeiner Agent, der alles kann, lässt sich leicht demonstrieren und ist schwer zu vertrauen. Eine Flotte von Agenten, die jeweils nur eine Sache tun, ist mühsam zu bauen und viel leichter zu steuern, weil der Umfang durch die Aufgabe definiert ist. Wenn einer aus der Reihe tanzt, weiß man, zu welchem Prozess er gehört und worauf er hätte zugreifen dürfen.
Der Wartungsaspekt ist für sich genommen erwähnenswert. Anlagenwartung ist der Bereich, in dem industrielle KI den klarsten Nutzen bringt, weil die Daten bereits vorliegen, die Ausfallarten teuer sind und eine zehnprozentige Verbesserung der Verfügbarkeit sich in Geld messen lässt. Es ist wenig glamouröse Arbeit, und genau die Art von Arbeit, die eine Budgetprüfung übersteht.
Eine Vertragsprüfung, die von Tagen auf Stunden schrumpfte
Cebu Pacific berichtete, dass die Einführung von ChatGPT Enterprise die juristische Vertragsprüfungszeit um etwa die Hälfte verkürzte. Die Durchlaufzeit für Projektanfragen sank von fünf Tagen auf etwa einen, und technische Referenzsuchen gingen von zehn bis fünfzehn Minuten auf unter zehn Sekunden zurück. In einer Nutzerumfrage gaben 86 Prozent an, KI unterstütze mehr als ein Drittel ihrer täglichen Arbeit.
Die Vertragszahl ist die, bei der man verweilen sollte. Juristische Prüfung ist eine Aufgabe mit echtem Risiko, definiertem Input und klarem Output. Sie ist außerdem eine Aufgabe, bei der der Engpass das Lesen ist, und Lesen ist etwas, worin Sprachmodelle wirklich gut sind. Die Fluggesellschaft hat nicht den Anwalt automatisiert. Sie hat den Teil der Arbeit entfernt, bei dem eine Person ein Dokument nach Klauseln durchsucht, die sie schon hundertmal gesehen hat. Das ist eine Workflow-Änderung, kein Tool-Kauf.
Das Muster dahinter
Keine der beiden Fallstudien handelt von einem Modell, das besser als ein Mensch denken kann. Beide handeln von Modellen, die an einer bestimmten Stelle in einen definierten Prozess eingefügt werden, wo sich Vorher und Nachher messen lassen. Tata Steel weiß, welche Wartungsentscheidungen schneller geworden sind. Cebu Pacific weiß, wie viele Tage der Anfrageprozess früher gedauert hat.
Die Zahl, die Anbieter beunruhigen sollte, steckt in den Umfragedaten. Der Enterprise-KI-Reifegradindex von Singapur bezifferte die Einführung agentischer KI auf 51 Prozent, gegenüber 22 Prozent im Vorjahr, während nur 10 Prozent der Unternehmen Ende-zu-Ende-Workflows darum herum neu gestaltet hatten. Eine Capgemini-Studie fand ähnliche Lücken, wobei die meisten Organisationen sich noch in Erkundung oder Pilotprojekten befanden.
Der Markt ist also voll von Unternehmen, die KI an einen Workflow angebunden haben, ohne den Workflow zu ändern. Sie haben ein Modell an den alten Prozess geschraubt und es Transformation genannt. Die beiden hiesigen Fallstudien haben das andere getan, und deshalb haben sie Zahlen geliefert, über die es sich zu berichten lohnt.
Spezialisierung macht die Agenten steuerbar
Es gibt einen Governance-Grund, eine Flotte enger Agenten einem einzigen breiten vorzuziehen, und das lohnt sich auszuführen. Ein Agent mit festem Umfang lässt sich leicht prüfen. Man weiß, worauf er zugreifen können sollte, man kann protokollieren, worauf er tatsächlich zugegriffen hat, und die Differenz dazwischen ist eine kurze Liste. Ein Agent mit breitem Auftrag hat einen Umfang, der sich mit jeder Aufgabe ändert, was dieselbe Prüfung zu einem Forschungsprojekt macht.
Tata Steels 300 Agenten sind genau auf diese Weise spezialisiert. Diese Entscheidung zahlt sich doppelt aus. Sie ist einfacheres Engineering, und sie macht den Einsatz vertretbar für die Leute, die ihn absegnen müssen. Jeder Agent lässt sich für sich betrachten, und ein Fehler in einem erfordert nicht, die anderen 299 neu zu prüfen.
Dasselbe Prinzip erklärt, warum so viele Enterprise-Agentenprogramme ins Stocken geraten. Ein Allzweck-Agent zeigt in einer Demo Potenzial, wird gegen einen breiten Arbeitsausschnitt pilotiert und stößt dann auf die Tatsache, dass niemand beschreiben kann, wie korrektes Verhalten über diesen ganzen Ausschnitt aussieht. Den Umfang zu verengen fühlt sich wie ein Rückschritt an und ist meist der Schritt, der das Projekt überlebensfähig macht.
Die versteckte Anforderung: eine Vergleichsbasis
Beide Fallstudien liefern Zahlen, und das ist kein Zufall. Um einen zehnprozentigen Verfügbarkeitsgewinn oder einen Rückgang von fünf Tagen auf einen zu messen, braucht man ein Vorher. Organisationen, die die Vergleichsbasis überspringen, enden mit Anekdoten statt Ergebnissen, weshalb so viele KI-Programme Begeisterung berichten und sich schwertun, Wirkung zu berichten.
Die Disziplin beginnt vor dem Einsatz. Wählen Sie den Prozess, halten Sie fest, wie lange er heute dauert und was er kostet, ändern Sie dann einen Schritt und messen Sie erneut. Das klingt bürokratisch und ist der Unterschied zwischen einem Programm, das sein Budget verteidigen kann, und einem, das es nicht kann. Cebu Pacific kann sagen, dass sich seine Vertragsprüfungszeit halbiert hat, weil jemand aufgeschrieben hat, wie sie früher war.
Es gibt eine zweite Messung, die ebenso wichtig ist und seltener vorgenommen wird: die Fehlerquote. Ein Agent, der die Zeit halbiert und die Fehler verdoppelt, hat nichts verbessert, sondern die Kosten vom Anfang des Prozesses an sein Ende verlagert. Die Fallstudien, die Bestand haben, sind die, bei denen ein Mensch die Ausgabe weiterhin an der Stelle prüft, an der ein Fehler teuer wäre, und der gemessene Gewinn daraus kommt, dass das Lesen entfällt, nicht das Prüfen.
Was die Lücke für das nächste Jahr bedeutet
Die Organisationen, die Ergebnisse sehen, sind die, die einen Prozess ausgewählt, ihn gemessen und ihn um das herum neu aufgebaut haben, worin das Modell tatsächlich gut ist. Die, die in Pilotprojekten feststecken, sind die, die Zugang gekauft und darauf gewartet haben, dass Adoption von selbst passiert. Der Zugang war nie der schwierige Teil. Das Redesign ist es.
Der Stahlhersteller und die Fluggesellschaft teilen außerdem ein Merkmal, das leicht übersehen wird. Beide haben Menschen an den Entscheidungspunkten belassen, die Haftung tragen. Der Wartungsagent markiert, ein Mensch entscheidet. Der Vertragsagent entwirft und hebt hervor, ein Anwalt genehmigt. Die KI hat das Scannen entfernt, nicht das Urteilsvermögen.
Diese Arbeitsteilung ist im Rückblick unspektakulär. Sie ist auch das, was ein KI-Programm, das eine Zahl hervorbringt, von einem trennt, das eine Folie hervorbringt. Wählen Sie den Prozess, finden Sie den Schritt, in dem ein Mensch Informationen liest oder bewegt, automatisieren Sie diesen Schritt und messen Sie, was sich geändert hat. Das Rezept ist einfach. Es umzusetzen ist schwieriger als einen Sitz zu kaufen, weshalb so viele Organisationen den Sitz kaufen und es Strategie nennen.
Verwandte Artikel
Ein Halbhumanoid auf Rädern erledigte eine Stunde Wäsche ohne Hilfe
Einzelne Aufgaben können erfolgreich sein, während ein Workflow trotzdem scheitert. Dyna hat die Kennzahl geändert.
LTX 2.5 will deinen blockigen Blender-Entwurf in eine fertige Einstellung verwandeln
Du hast keine Kontrolle darüber, was im Text-zu-Video passiert. Das hier versucht, das zu beheben.
ServiceNow macht aus Agenten-Fehlern Trainingsdaten
Generierung ohne Verifikation ist Rauschen. Die Gates sind das Produkt.
Ein Framework für Sprache und Vision: Horizons offenes 1,6-Milliarden-Modell
Eine Wette darauf, dass die Brücken zwischen Sprache und Vision nie nötig waren.