Dove l'AI aziendale dà davvero risultati: un'acciaieria e una compagnia aerea

Questo mese sono arrivati due casi di studio che, insieme, dicono più sull'AI aziendale di un anno di keynote dei fornitori. Uno riguarda un'acciaieria che ha implementato centinaia di agenti specializzati. L'altro una compagnia aerea che ha dimezzato i tempi di revisione dei contratti. In nessuno dei due c'era un assistente generico che rispondeva a domande in una barra laterale.
Trecento agenti in un'acciaieria
Secondo Google Cloud, Tata Steel ha implementato più di 300 agenti AI specializzati in nove mesi. Si occupano di manutenzione degli asset, accesso alle informazioni e risposte più rapide ai clienti. La parola che fa il lavoro in questa frase è "specializzati". Non era un unico agente a cui era stato dato un mandato ampio. Erano trecento agenti ristretti, ciascuno legato a uno specifico compito operativo.
È un'architettura diversa da quella che vendono la maggior parte dei fornitori. Un agente generico in grado di fare qualsiasi cosa è facile da mostrare in una demo e difficile da rendere affidabile. Una flotta di agenti che fanno ognuno una sola cosa è noiosa da costruire e molto più facile da governare, perché l'ambito è definito dal compito. Quando uno di loro si comporta male, sai a quale processo appartiene e a cosa avrebbe dovuto poter accedere.
L'aspetto della manutenzione merita una nota a parte. La manutenzione degli asset è dove l'AI industriale offre il ritorno più chiaro, perché i dati ci sono già, le modalità di guasto sono costose e un miglioramento del dieci percento del tempo di attività è misurabile in denaro. È un lavoro poco glamour, ed è esattamente il tipo di lavoro che sopravvive a una revisione di budget.
Una revisione contrattuale passata da giorni a ore
Cebu Pacific ha riferito che il rollout di ChatGPT Enterprise ha ridotto di circa la metà i tempi di revisione dei contratti legali. I tempi di intake dei progetti sono scesi da cinque giorni a circa uno, e le ricerche di riferimento ingegneristiche sono passate da dieci-quindici minuti a meno di dieci secondi. In un sondaggio tra gli utenti, l'86 percento ha dichiarato che l'AI supportava più di un terzo del proprio lavoro quotidiano.
Il dato sui contratti è quello su cui soffermarsi. La revisione legale è un compito con posta in gioco reale, un input definito e un output chiaro. È anche un compito in cui il collo di bottiglia è la lettura, e la lettura è qualcosa in cui i modelli linguistici sono davvero bravi. La compagnia aerea non ha automatizzato l'avvocato. Ha rimosso la parte del lavoro in cui una persona scorre un documento cercando clausole che ha visto cento volte. Questo è un cambiamento di flusso di lavoro, non l'acquisto di uno strumento.
Lo schema che sta alla base di entrambi
Nessuno dei due casi di studio riguarda un modello in grado di ragionare meglio di un essere umano. Entrambi riguardano modelli inseriti in un passaggio specifico di un processo definito, dove il prima e il dopo possono essere misurati. Tata Steel sa quali decisioni di manutenzione sono diventate più rapide. Cebu Pacific sa quanti giorni richiedeva il processo di intake.
Il dato che dovrebbe preoccupare i fornitori è nei dati del sondaggio. L'indice di maturità dell'AI aziendale di Singapore ha collocato l'adozione dell'AI agentica al 51 percento, in aumento dal 22 percento dell'anno precedente, mentre solo il 10 percento delle imprese aveva riprogettato i flussi di lavoro end-to-end attorno ad essa. Uno studio di Capgemini ha rilevato divari simili, con la maggior parte delle organizzazioni ancora in fase di esplorazione o di pilotaggio.
Quindi il mercato è pieno di aziende che hanno collegato l'AI a un flusso di lavoro senza cambiare il flusso di lavoro. Hanno avvitato un modello sul vecchio processo e l'hanno chiamato trasformazione. I due casi di studio qui hanno fatto l'altra cosa, ed è per questo che hanno prodotto numeri che vale la pena riportare.
La specializzazione è ciò che rende gli agenti governabili
C'è una ragione di governance per preferire una flotta di agenti ristretti a un unico agente ampio, e vale la pena spiegarla. Un agente con un ambito fisso è facile da verificare. Sai a cosa dovrebbe poter accedere, puoi registrare a cosa ha effettivamente avuto accesso, e la differenza tra i due è una lista breve. Un agente con un mandato ampio ha un ambito che cambia a ogni compito, il che rende lo stesso audit un progetto di ricerca.
I 300 agenti di Tata Steel sono specializzati esattamente in questo modo. Questa scelta ripaga due volte. È ingegneria più semplice e rende l'implementazione difendibile davanti a chi deve approvarla. Ogni agente può essere valutato singolarmente, e un errore in uno non richiede di riesaminare gli altri 299.
Lo stesso principio spiega perché così tanti programmi aziendali sugli agenti si bloccano. Un agente generico promette bene in una demo, viene pilotato su un'ampia fetta di lavoro e poi si scontra con il fatto che nessuno riesce a descrivere come debba essere il comportamento corretto lungo tutta quella fetta. Restringere l'ambito sembra un passo indietro ed è di solito il passo che permette al progetto di sopravvivere.
Il requisito nascosto: una baseline per confrontare
Entrambi i casi di studio producono numeri, e non è un caso. Misurare un aumento del dieci percento del tempo di attività o un calo da cinque giorni a uno richiede un prima. Le organizzazioni che saltano la baseline finiscono con aneddoti invece che con risultati, ed è per questo che così tanti programmi di AI riportano entusiasmo e faticano a riportare impatto.
La disciplina inizia prima dell'implementazione. Scegli il processo, registra quanto tempo richiede e quanto costa oggi, poi cambia un passaggio e misura di nuovo. Sembra burocratico ed è la differenza tra un programma in grado di difendere il proprio budget e uno che non può farlo. Cebu Pacific può dire che il tempo di revisione dei contratti è stato dimezzato perché qualcuno ha annotato quanto era prima.
C'è una seconda misurazione che conta altrettanto e viene rilevata meno spesso: il tasso di errore. Un agente che dimezza il tempo e raddoppia gli errori non ha migliorato nulla, ha spostato il costo dalla parte iniziale del processo a quella finale. I casi di studio che reggono sono quelli in cui un essere umano controlla ancora l'output nel punto in cui un errore sarebbe costoso, e il guadagno misurato deriva dall'eliminazione della lettura, non della revisione.
Cosa significa il divario per il prossimo anno
Le organizzazioni che vedono risultati sono quelle che hanno scelto un processo, l'hanno misurato e l'hanno ricostruito attorno a ciò in cui il modello è davvero bravo. Quelle bloccate nei progetti pilota sono quelle che hanno comprato l'accesso e hanno aspettato che l'adozione avvenisse da sola. L'accesso non è mai stato la parte difficile. La riprogettazione lo è.
L'acciaieria e la compagnia aerea condividono anche un tratto facile da trascurare. Entrambe hanno mantenuto gli esseri umani nei punti decisionali che comportano responsabilità. L'agente di manutenzione segnala, una persona decide. L'agente contrattuale redige ed evidenzia, un avvocato approva. L'AI ha rimosso la scansione, non il giudizio.
Questa divisione del lavoro è banale col senno di poi. È anche ciò che separa un programma di AI che produce un numero da uno che produce una slide. Scegli il processo, trova il passaggio in cui una persona legge o sposta informazioni, automatizza quel passaggio e misura cosa è cambiato. La ricetta è semplice. Eseguirla è più difficile che comprare una licenza, ed è per questo che così tante organizzazioni comprano la licenza e la chiamano strategia.
Articoli correlati
Un semi-umanoide su ruote ha completato un'ora di lavanderia senza aiuto
I singoli compiti possono riuscire mentre un flusso di lavoro fallisce comunque. Dyna ha cambiato la metrica.
LTX 2.5 vuole renderizzare la tua bozza Blender a blocchi in un'inquadratura finita
Non controlli ciò che accade nel text-to-video. Questo prova a rimediare.
ServiceNow trasforma i fallimenti degli agenti in dati di addestramento
La generazione senza verifica è rumore. I cancelli sono il prodotto.
Un unico framework per linguaggio e visione: il modello aperto da 1,6 miliardi di Horizon
Una scommessa sul fatto che i ponti tra linguaggio e visione non siano mai stati necessari.