Huawei Cloud ha ricostruito il suo stack attorno agli agenti, poi ha messo una data alle fatture

Huawei Cloud ha usato la sua conferenza annuale Connect di settembre per dire che il suo portafoglio di AI enterprise è ora completamente sul mercato, e che il centro di progettazione di quel portafoglio sono gli agenti. Il CEO di Huawei Cloud, Zhou Yuefeng, ha inquadrato il cambiamento come la costruzione di un "Agentic Cloud" per un'era di agenti di settore, e gli annunci che lo hanno accompagnato riguardavano soprattutto l'infrastruttura.
Quattro componenti di infrastruttura, per essere precisi. Huawei Cloud ha descritto il suo nuovo paradigma infrastrutturale come token efficienti, memoria potenziata, scheduling integrato di carichi generali e AI, e autonomia sicura. Ha detto che la piattaforma risultante serve già più di 3.500 clienti in tutto il mondo. La frase suona come marketing finché non si guarda a cosa mira ciascun componente, perché ognuno risponde a un guasto che gli agenti incontrano in produzione e che i chatbot non incontrano.
Token, memoria e il ripristino in dieci minuti
Il livello di calcolo è il servizio cluster Lingqu Ascend 950. Huawei Cloud afferma di usare un meccanismo di ripristino rapido a cinque livelli con osservabilità full-link, che i job di training su di esso hanno funzionato per 40 giorni senza interruzioni, e che un guasto viene recuperato entro dieci minuti. Indica un throughput dei token superiore del 20 per cento rispetto alla generazione precedente. Il servizio è diventato commerciale in Cina il 30 settembre, con un lancio internazionale previsto per il 30 novembre.

Un obiettivo di ripristino in dieci minuti è una specifica diversa da un punteggio di benchmark. Le esecuzioni di training lunghe falliscono, e il costo di un guasto si misura in ore GPU perse e overhead di riavvio, quindi il tempo di ripristino è il numero a cui il team finanziario di un cliente tiene davvero.
Il livello di memoria è mirato a una specifica modalità di guasto degli agenti di lunga durata. Huawei Cloud chiama il prodotto CMS memory storage e lo descrive come capace di fornire spazio di memoria su scala petabyte, circa il doppio della capacità di offerte comparabili, con velocità di lettura a livello terabyte per l'accesso ad alta velocità e un miglioramento delle prestazioni del 50 per cento. La proposta è che un agente che lavora a un compito lungo ha bisogno di un luogo dove conservare ciò che ha appreso che non sia la finestra di contesto, perché una finestra di contesto che cresce senza limiti è costosa e inaffidabile.
Poi c'è il livello di accesso ai modelli. AgenticMaaS è descritto come ciò che consente agli sviluppatori di chiamare i principali modelli allo stato dell'arte con un clic e senza lavoro di deployment. MiniMax ha dimostrato un modello multimodale in esecuzione sulla piattaforma allo stesso evento, il che ricorda che in Cina i fornitori di modelli e i fornitori di cloud spesso vendono allo stesso acquirente enterprise.
Commerciale e open source, venduti insieme
Il livello applicativo è dove l'approccio di Huawei Cloud differisce da una pura mossa infrastrutturale. Segue una doppia strategia: la piattaforma commerciale ZhiGuo AgentArts e una controparte open source chiamata openJiuwen. Tra le due, l'azienda dice di aver pubblicato più di 5.000 asset generali e più di 1.000 asset di settore, cioè competenze, template e connettori riutilizzabili anziché modelli grezzi.
La piattaforma è in uso presso più di cento enti governativi, banche, istituzioni di ricerca e imprese, tra cui il governo del distretto di Longgang a Shenzhen, Postal Savings Bank of China, China Southern Power Grid e Kingsoft Office. Kingsoft ha costruito agenti per l'ufficio sulla piattaforma combinando il suo centro documentale WPS 365 con il suo assistente Comate, che è il tipo di integrazione che un fornitore cloud non può costruire da solo e un fornitore applicativo non può ospitare da solo.
ZhiGuo AgentArts è previsto per il lancio commerciale sui mercati internazionali il 30 dicembre. La comunità open source attorno a openJiuwen riporta più di 50.000 stelle e 3,29 milioni di download. Distribuire sia una piattaforma commerciale sia una versione aperta è un modo per seminare la base di sviluppatori con persone che prima o poi avranno bisogno del livello a pagamento, ed è un modello che diversi fornitori cinesi seguono ormai.
L'altro argomento a favore dell'on-premises
Huawei Cloud non è l'unica azienda a vendere infrastrutture per agenti in Cina, e una serie di eventi più discreta a settembre mostra il resto del mercato. Mitac, in collaborazione con AMD, ha tenuto seminari di deployment a Wuxi e Guiyang per un appliance per agenti enterprise chiamato Agent Builder, costruito attorno ai processori AMD Ryzen AI Max e commercializzato sulla sovranità dei dati. La proposta lì è l'opposto di un cloud pubblico: tenere il modello, il calcolo, la knowledge base e i sistemi aziendali all'interno dell'azienda, ed eseguire l'agente su un box in ufficio.
Entrambi gli approcci rispondono alla stessa obiezione di procurement. Le imprese vogliono agenti che tocchino processi aziendali reali, e i processi aziendali reali contengono dati che non si sentono a proprio agio a mettere dietro l'endpoint di qualcun altro.
I quattro numeri che un acquirente già monitora
I quattro pilastri infrastrutturali corrispondono a quattro costi. I token sono il prezzo di ogni inferenza, ed è per questo che l'annuncio apre con il throughput anziché con un punteggio di benchmark. La memoria è ciò che costa un compito di lunga durata quando la finestra di contesto non basta più. Lo scheduling è la penalità di utilizzo nell'eseguire carichi generali e AI su hardware condiviso. La sicurezza è ciò su cui un reparto compliance chiede prima che qualcosa tocchi i dati di produzione.
L'affermazione di Huawei Cloud è di aver affrontato tutti e quattro in un unico stack, e di poterlo fare perché possiede il silicio. È una promessa più difficile da eguagliare per un concorrente, e più facile da verificare per un cliente, perché il risultato compare in tre punti che un team di procurement già misura: costo per milione di token, tasso di esecuzioni lunghe fallite e quota di tempo GPU che lavora davvero.
Perché l'infrastruttura è la storia, non i modelli
L'affermazione interessante emersa quest'anno dalla discussione cinese sugli agenti è che la capacità dei modelli è convergente, e che il valore si è spostato su ciò che la circonda. Un professore di pratica presso lo Shanghai Advanced Institute of Finance ha fatto la versione economica dell'argomentazione a un forum di Shanghai a settembre: a differenza delle piattaforme internet, dove il costo marginale tende a zero e gli effetti di rete sono forti, un grande modello consuma risorse a ogni inferenza, e un utente può cambiare modello in pochi minuti. Un fossato costruito solo sul modello è sottile.
Se questa lettura è corretta, il livello difendibile è quello costoso da spostare, e ciò significa token, memoria, scheduling e sicurezza anziché pesi.
Il vantaggio di Huawei in questa chiave di lettura è verticale. Possiede il chip, l'interconnessione, il cloud e la piattaforma di modelli, ed è per questo che l'annuncio dell'Ascend 950 apre con il tempo di ripristino e il throughput dei token anziché con una posizione in classifica. I concorrenti senza un business di chip vendono una storia di integrazione, e le storie di integrazione sono più facili da copiare.
La controargomentazione è che essere integrati ti rende anche un single point of failure, e che le imprese vogliono sempre più un livello agentico portabile anziché uno modellato dal fornitore. È questa tensione che i prossimi due trimestri metteranno alla prova, a cominciare dalla data commerciale del 30 settembre in Cina e dal lancio internazionale alla fine di novembre. La scadenza internazionale conta più di quella nazionale, perché uno stack costruito attorno a silicio nazionale deve dimostrare di poter servire un cliente i cui dati non possono lasciare la propria giurisdizione.
Articoli correlati
Xiaomi ha rilasciato un modello omnimodale che eguaglia la frontiera, più la ricetta di addestramento
I pesi ti permettono di eseguire un modello. Gli ambienti ti permettono di riaddestrarlo.
Cadence mette gli agenti nella progettazione dei chip e riduce un ciclo di verifica di cinque settimane a un giorno
Gli agenti, quindi, chiamano più motori sottostanti, non meno.
Roblox Build ha pubblicato 9.000 giochi in sei settimane. Il numero interessante è 71
Leggilo come un numero di reclutamento più che di qualità.
Due agenti sono andati in produzione a settembre. Ecco cosa avevano in comune
Gli agenti che sono sopravvissuti al contatto con la produzione a settembre sono stati quelli che si sono adattati a un processo esistente.