DeepSeek ha reso open source l'esperienza ingegneristica dei modelli da mille miliardi di parametri: questa volta il calcolo nazionale colma il divario sul software

Il 30 settembre DeepSeek ha pubblicato una serie di codice sul proprio account ufficiale, rendendo open source sei moduli per la piattaforma Huawei Ascend: TileLang, DeepGEMM-Ascend, DeepEP-Ascend, TileKernels, FlashMLA e DeepSelect. I nomi sembrano frammentari, ma la copertura è in realtà piuttosto organica: un linguaggio di programmazione, una serie di kernel di calcolo e la comunicazione distribuita.
Non sembra un open source ordinario. Ciò che viene aperto non è un modello, ma lo strato di fondamenta necessario per farlo girare.
Quando i chip bastano, a bloccare è qualcos'altro
Negli ultimi anni, quando si parla di potenza di calcolo nazionale, l'argomento più discusso sono i valori numerici. Le schede tecniche migliorano di anno in anno, ma chi ha davvero migrato un modello lo sa bene: i problemi raramente nascono dalla potenza di picco.
L'ecosistema CUDA di NVIDIA è stato costruito in oltre vent'anni. Compilatori, librerie matematiche, librerie di comunicazione: uno strato sopra l'altro; lo sviluppatore prende la scheda e la usa, con documentazione, community e resoconti degli errori già pronti. Passando a un altro hardware, lo stesso operatore può dover essere scritto da zero, lo scheduling va regolato a mano e le librerie di comunicazione multi-nodo e multi-scheda vanno implementate da soli. Il punteggio del chip non è basso, ma il solo fatto di portarci sopra un modello costa in modo assurdo.
Questa distanza ha anche un aspetto di cui si parla poco. L'hardware si compra con un investimento una tantum; l'ecosistema software può essere costruito solo affinando, anno dopo anno, il lavoro delle persone. Comprare schede è una questione di approvvigionamento; completare la toolchain è una questione di tempo, e quel tempo si può ottenere solo attraverso progetti reali. Chi riesce per primo a far girare un modello su una piattaforma, a renderlo stabile e a portarlo in scala, è anche l'unico che può accumulare esperienza riutilizzabile. È per questo che questo open source merita una discussione a parte: non è qualcosa che è stato comprato, è qualcuno che ha consegnato ciò che aveva accumulato.
La vera lacuna di lungo periodo della potenza di calcolo nazionale è quindi il software. I chip sanno calcolare, ma non sono comodi da usare. Quello che DeepSeek ha reso open source cade esattamente in questo vuoto.
Tra i sei moduli, il più interessante è TileLang
Il modulo più pesante dei sei è TileLang. È un linguaggio di programmazione di alto livello sviluppato internamente da DeepSeek, finora rivolto soprattutto al backend NVIDIA; questa volta supporta ufficialmente Ascend 950, offrendo generazione di codice nativa, scheduling e sincronizzazione automatici. La posizione di DeepSeek è diretta: un'alternativa a CUDA, con un "modello di programmazione più semplice".
Il complementare TileKernels risolve un altro problema annoso. Può selezionare automaticamente il backend NVIDIA o Huawei ed esporre verso l'alto la stessa API Python. In altre parole, lo stesso codice gira su due piattaforme hardware e il costo del passaggio si riduce al livello della configurazione, invece di riscrivere i kernel.
I dati dei test interni resi pubblici non sono nemmeno vaghi. Alcuni kernel su Ascend 950DT raggiungono una percentuale molto alta del limite hardware dichiarato: il 99,8% per la moltiplicazione di matrici dense BF16, circa il 99,5% per FP8; l'implementazione di sparse attention pensata per DeepSeek V4.1 arriva a 410 TFLOPS in fase di prefill, circa il 95% del valore teorico. Le due aziende hanno inoltre ottimizzato congiuntamente una soluzione supernodo basata su 128 Ascend 950, dedicata proprio a bilanciare calcolo e trasferimento dati.
Il valore di questi numeri sta nel dimostrare che la strada è percorribile. Prima, parlando di potenza di calcolo nazionale, si discuteva se fosse utilizzabile; ora iniziano a esserci team disposti a rendere pubbliche le proprie esperienze di ottimizzazione estrema dell'hardware, segno che almeno qualcuno è già arrivato a un livello condivisibile.
Un'unica API per entrambi i backend: dov'è il valore
Guardando TileLang e TileKernels insieme, l'utilità diventa più chiara. TileKernels seleziona automaticamente il backend NVIDIA o Huawei ed espone la stessa API Python. Questo significa che il team mantiene un solo codice, non due.
Nella realtà, un servizio di inferenza appena decente di solito gira su diversi tipi di hardware contemporaneamente. Nel cloud può esserci ancora NVIDIA, negli scenari self-hosted o di innovazione tecnologica nazionale ci sono schede cinesi, e per l'edge c'è un altro set ancora. Se a ogni cambio di hardware si dovessero riscrivere i kernel, il team dovrebbe mantenere più implementazioni parallele e testarle tutte separatamente. Un'unica API fa scendere questa cosa da "riscrittura" a "modifica di configurazione", e ciò che si risparmia non è solo manodopera, ma anche occasioni di errore.

Per un team che vuole solo arrivare al prodotto finito, questo tipo di cambiamento non finirà in nessun comunicato di lancio, ma determina se sarà disposto a provare hardware nazionale.
Il vero cambiamento avviene sul costo di migrazione
Per uno sviluppatore qualsiasi, l'impatto più concreto di questo open source è il costo di migrazione.
In passato, migrare training o inferenza su Ascend significava integrare da soli gli operatori di basso livello e adattare gli strumenti: non era raro che un progetto ci consumasse mesi. Ora queste toolchain sono direttamente open source, molte trappole sono già state incontrate e risolte da altri e possono essere riutilizzate così come sono. La soglia scende da "serve un team dedicato all'adattamento degli operatori" a "serve qualcuno nel team che sappia leggere questi strumenti".
Questo spiega anche perché il rilascio abbia suscitato una reazione non indifferente nella community degli sviluppatori. Di modelli, in questi giorni, ne escono già abbastanza; ciò che scarseggia davvero è risparmiarsi un pezzo di strada.
Ora bisogna vedere se gli altri lo useranno
Per valutare il peso di questo open source non basta guardare a ciò che dice DeepSeek, ma a ciò che faranno gli altri nei prossimi sei mesi.
Se una toolchain riesca ad affermarsi dipende da se ci sono terze parti disposte a investirci. Se TileLang servisse solo ai modelli di DeepSeek, il suo significato resterebbe confinato dentro l'azienda; se altri team lo usassero per scrivere operatori, aprire issue ed estendere i backend hardware, allora comincerebbe a diventare un'infrastruttura pubblica. Per quanto belli, i numeri contano solo dopo mesi di verifica su carichi reali.
Un'altra variabile è se altri chip nazionali verranno integrati di conseguenza. Al momento le informazioni pubbliche si concentrano su Ascend; se questo linguaggio di alto livello potesse essere portato su più piattaforme con la stessa logica, il suo valore salirebbe di un altro gradino. Su questo, per ora, non c'è risposta.
Rendere open source le fondamenta è una cosa più lenta che rendere open source un modello
Negli ultimi due anni il campo di battaglia principale dell'open source nazionale sono stati i pesi dei modelli. Parametri, classifiche, download: cose che si vedono subito. La toolchain di basso livello è diversa: non compare nelle classifiche e nel breve termine non porta visibilità. Ma senza questo strato, quanti modelli ci si metta sopra restano tutti in bilico.
Consegnando la propria esperienza ingegneristica nel far girare modelli da mille miliardi di parametri su Ascend, DeepSeek fa esattamente questo lavoro di recupero, poco appariscente ma decisivo per stabilire se il settore possa andare avanti.
Se convenga spostare subito su Ascend i progetti NVIDIA che si hanno in mano, la risposta dipende ancora dallo scenario concreto e dal fatto che nel team ci sia qualcuno disposto a dedicare tempo al basso livello. Ma almeno da questo giorno, la motivazione "l'ecosistema non è comodo" inizia a reggere meno. E una volta che un ecosistema inizia a essere utilizzabile, quello che succede dopo tende ad andare più veloce del previsto.
Articoli correlati
Il watermark non tiene il passo con i falsi
I sistemi funzionano. La copertura no. Il divario viene riempito da qualunque cosa il pubblico presuma.
Il tuo agente AI ora chiama il supporto clienti, e le aziende devono rispondere
Una voce perfetta su una richiesta non autorizzata è peggio di una voce goffa su una verificata.
Reddit chiude la sua ultima porta aperta e dà la colpa agli scraper
Uno scraper che Reddit non ha autorizzato è abuso. Uno scraper che Reddit ha autorizzato è ricavo.
La Banca d'Inghilterra ha appena inserito il debito dell'IA tra i rischi per la stabilità finanziaria
Un boom finanziato con utili non distribuiti può essere riassorbito in privato. Questo, però, corre su 450 miliardi di dollari di nuovo debito.