← Torna al blog
Aicirca 7 min di lettura

Ai2 ha reso open source lo stack di training, non l'ennesimo set di pesi

Pubblicato 5 ott 2026
Ai2 ha reso open source lo stack di training, non l'ennesimo set di pesi

L'Allen Institute for AI ha rilasciato Olmo-core 3, un'infrastruttura di training aperta per modelli mixture-of-experts su scala da mille miliardi di parametri. Il benchmark principale è un MoE da 47 miliardi di parametri che raggiunge circa 2,7 volte il throughput della configurazione precedente su otto GPU B300. È un numero rispettabile. Non è però il motivo per cui questo rilascio conta.

I pesi sono facili da regalare e difficili da cui imparare. Scarichi un set di pesi e puoi eseguire un modello. Non puoi riprodurlo, sottoporlo ad audit o riaddestrarlo sui tuoi dati senza essenzialmente ricostruire da zero la pipeline di training. Olmo-core 3 è il rilascio della pipeline.

La distinzione che continua a emergere

Pesi aperti e training aperto sono prodotti diversi, e il divario tra i due è dove si trova la maggior parte delle informazioni utili.

Un modello rilasciato ti dice cosa ha ottenuto un team. Uno stack di training ti dice come, ed è ciò di cui hai bisogno se vuoi farlo da solo. Il secondo è molto più utile per chiunque sia esterno all'organizzazione che lo rilascia, e molto più raro, perché il codice di training, la pipeline dei dati e i dettagli di configurazione sono le parti che hanno richiesto più tempo per essere messe a punto.

Il mixture-of-experts rende tutto questo più importante, non meno. Un modello MoE instrada ogni token verso un sottoinsieme di esperti, quindi un modello con migliaia di miliardi di parametri totali potrebbe attivarne solo una piccola frazione per token. Questo design riduce il costo di inferenza, ma introduce decisioni di routing, bilanciamento del carico tra esperti e pattern di comunicazione tra dispositivi che sono davvero difficili da ottimizzare. Due team possono avere architetture del modello identiche e throughput molto diversi a causa delle scelte nel ciclo di training.

Rilasciare l'infrastruttura di training significa che quelle scelte sono visibili. È questo che rende significativo un valore di throughput 2,7 volte superiore, perché è legato a codice che qualcun altro può eseguire e verificare.

Una scheda acceleratrice grafica appoggiata su un tavolo scuro accanto a una scheda bianca

Perché il training MoE è la parte difficile

I modelli dense scalano in modo prevedibile. Aggiungi parametri, aggiungi calcolo, ottieni una curva regolare. I modelli MoE introducono un problema di scheduling. Se il router invia la maggior parte dei token a pochi esperti, quegli esperti diventano il collo di bottiglia e il resto dell'hardware resta inattivo. Se distribuisce i token in modo troppo uniforme, il modello perde la specializzazione che rendeva attraente l'architettura.

Fare bene questo richiede fattori di capacità, loss ausiliarie e overlay di comunicazione che la maggior parte dei laboratori considera proprietari. Richiede anche checkpointing che sopravviva ai guasti hardware, perché una run di training a questa scala incontrerà guasti e ricominciare da capo non è un'opzione.

Il guadagno di throughput che Ai2 riporta su otto GPU B300 è un risultato su piccola scala, e va letto come tale. Mostrare che un ciclo di training è efficiente su un nodo non equivale a mostrare che regge su centinaia di nodi, dove domina la comunicazione tra nodi. Ma è il primo risultato giusto, perché i problemi di efficienza di solito compaiono prima su piccola scala e peggiorano man mano che si scala.

Perché il throughput su otto GPU è il primo numero giusto

Un risultato di throughput su piccola scala sembra modesto accanto all'inquadramento da mille miliardi di parametri, e merita una difesa. I problemi di efficienza del training tendono a comparire presto e a peggiorare. Se un ciclo di training spreca un terzo del suo calcolo su un singolo nodo, lo stesso ciclo sprecherà di più quando si aggiunge la comunicazione tra nodi, perché l'inefficienza si accumula a ogni livello di coordinamento.

Pubblicare prima un numero su piccola scala è un modo per dire che i fondamentali sono solidi prima di fare affermazioni su un grande cluster. È anche il punto giusto da cui partire. Un team che riporta un numero su larga scala prima di uno su piccola scala di solito sta riportando un picco anziché una velocità sostenuta.

C'è una seconda ragione per cui il numero conta. Il throughput MoE è sensibile alla dimensione del batch e alla lunghezza della sequenza in modi in cui i modelli dense non lo sono, e la configurazione che massimizza l'efficienza su otto GPU spesso si generalizza a cluster più grandi con un po' di tuning. Un miglioramento di 2,7 volte è abbastanza grande da riflettere un cambiamento strutturale anziché un dettaglio di tuning, il che lo rende meritevole di attenzione.

Il pubblico per questo è più piccolo del pubblico per i pesi

La maggior parte delle persone che parla di modelli aperti vuole i pesi. Vuole eseguire inferenza, fare fine-tuning su un dominio o costruire un prodotto. Quel gruppo è servito da ogni rilascio di pesi aperti.

Il gruppo che ha bisogno di uno stack di training è molto più piccolo: laboratori di ricerca, programmi nazionali di calcolo, università con accesso a cluster e aziende in settori regolamentati che devono documentare come è stato prodotto un modello. Questi utenti sono stati serviti male, perché la scelta è stata tra costruire una pipeline da zero e usare qualcosa che funziona solo con l'hardware di uno specifico fornitore.

Uno stack di training aperto cambia la seconda opzione. Dà a un laboratorio un punto di partenza che può modificare e offre a un programma governativo un percorso verso modelli sovrani che non dipende dalla volontà di un fornitore straniero di condividere i dettagli implementativi.

È una cosa strategica da rilasciare, e Ai2 è stata coerente su questo. I modelli dell'istituto sono stati pubblicati con dati, codice e log di training, che è uno standard più difficile rispetto a rilasciare pesi e un paper.

La discussione silenziosa sul training aperto

C'è un dibattito all'interno della comunità dei modelli aperti su cosa dovrebbe significare apertura, e rilasci come questo lo fanno avanzare.

Una posizione sostiene che sono i pesi a contare, perché sono i pesi che le persone usano. Secondo questa visione, pubblicare un modello è un regalo e i dettagli di training sono affari privati di un'azienda. L'altra posizione sostiene che un modello senza il suo stack di training non può essere sottoposto ad audit, riprodotto o migliorato da chiunque sia esterno al team originale, e che definire aperto un simile rilascio sopravvaluta ciò che offre.

La seconda posizione ha guadagnato terreno per una ragione pratica. Le autorità di regolamentazione in diverse giurisdizioni hanno iniziato a chiedere agli sviluppatori di modelli di documentare i dati di training e la provenienza. Un team che ha addestrato su una pipeline rilasciata può rispondere a queste domande. Un team che ha fatto fine-tuning su pesi presi in prestito non può, perché non sa cosa sia stato usato per produrli.

Per un istituto di ricerca, il calcolo è semplice. Rilasciare uno stack costa tempo di ingegneria e non rinuncia a nulla dal punto di vista commerciale, perché l'istituto non vende chiamate API. Per un laboratorio commerciale, fare lo stesso darebbe ai concorrenti un vantaggio iniziale. Questa asimmetria è il motivo per cui gli stack di training aperti provengono da istituti e università molto più spesso che da aziende, e perché ognuno che compare vale la pena di essere esaminato.

Cosa tenere d'occhio

Se il risultato di throughput regge su scala. Il test interessante non è otto GPU ma qualche centinaio, dove i pattern di comunicazione che Olmo-core 3 codifica o funzionano o no.

Se laboratori esterni lo adottano davvero. Uno stack di training si diffonde quando qualcun altro addestra un modello con esso e pubblica il risultato. La prima riproduzione credibile sarebbe più informativa di qualsiasi tabella di benchmark.

Se il training aperto cambia gli acquisti. Le organizzazioni che devono documentare la provenienza dei loro modelli hanno avuto opzioni limitate. Se una pipeline di training completa è disponibile con una licenza permissiva, alcune di quelle organizzazioni ci costruiranno sopra invece di pagare per un'alternativa chiusa.

I rilasci di pesi attirano l'attenzione perché chiunque può scaricarli e provarli. I rilasci di training sono dove viene trasferita la conoscenza effettiva del settore, e avvengono molto meno spesso. Questo vale la pena di essere letto con attenzione, dato che la parte trasferibile di un modello è il processo che ci sta dietro.

Articoli correlati