← Torna al blog
Aicirca 6 min di lettura

Il muro fotonico della memoria è la scommessa da 88 milioni di dollari che Volantis ha appena fatto

Pubblicato 4 ott 2026
Il muro fotonico della memoria è la scommessa da 88 milioni di dollari che Volantis ha appena fatto

La proposta di Volantis è facile da enunciare e difficile da credere: costruire un sistema di inferenza che faccia sparire il muro della memoria.

La società di semiconduttori di San Francisco ha chiuso un round Serie A da 88 milioni di dollari il 1° ottobre, co-guidato da Lachy Groom e Abstract Ventures, con la partecipazione di John Doerr, VXI Capital, Triatomic e Susa Ventures. La lista di angel investor sembra un who's who della conversazione sui costi di inferenza, tra cui Dwarkesh Patel, Naveen Rao e Sholto Douglas. Il team fondatore proviene da NVIDIA, AMD, Broadcom e Ayar Labs, con esperienze precedenti sul primo prodotto CoWoS, VCSEL sintonizzabili ad alto volume e le prime ottiche co-packaged.

Il compromesso con cui tutti hanno imparato a convivere

Eseguire rapidamente un modello di grandi dimensioni richiede due cose che l'hardware non è stato in grado di fornire insieme. Serve una capacità enorme per contenere i pesi e una larghezza di banda enorme per alimentarli continuamente al motore di calcolo. Ogni architettura oggi in produzione sceglie un lato.

La SRAM on-chip offre larghezza di banda senza capacità, il che limita le dimensioni del modello e le finestre di contesto, aumentando al contempo costo ed energia per token. La memoria HBM e GPU offre capacità senza sufficiente larghezza di banda per servire i modelli più grandi a velocità elevate. Persino approcci più recenti come la DRAM 3D restano sulla stessa curva, solo più avanti lungo di essa.

Volantis afferma che il suo primo sistema, A-1, è progettato per aumentare insieme capacità e larghezza di banda di quasi due ordini di grandezza. Ciò gli consentirebbe di eseguire modelli che superano i 20.000 miliardi di parametri a una velocità fino a 10.000 token al secondo per utente. Questi sono obiettivi di progettazione, annunciati dall'azienda, senza verifica indipendente. Trattateli come una dichiarazione d'intenti, non come un benchmark.

Il motivo per cui il compromesso persiste da così tanto tempo è la fisica. La larghezza di banda è limitata da quanti dati possono attraversare il confine tra memoria e calcolo, e quel confine è dove va gran parte dell'energia in un modello di grandi dimensioni. Spostare i pesi dalla memoria alle unità aritmetiche costa molta più energia dell'aritmetica stessa. Qualsiasi architettura che aumenti la larghezza di banda senza aumentare anche quel costo vince due volte.

Un connettore in fibra ottica che brilla al centro su metallo spazzolato scuro

La fotonica, puntata su un problema più difficile

La fotonica già sposta dati all'interno dei data center. Ciò che esiste oggi è per lo più chip-to-chip. Collegare il calcolo alla memoria è un problema diverso, perché richiede che oltre cento volte più dati viaggino su distanze molto più brevi. Energia e costo si comportano diversamente a quella scala.

Volantis ha costruito la sua piattaforma specificamente per quell'ambiente. Anziché laser esterni, utilizza micro-VCSEL personalizzati, appoggiandosi alla catena di fornitura esistente di VCSEL in arseniuro di gallio ed evitando i vincoli del fosfuro di indio che hanno creato colli di bottiglia in altri progetti ottici. L'azienda afferma che i collegamenti risultanti consumano meno di un picojoule per bit.

Il tessuto ottico mette in pool molti chip di memoria in un'unica risorsa logica, così aggiungere memoria aggiunge larghezza di banda, non solo capacità. Questo è il trucco. È anche la parte che deciderà se l'intera cosa funziona, perché mettere in pool la memoria attraverso un'interconnessione ottica è dove latenza e tolleranza ai guasti diventano davvero difficili. Un singolo collegamento lento può bloccare un intero pool, e un guasto che metterebbe fuori uso un solo modulo di memoria ora ha un raggio d'impatto molto più ampio.

Perché il tempismo non è un caso

Il mercato per questa proposta ha cambiato forma nell'ultimo anno. Quando i modelli rispondevano a domande, l'inferenza era economica e le raffiche erano brevi. Man mano che gli agenti assumono compiti più lunghi, funzionando per minuti o ore alla volta, la velocità di inferenza smette di essere una comodità e diventa un moltiplicatore di throughput. Un agente di coding che completa un compito in due minuti invece di trenta non sembra solo più veloce. Cambia quante idee uno sviluppatore può testare in un giorno.

Questo cambiamento è il motivo per cui gli investitori che ragionano sull'economia dell'inferenza continuano a comparire in round come questo. Se i carichi di lavoro degli agenti scalano con la velocità dell'hardware sottostante, allora l'hardware smette di essere un costo di sfondo e diventa ciò che determina la velocità operativa di un'azienda. La larghezza di banda della memoria, in quel mondo, non è un numero su una scheda tecnica. È una voce di bilancio nella rapidità con cui un'azienda può agire.

Con chi compete

Volantis non è sola nell'attaccare il collo di bottiglia dell'inferenza, e le alternative plasmano il modo in cui la scommessa dovrebbe essere giudicata. I produttori di GPU continuano a spingere la larghezza di banda con nuovi tipi di memoria e packaging, spremendo la stessa curva più a fondo. Le case di progettazione di chip inseguono acceleratori specializzati, ottimizzati per forme specifiche di modelli. Una revisione fotonica compete con tutti loro, e vince solo se sposta la curva anziché il punto su di essa. È un'asticella alta, ed è esattamente per questo che il round è degno di nota: gli investitori seri raramente finanziano chi sposta la curva, a meno che non credano che l'approccio dominante sia vicino al suo limite.

Il divario onesto

Due avvertenze appartengono a qualsiasi lettura equa. La prima è che A-1 non esiste ancora. Volantis prevede di consegnare i suoi primi motori di inferenza integrati ai clienti nel 2027, il che lascia spazio a molti imprevisti tra un round di finanziamento e un prodotto effettivamente in spedizione. La seconda è che i numeri sono dell'azienda stessa, descritti come obiettivi di progettazione. Non esiste alcun benchmark di terze parti né alcun cliente che esegua il sistema.

Ciò non rende la scommessa irragionevole. La rende precoce. Le tempistiche dei semiconduttori sono lunghe, e il denaro viene speso in personale tecnico e nel percorso verso i primi deployment, non nel marketing di un prodotto. Gli 88 milioni di dollari sono una pista di finanziamento, non una prova.

Il muro della memoria in parole semplici

Il muro della memoria è il divario tra la velocità con cui un processore può calcolare e la velocità con cui può recuperare i dati su cui calcola. Nell'AI moderna, l'aritmetica raramente è il collo di bottiglia. Lo è l'attesa che arrivino i pesi. La conseguenza è che un chip più veloce, da solo, offre molto meno di quanto implichi la scheda tecnica, perché il chip passa gran parte del suo tempo inattivo. Ogni sforzo serio nell'hardware per l'inferenza è, in qualche forma, un attacco a quel tempo di inattività. Volantis lo attacca dal lato della memoria anziché da quello del calcolo, che è l'approccio meno affollato e il più difficile, perché spremere larghezza di banda dal percorso memoria-calcolo significa ricostruire il percorso stesso anziché ottimizzare ciò che si trova a ciascuna estremità.

Cosa lo dimostrerebbe

La pietra miliare da osservare non è un annuncio. È un cliente che esegue un modello che altrimenti non ci starebbe, a una velocità che cambia ciò che può fare. Se l'A-1 verrà spedito e l'affermazione sulla larghezza di banda della memoria sopravviverà al contatto con un carico di lavoro reale, il muro della memoria smetterà di essere un fatto della vita e diventerà un problema risolto con un fornitore associato.

Fino ad allora, il riassunto onesto è che Volantis ha raccolto denaro serio da persone che comprendono il problema, per attaccare il vincolo più difficile in assoluto nell'hardware per l'inferenza, e ha promesso un sistema che conterebbe molto se arrivasse. Nei semiconduttori, è più o meno così che inizia ogni cosa importante. È anche così che finiscono molte cose costose.

Articoli correlati