Un mur de mémoire photonique : le pari de 88 millions de dollars que Volantis vient de faire

La promesse de Volantis est facile à énoncer et difficile à croire : construire un système d’inférence qui fait disparaître le mur de la mémoire.
La société de semi-conducteurs basée à San Francisco a bouclé un tour de série A de 88 millions de dollars le 1er octobre, co-dirigé par Lachy Groom et Abstract Ventures, avec la participation de John Doerr, VXI Capital, Triatomic et Susa Ventures. La liste des business angels ressemble à un bottin mondain de la conversation sur le coût de l’inférence, avec notamment Dwarkesh Patel, Naveen Rao et Sholto Douglas. L’équipe fondatrice vient de NVIDIA, AMD, Broadcom et Ayar Labs, avec à son actif les premiers travaux sur le premier produit CoWoS, des VCSEL accordables à haut volume et les débuts de l’optique co-packagée.
Le compromis avec lequel tout le monde a appris à vivre
Exécuter rapidement un grand modèle exige deux choses que le matériel n’a pas su fournir ensemble. Il faut une capacité énorme pour stocker les poids, et une bande passante énorme pour les alimenter en continu dans le moteur de calcul. Toutes les architectures en production aujourd’hui choisissent un camp.
La SRAM sur puce offre de la bande passante sans capacité, ce qui plafonne la taille des modèles et les fenêtres de contexte tout en augmentant le coût et l’énergie par token. La HBM et la mémoire des GPU offrent de la capacité sans assez de bande passante pour servir les plus grands modèles à grande vitesse. Même les approches plus récentes comme la DRAM 3D restent sur la même courbe, simplement plus loin sur celle-ci.
Volantis affirme que son premier système, A-1, est conçu pour accroître simultanément la capacité et la bande passante de près de deux ordres de grandeur. Cela lui permettrait d’exécuter des modèles dépassant 20 000 milliards de paramètres à jusqu’à 10 000 tokens par seconde et par utilisateur. Ce sont des objectifs de conception, annoncés par l’entreprise, sans vérification indépendante. À considérer comme une déclaration d’intention, pas comme un benchmark.
La raison pour laquelle ce compromis perdure depuis si longtemps est physique. La bande passante est limitée par la quantité de données pouvant franchir la frontière entre mémoire et calcul, et c’est à cette frontière que va en réalité la majeure partie de l’énergie d’un grand modèle. Déplacer les poids de la mémoire vers les unités arithmétiques coûte bien plus d’énergie que l’arithmétique elle-même. Toute architecture qui augmente la bande passante sans augmenter aussi ce coût gagne deux fois.

La photonique, braquée sur un problème plus difficile
La photonique déplace déjà des données dans les centres de données. Ce qui existe aujourd’hui est surtout de puce à puce. Relier le calcul à la mémoire est un problème différent, car cela exige que plus de cent fois plus de données parcourent des distances bien plus courtes. L’énergie et le coût ne se comportent pas de la même manière à cette échelle.
Volantis a conçu sa plateforme spécifiquement pour cet environnement. Plutôt que des lasers externes, elle utilise des micro-VCSEL personnalisés, en s’appuyant sur la chaîne d’approvisionnement existante de VCSEL en arséniure de gallium et en contournant les contraintes liées au phosphure d’indium qui ont étranglé d’autres conceptions optiques. L’entreprise affirme que les liaisons ainsi obtenues consomment moins d’un picojoule par bit.
La matrice optique mutualise de nombreuses puces mémoire en une seule ressource logique, de sorte qu’ajouter de la mémoire ajoute de la bande passante, et pas seulement de la capacité. C’est là l’astuce. C’est aussi la partie qui décidera si l’ensemble fonctionne, car mutualiser la mémoire à travers une interconnexion optique est précisément là où la latence et la tolérance aux pannes deviennent vraiment difficiles. Une seule liaison lente peut bloquer tout un pool, et une panne qui ferait tomber un module mémoire a désormais un rayon d’impact bien plus large.
Pourquoi ce moment n’est pas un hasard
Le marché visé par cette promesse a changé de forme au cours de l’année écoulée. Quand les modèles répondaient à des questions, l’inférence était bon marché et les pics d’activité étaient courts. À mesure que les agents s’attaquent à des tâches plus longues, durant plusieurs minutes ou heures d’affilée, la vitesse d’inférence cesse d’être un simple confort et devient un multiplicateur de débit. Un agent de codage qui termine une tâche en deux minutes au lieu de trente ne donne pas seulement l’impression d’être plus rapide. Il change le nombre d’idées qu’un développeur peut tester dans une journée.
Ce basculement explique pourquoi les investisseurs qui réfléchissent à l’économie de l’inférence continuent d’apparaître sur des tours comme celui-ci. Si les charges de travail des agents augmentent avec la vitesse du matériel sous-jacent, alors le matériel cesse d’être un coût de fond pour devenir ce qui détermine la vitesse d’exécution d’une entreprise. Dans ce monde, la bande passante mémoire n’est pas un chiffre sur une fiche technique. C’est un poste de coût dans la rapidité avec laquelle une entreprise peut agir.
À qui cela fait concurrence
Volantis n’est pas seul à s’attaquer au goulot d’étranglement de l’inférence, et les alternatives déterminent la façon dont ce pari doit être jugé. Les fabricants de GPU continuent de pousser la bande passante avec de nouveaux types de mémoire et de packaging, en pressant la même courbe plus fort. Les maisons de conception de puces courent après des accélérateurs spécialisés, ajustés à des formes de modèles spécifiques. Une refonte photonique leur fait concurrence à tous, et elle ne gagne que si elle déplace la courbe plutôt qu’un point sur celle-ci. La barre est haute, et c’est exactement pourquoi ce tour est notable : les investisseurs sérieux financent rarement ceux qui déplacent les courbes, sauf s’ils croient que l’approche dominante approche de sa limite.
Le vrai écart
Deux réserves s’imposent dans toute lecture équitable. La première est qu’A-1 n’existe pas encore. Volantis prévoit de livrer ses premiers moteurs d’inférence intégrés à des clients en 2027, ce qui laisse largement le temps à beaucoup de choses de mal tourner entre un tour de financement et un produit commercialisé. La seconde est que les chiffres sont ceux de l’entreprise, décrits comme des objectifs de conception. Il n’existe ni benchmark tiers ni client faisant tourner le système.
Cela ne rend pas le pari déraisonnable. Cela le rend précoce. Les délais dans les semi-conducteurs sont longs, et l’argent est dépensé en effectifs d’ingénierie et dans le chemin vers les premiers déploiements, pas dans le marketing d’un produit. Les 88 millions de dollars sont une piste de financement, pas une preuve.
Le mur de la mémoire en termes simples
Le mur de la mémoire est l’écart entre la vitesse à laquelle un processeur peut calculer et celle à laquelle il peut récupérer les données sur lesquelles il calcule. Dans l’IA moderne, l’arithmétique est rarement le goulot d’étranglement. C’est l’attente de l’arrivée des poids qui l’est. La conséquence est qu’une puce plus rapide, à elle seule, apporte bien moins que ce que la fiche technique laisse entendre, car la puce passe une grande partie de son temps à ne rien faire. Tout effort sérieux dans le matériel d’inférence est, sous une forme ou une autre, une attaque contre ce temps d’inactivité. Volantis l’attaque du côté de la mémoire plutôt que du calcul, ce qui est l’approche la moins encombrée et la plus difficile, car extraire de la bande passante du chemin mémoire-calcul signifie reconstruire le chemin lui-même plutôt que régler ce qui se trouve à chaque extrémité.
Ce qui le prouverait
Le jalon à surveiller n’est pas une annonce. C’est un client qui exécute un modèle qui ne tiendrait pas autrement, à une vitesse qui change ce qu’il peut faire. Si l’A-1 est livré et que l’affirmation sur la bande passante mémoire survit au contact d’une charge de travail réelle, le mur de la mémoire cesse d’être une fatalité pour devenir un problème résolu, avec un fournisseur associé.
D’ici là, le résumé honnête est que Volantis a levé des fonds sérieux auprès de personnes qui comprennent le problème, pour s’attaquer à la contrainte la plus difficile du matériel d’inférence, et a promis un système qui compterait beaucoup s’il voit le jour. Dans les semi-conducteurs, c’est à peu près ainsi que commence toute chose importante. C’est aussi ainsi que se terminent beaucoup de choses coûteuses.
Articles associés
Un semi-humanoïde à roues a terminé une heure de lessive sans aide
Des tâches individuelles peuvent réussir alors qu'un flux de travail échoue encore. Dyna a changé la métrique.
LTX 2.5 veut transformer votre brouillon Blender en un plan finalisé
En texte-vidéo, vous ne contrôlez pas ce qui se passe. Cet outil tente d'y remédier.
ServiceNow transforme les échecs des agents en données d'entraînement
La génération sans vérification est du bruit. Les portes sont le produit.
Un seul cadre pour le langage et la vision : le modèle ouvert 1,6B d’Horizon
Un pari : les ponts entre le langage et la vision n’ont jamais été nécessaires.