Eine photonische Speicherwand ist die 88-Millionen-Dollar-Wette, die Volantis gerade eingegangen ist

Das Versprechen von Volantis ist einfach zu formulieren und schwer zu glauben: ein Inferenzsystem zu bauen, das die Speicherwand verschwinden lässt.
Das Halbleiterunternehmen aus San Francisco hat am 1. Oktober eine Series A über 88 Millionen US-Dollar abgeschlossen, gemeinsam geleitet von Lachy Groom und Abstract Ventures, mit Beteiligung von John Doerr, VXI Capital, Triatomic und Susa Ventures. Die Angel-Liste liest sich wie ein Who's Who der Debatte über Inferenzkosten, darunter Dwarkesh Patel, Naveen Rao und Sholto Douglas. Das Gründungsteam kommt von NVIDIA, AMD, Broadcom und Ayar Labs und war zuvor am ersten CoWoS-Produkt, an hochvolumigen, abstimmbaren VCSELs und an früher Co-Packaged-Optik beteiligt.
Der Kompromiss, mit dem alle zu leben gelernt haben
Ein großes Modell schnell auszuführen erfordert zwei Dinge, die Hardware bisher nicht gemeinsam liefern kann. Man braucht enorme Kapazität, um die Gewichte zu halten, und enorme Bandbreite, um sie kontinuierlich in die Rechen-Engine einzuspeisen. Jede heute in Produktion befindliche Architektur entscheidet sich für eine Seite.
On-Chip-SRAM liefert Bandbreite ohne Kapazität, was Modellgröße und Kontextfenster begrenzt und gleichzeitig Kosten und Energie pro Token erhöht. HBM- und GPU-Speicher liefern Kapazität ohne genügend Bandbreite, um die größten Modelle mit hoher Geschwindigkeit zu bedienen. Selbst neuere Ansätze wie 3D-DRAM bleiben auf derselben Kurve, nur weiter an ihr entlang.
Volantis sagt, sein erstes System, A-1, sei darauf ausgelegt, Kapazität und Bandbreite gemeinsam um fast zwei Größenordnungen zu steigern. Dadurch könne es Modelle mit über 20 Billionen Parametern mit bis zu 10.000 Token pro Sekunde pro Nutzer ausführen. Das sind Designziele, vom Unternehmen angekündigt, ohne unabhängige Überprüfung. Betrachten Sie sie als Absichtserklärung, nicht als Benchmark.
Der Grund, warum dieser Kompromiss so lange Bestand hat, ist Physik. Die Bandbreite ist dadurch begrenzt, wie viele Daten die Grenze zwischen Speicher und Recheneinheit überqueren können, und an genau dieser Grenze wird bei einem großen Modell tatsächlich der Großteil der Energie verbraucht. Das Verschieben von Gewichten aus dem Speicher zu den Rechenwerken kostet weit mehr Leistung als die Arithmetik selbst. Jede Architektur, die die Bandbreite erhöht, ohne auch diese Kosten zu erhöhen, gewinnt doppelt.

Photonik, auf ein schwierigeres Problem gerichtet
Photonik bewegt bereits Daten innerhalb von Rechenzentren. Was heute existiert, ist größtenteils Chip-zu-Chip. Recheneinheiten mit Speicher zu verbinden, ist ein anderes Problem, denn es verlangt, dass mehr als hundertmal so viele Daten über deutlich kürzere Strecken übertragen werden. Energie und Kosten verhalten sich in diesem Maßstab anders.
Volantis hat seine Plattform speziell für diese Umgebung gebaut. Statt externer Laser verwendet sie maßgeschneiderte Mikro-VCSELs, stützt sich auf die bestehende VCSEL-Lieferkette aus Galliumarsenid und umgeht die Indiumphosphid-Beschränkungen, die andere optische Designs ausgebremst haben. Das Unternehmen sagt, die resultierenden Verbindungen verbrauchten weniger als ein Pikojoule pro Bit.
Das optische Fabric bündelt viele Speicherchips zu einer einzigen logischen Ressource, sodass das Hinzufügen von Speicher Bandbreite und nicht nur Kapazität hinzufügt. Das ist der Trick. Es ist zugleich der Teil, der darüber entscheiden wird, ob das Ganze funktioniert, denn Speicher über ein optisches Interconnect zu poolen ist der Punkt, an dem Latenz und Fehlertoleranz wirklich schwierig werden. Eine einzige langsame Verbindung kann einen gesamten Pool aufhalten, und ein Fehler, der ein einzelnes Speichermodul lahmlegen würde, hat nun einen viel größeren Schadensradius.
Warum das Timing kein Zufall ist
Der Markt für dieses Versprechen hat im letzten Jahr seine Form verändert. Als Modelle Fragen beantworteten, war Inferenz billig und Lastspitzen waren kurz. Während Agenten längere Aufgaben übernehmen und dabei Minuten oder Stunden am Stück laufen, hört Inferenzgeschwindigkeit auf, ein Komfortgewinn zu sein, und wird zum Durchsatzmultiplikator. Ein Coding-Agent, der eine Aufgabe in zwei statt dreißig Minuten erledigt, fühlt sich nicht nur schneller an. Er verändert, wie viele Ideen ein Entwickler an einem Tag testen kann.
Diese Verschiebung ist der Grund, warum Investoren, die über Inferenzökonomie nachdenken, bei Runden wie dieser immer wieder auftauchen. Wenn Agenten-Workloads damit skalieren, wie schnell die zugrunde liegende Hardware ist, dann ist die Hardware keine Hintergrundkosten mehr, sondern das, was die Arbeitsgeschwindigkeit eines Unternehmens bestimmt. Speicherbandbreite ist in dieser Welt keine Zahl auf einem Datenblatt. Sie ist ein Posten in der Rechnung dafür, wie schnell ein Unternehmen handeln kann.
Mit wem das konkurriert
Volantis ist nicht allein damit, den Inferenz-Engpass anzugreifen, und die Alternativen prägen, wie die Wette beurteilt werden sollte. GPU-Hersteller treiben die Bandbreite mit neuen Speichertypen und Packaging weiter voran und pressen mehr aus derselben Kurve heraus. Chip-Designhäuser verfolgen spezialisierte Beschleuniger, die auf bestimmte Modellformen abgestimmt sind. Ein photonischer Umbau konkurriert mit all dem und gewinnt nur, wenn er die Kurve verschiebt und nicht nur den Punkt auf ihr. Das ist eine hohe Hürde, und genau deshalb ist die Runde bemerkenswert: Seriöse Investoren finanzieren selten Kurvenverschieber, es sei denn, sie glauben, dass der etablierte Ansatz nahe an seiner Grenze ist.
Die ehrliche Lücke
Zwei Vorbehalte gehören in jede faire Betrachtung. Die erste ist, dass A-1 noch nicht existiert. Volantis plant, seine ersten integrierten Inferenz-Engines im Jahr 2027 an Kunden auszuliefern, was viel Raum dafür lässt, dass zwischen einer Finanzierungsrunde und einem auslieferungsfähigen Produkt einiges schiefgeht. Die zweite ist, dass die Zahlen vom Unternehmen selbst stammen und als Designziele bezeichnet werden. Es gibt keinen Benchmark eines Dritten und keinen Kunden, der das System betreibt.
Das macht die Wette nicht unvernünftig. Es macht sie früh. Halbleiter-Zeitpläne sind lang, und das Geld wird in Engineering-Personal und den Weg zu ersten Deployments gesteckt, nicht in die Vermarktung eines Produkts. Die 88 Millionen US-Dollar sind Runway, kein Beweis.
Die Speicherwand in einfachen Worten
Die Speicherwand ist die Kluft zwischen der Geschwindigkeit, mit der ein Prozessor rechnen kann, und der Geschwindigkeit, mit der er die Daten herbeischaffen kann, mit denen er rechnet. In der modernen KI ist die Arithmetik selten der Engpass. Das Warten auf die Gewichte ist es. Die Folge ist, dass ein schnellerer Chip für sich genommen weit weniger bringt, als das Datenblatt suggeriert, weil der Chip einen Großteil seiner Zeit im Leerlauf verbringt. Jede ernsthafte Anstrengung bei Inferenz-Hardware ist in irgendeiner Form ein Angriff auf diese Leerlaufzeit. Volantis greift sie von der Speicherseite statt von der Rechenseite an, was der weniger überfüllte und der schwierigere Ansatz ist, denn aus dem Speicher-zu-Rechen-Pfad Bandbreite herauszuholen bedeutet, den Pfad selbst neu zu bauen, statt abzustimmen, was an beiden Enden sitzt.
Was es beweisen würde
Der Meilenstein, auf den man achten sollte, ist keine Ankündigung. Es ist ein Kunde, der ein Modell ausführt, das sonst nicht passen würde, mit einer Geschwindigkeit, die verändert, was er tun kann. Wenn die A-1 ausgeliefert wird und die Speicherbandbreiten-Behauptung den Kontakt mit einer echten Workload übersteht, hört die Speicherwand auf, eine Tatsache des Lebens zu sein, und wird zu einem gelösten Problem mit einem Anbieter daran.
Bis dahin lautet die ehrliche Zusammenfassung, dass Volantis ernsthaftes Geld von Leuten eingesammelt hat, die das Problem verstehen, um die härteste einzelne Einschränkung in Inferenz-Hardware anzugreifen, und ein System versprochen hat, das sehr viel bedeuten würde, wenn es kommt. In der Halbleiterbranche fangen so ungefähr alle wichtigen Dinge an. Und so enden auch viele teure Dinge.
Verwandte Artikel
Ein Halbhumanoid auf Rädern erledigte eine Stunde Wäsche ohne Hilfe
Einzelne Aufgaben können erfolgreich sein, während ein Workflow trotzdem scheitert. Dyna hat die Kennzahl geändert.
LTX 2.5 will deinen blockigen Blender-Entwurf in eine fertige Einstellung verwandeln
Du hast keine Kontrolle darüber, was im Text-zu-Video passiert. Das hier versucht, das zu beheben.
ServiceNow macht aus Agenten-Fehlern Trainingsdaten
Generierung ohne Verifikation ist Rauschen. Die Gates sind das Produkt.
Ein Framework für Sprache und Vision: Horizons offenes 1,6-Milliarden-Modell
Eine Wette darauf, dass die Brücken zwischen Sprache und Vision nie nötig waren.