光子記憶體牆,就是 Volantis 剛下的 8,800 萬美元賭注

Volantis 的提案說來簡單,卻令人難以置信:打造一套能讓記憶體牆消失的推論系統。
這家舊金山半導體公司於 10 月 1 日完成 8,800 萬美元 A 輪募資,由 Lachy Groom 與 Abstract Ventures 共同領投,John Doerr、VXI Capital、Triatomic 與 Susa Ventures 參與。天使投資人名單宛如推論成本議題的名人錄,包括 Dwarkesh Patel、Naveen Rao 與 Sholto Douglas。創始團隊來自 NVIDIA、AMD、Broadcom 與 Ayar Labs,先前曾參與首款 CoWoS 產品、大量生產的可調式 VCSEL,以及早期共同封裝光學元件。
人人都已學會忍受的取捨
要快速執行大型模型,需要硬體至今無法同時提供的兩樣東西。你需要龐大的容量來存放權重,以及龐大的頻寬來持續把它們餵進運算引擎。現今每一種量產架構都只能選一邊。
晶片內 SRAM 提供頻寬卻沒有容量,這會限制模型大小與上下文視窗,同時提高每 token 的成本與能耗。HBM 與 GPU 記憶體提供容量,卻沒有足夠頻寬來高速服務最大型模型。即使是 3D DRAM 等較新做法,也只是沿著同一條曲線走得更遠。
Volantis 表示,其首套系統 A-1 的設計目標是同時把容量與頻寬提升近兩個數量級。這將讓它能以每使用者每秒最高 10,000 個 token 的速度,執行超過 20 兆參數的模型。這些是公司公布的設計目標,未經獨立驗證。請把它們視為意圖聲明,而非基準測試。
這種取捨之所以持續這麼久,原因在於物理。頻寬受限於有多少資料能跨越記憶體與運算之間的邊界,而大型模型的大部分能耗其實都花在這個邊界上。把權重從記憶體搬到算術單元所耗的電力,遠高於算術本身。任何能提高頻寬、卻不增加這項成本的架構,等於贏了兩次。

光子學,對準更難的問題
光子學早已在資料中心內搬移資料。現今存在的多半是晶片對晶片。連接運算與記憶體則是另一個問題,因為它要求超過百倍的資料量在短得多的距離內傳輸。在這樣的規模下,能耗與成本的行為會截然不同。
Volantis 專門為那樣的環境打造平台。它不使用外部雷射,而是採用客製化微型 VCSEL,倚賴現有的砷化鎵 VCSEL 供應鏈,並避開其他光學設計長久以來的磷化銦限制。該公司表示,由此產生的鏈路每位元耗能不到一皮焦耳。
這套光學互連架構將許多記憶體晶片匯集成單一邏輯資源,因此增加記憶體不只增加容量,也增加頻寬。這就是竅門。這也正是決定整套系統能否成功的關鍵,因為透過光學互連來匯集記憶體,正是延遲與容錯變得真正困難的地方。單一條慢速鏈路就可能拖住整個資源池,而原本只會讓一個記憶體模組故障的問題,如今波及範圍大得多。
為何時機絕非偶然
過去一年,這套提案所面對的市場已經改變了形狀。當模型只是回答問題時,推論很便宜,而且突發需求很短。隨著 AI 代理開始承擔更長的任務,一次執行數分鐘甚至數小時,推論速度不再只是便利性,而成為吞吐量的乘數。一個能在兩分鐘而不是三十分鐘完成任務的寫程式代理,不只是感覺更快。它會改變開發者一天能測試多少個想法。
這樣的轉變,正是關注推論經濟學的投資人會不斷出現在這類募資輪的原因。如果代理工作負載會隨著底層硬體的速度而擴展,那麼硬體就不再只是背景成本,而是決定公司運作速度的關鍵。在那樣的世界裡,記憶體頻寬不是規格表上的一個數字。而是企業能多快行動的一項要素。
這要和誰競爭
Volantis 並非唯一在攻擊推論瓶頸的公司,而各種替代方案會影響我們該如何評判這筆賭注。GPU 製造商持續以新的記憶體類型與封裝推升頻寬,在同一條曲線上更用力擠壓。晶片設計公司則追逐針對特定模型形狀調校的專用加速器。光子學大改造要與所有這些方案競爭,而它唯有移動整條曲線,而不只是曲線上的某一點,才算勝出。這是個很高的門檻,也正因如此,這輪募資才值得注意:認真的投資人很少資助能移動曲線的人,除非他們相信現行做法已接近極限。
誠實的落差
任何公平的解讀都該包含兩點但書。第一,A-1 尚未存在。Volantis 計劃在 2027 年向客戶交付首批整合式推論引擎,這讓募資輪到產品出貨之間留下了很多出錯的空間。第二,那些數字是公司自己的說法,被描述為設計目標。目前沒有第三方基準測試,也沒有客戶正在運行這套系統。
用白話解釋記憶體牆
記憶體牆是指處理器運算速度,與它抓取運算所需資料的速度之間的落差。在現代 AI 中,算術很少是瓶頸。等待權重送達才是。結果是,單靠更快的晶片,能帶來的效益遠低於規格表所暗示,因為晶片有許多時間都閒置。推論硬體領域每一項認真投入的努力,某種程度上都是在攻擊那段閒置時間。Volantis 是從記憶體端而非運算端發動攻擊,這是較不擁擠、也更困難的做法,因為要從記憶體到運算的路徑中榨出頻寬,意味著重建這條路徑本身,而不是調整兩端各自所在的元件。
什麼能證明這一切
值得關注的里程碑不是一則發布。而是有客戶能運行原本根本放不下的模型,並以改變他們能力範圍的速度運行。如果 A-1 出貨,而且記憶體頻寬的宣稱經得起真實工作負載的考驗,記憶體牆就不再是無可避免的現實,而會變成一個已有廠商提供解方的已解決問題。
在那之前,誠實的總結是:Volantis 從了解這個問題的人手中募得了可觀資金,去攻擊推論硬體中最艱難的單一限制,並承諾了一套若能實現就意義重大的系統。在半導體業,每一件重要的事大致都是這樣開始的。很多昂貴的事情也是這樣結束的。