Reflection AI 剛推出 Beam:號稱是美國回應中國實驗室的 501B 開放權重模型

10 月 5 日,Reflection AI 揭曉了旗下首款開放權重模型 Beam,並以毫不掩飾的地緣政治措辭來包裝這次發布。這家總部位於紐約的新創公司由兩名前 DeepMind 研究員於 2024 年創立,將 Beam 稱為一款主力模型,適合企業、政府和開發者使用,讓他們能執行並客製化前沿級模型,而不必依賴中國的權重。
Beam 是稀疏專家混合(MoE)系統,總參數量達 5010 億,每項任務啟用 230 億參數。Reflection 計劃於本月稍晚以 Apache 2.0 授權發布權重,同時一併發布技術報告與模型卡。目前該模型處於早期存取階段,且獨立基準測試尚未公開。
最後這點決定了我們該如何解讀這項公告。
數字實際上說明了什麼
該公司自家的比較將 Beam 放在 Z.ai 的 GLM-5.2 附近,並在程式編寫與代理式(agentic)任務上接近阿里巴巴的 Qwen 3.8-Max。以參數量而言,這是合理的比較。GLM-5.2 總參數約 7440 億,啟用參數 400 億,因此 Beam 是較小的網路,每個 token 啟用的專家較少。

效率方面的說法更有意思。執行長 Misha Laskin 向 Semafor 表示,Beam 推理一個問題所需的運算量,比同級開放模型少三到四倍。如果此言屬實,這比排行榜名次更重要,因為執行模型的成本,才決定了有沒有人會持續使用它。
Reflection 在上一輪募資中,以 250 億美元的投前估值完成融資,投資人包括 Nvidia、Sequoia 和 Citigroup。據報導,Nvidia 的投資金額為 8 億美元,這讓一家硬體供應商同時站在開放權重論戰的兩邊:人們執行的模型越多,購買的晶片就越多。
為何美國開放模型也是硬體故事
過去兩年,開放權重一直是中國的強項。DeepSeek、Qwen、Kimi 和 GLM 樹立了每美元效能的標竿,西方企業開始把重複性工作交給它們處理,從客服到例行性程式碼生成皆然。這種採用形成了尷尬的依賴關係。一家無法檢查或自行託管其所依賴模型的公司,對自身技術堆疊的掌控有限。
Beam 正是直指這個缺口。Laskin 對 Semafor 的推銷說得很直白:那些正在打造主權 AI 系統、不願或不能使用中國模型的組織,「今天其實沒有很好的選擇」。
在此之上還有一層安全考量。美國與英國政府評估人員發現,近期中國的開放模型可能協助攻擊者利用程式碼漏洞。無論這項發現是決定性的還是言過其實,它都給了西方買家一個理由,願意為本國訓練的替代方案支付溢價,也讓 Reflection 有了一套能在華府訴說的監管論述。
Beam 進入的戰場
Reflection 並非第一家嘗試此路線的西方實驗室。Thinking Machines Lab 和 Mistral 也發布開放權重模型,而且都已占有一席之地。Beam 的差異在於規模與定位框架。它擁有 5010 億總參數、230 億啟用參數,鎖定的是前沿層級,而非多數西方開放模型競爭的高效率助手層級。
這個層級的經濟效益非常嚴苛。如此規模的模型,服務成本所費不貲,而可能採用它的企業,既在意每美元吞吐量,也同樣在意基準測試排名。這就是為什麼效率主張是 Reflection 推銷的核心,也是為什麼它最需要被驗證。一款品質能與 GLM-5.2 匹敵、但服務成本相同的模型,會消除買家從中國模型轉換過來的主要理由。
授權選擇透露了意圖。Apache 2.0 允許商業使用、修改與再散布,義務極少,當目標是採用而非控制時,就會選擇這種授權。若實驗室想直接將權重變現,會採用限制更多的授權。Reflection 押注的是,在基礎設施層普及,比把這個成品當作守門資產更有價值。
底下也還有算力故事。Reflection 與 SpaceX 簽約,取得 Colossus 2 資料中心的容量,並與美國能源部建立合作關係。這些安排對一家訓練如此規模模型的公司很重要,也讓這家新創與一系列公私機構綁在一起,而這些機構各有理由想要中國權重的本土替代方案。
仍屬宣稱的部分
上述一切全都建立在 Reflection 自家的評估上。第三方基準測試在發表時並未公開,權重也尚未發布。一款在供應商測試中勝過對手的模型,和一款在生產流程中勝過對手的模型,是兩回事。
與 GLM-5.2 的比較,也比框架所暗示的更狹窄。在程式編寫與代理式任務上追平一款中國模型,同時在同一軸向上接近另一款,若結果能複現,確實是真實成果。但這不等於在整個開放權重領域都達到競爭力上的平起平坐;該領域涵蓋的模型,在強項、授權和部署型態上差異極大。
Reflection 表示,它已在訓練一款後續模型,威力將會「強大得多」。這話說得合情合理,卻很難驗證。
時機並非偶然
Beam 問世的時機,正處於一個特定的監管時刻。整個夏季一連串涉及自主模型的安全事件,把 AI 監管推上政治議程,而美國主要實驗室在白宮會議後簽署了一項自願安全協議。該協議仰賴企業自我監督,而非聯邦法規,而圍繞它的政治盤算,可能隨 11 月期中選舉而改變。
Reflection 表示,此刻投入開放權重業務的理由,是要在那場對話中取得一席之地。Laskin 告訴 Semafor,公司希望開放模型的建構者能為監管辯論做出貢獻,論點是開放與封閉開發者都應與政府合作,而不是被政府從外部監管。一款西方企業與機構能自行執行的開放模型,在這場辯論中就是具體論據,這是政策白皮書做不到的。
這樣的定位也說明了,為何該公司正與美國「促進超級智慧創新與標準中心」(Center for Advancing Innovation and Standards for Super Intelligence)及英國 AI 安全研究所合作,評估這款模型。取得獨立安全評估,是先發制人回應開放權重最響亮反對意見的方法,也就是釋出權重會移除監督。
值得觀察的重點
三個訊號將決定答案。
第一是權重本身。Apache 2.0 允許商業使用與修改,附帶條件極少,對一家試圖孕育生態系的公司而言,這是刻意採取的寬鬆選擇。釋出的成品是否符合基準測試所宣稱的表現,是第一個考驗。
第二是第三方評估。效率主張能否被獨立複現,或無法複現,對採用情況的影響,都會比任何一篇發布文章更大。
第三是企業行為。企業花了一年時間學會把例行工作導向便宜模型,並把前沿模型保留給困難問題。如果 Beam 在成本與能力上落在這兩個層級之間,它就有市場。如果它更靠近昂貴的一端,又沒有決定性的品質優勢,地緣政治也撐不起它。
開放權重競賽同時是價格的向下競爭,也是能力的向上競爭。Reflection 正以一款鼓勵複製的授權,以及一項鼓勵實測的主張,同時投入這兩場競賽。該公司已經說了正確的話。現在,得由權重來說這些話了。
相關文章
Cloudflare 推出 270 億參數決策模型,在 Jev 的主場擊敗 Jev
有些模型呼叫應該回傳一個數字,而不是一段文字。一個類別正圍繞這個想法成形。
BOSSFIGHT 讓前沿模型當了 24 週咖啡店老闆,多數輸給了「什麼都不做」
在測驗中拒絕賄賂,與在真實季度中拒絕妥協,是兩種不同的能力,而目前的評測往往只衡量了較容易的那一種。
NASA 與 IBM 開源了以 17 年軌道器資料訓練的月球基礎模型
該模型對於尋找和描述特徵很有用,但對於高精度地指出它們的確切位置則不可靠。
四步取代四十步:蒸餾如何把開放圖像模型塞進消費級 GPU
低步數蒸餾是一種取捨,而非免費午餐。文字保真度、編輯精確度與多參考一致性是最先受影響的部分。