InternLumina-U2 將文字、圖像、影片與 3D 整合進單一 16B 模型,並釋出兩套權重

統一的多模態模型通常得做取捨:涵蓋的任務很多,卻沒有一項精通。InternLumina-U2 試圖在較小的參數預算下檢驗這個假設,而它的發布方式所透露的策略意涵,並不亞於其架構本身。
InternLM 以 Apache 2.0 授權在 Hugging Face 上釋出這個模型。它是一個 16B 參數的混合專家(MoE)模型,每個 token 僅有 1B 活躍參數,寫作 16B-A1B。它將稀疏骨幹網路與建構於名為 AToken 之上的 8 本碼簿(codebook)全離散視覺表徵搭配起來,並在單一模型中處理文字問答、文字生圖、圖像理解、圖像編輯、影片理解與 3D 理解。
更有意思的細節藏在任務清單之下:這次釋出包含分別針對華為昇騰(Ascend)NPU 與 NVIDIA GPU 的獨立檢查點(checkpoint)。
統一模型究竟替你省下了什麼
支持統一的理由在於維護成本。一支打造同時能理解與生成圖像之產品的團隊,通常會用一個模型做理解、另一個模型做生成,接著得維護兩條推論路徑、兩套提示詞與兩個升級週期。把理解與生成收攏進同一個框架,能移除部分這類額外負擔;而把同一套框架延伸到影片與 3D,則會進一步放大這個好處。
達成方式背後的機制同樣重要。全離散視覺表徵意味著圖像會被切分(tokenize)進一組學習而得的碼簿,在此例中是建構於 AToken 之上的八本。這把圖像與影片理解推向更接近語言模型本來就懂得處理的 token 序列形式,也正是這一點讓單一骨幹能橫跨這麼多模態變得可行。

統一做法在這個規模下能否與專門模型匹敵,仍是未解的問題。Apache 2.0 消除了法律上的摩擦,但寬鬆授權並不能回答:單一條 1B 活躍參數的路徑,生成圖像的表現能否與專門打造的圖像模型相當。技術報告標示為即將發布,目前可得的基準數據屬初步性質,且由公司自行提報。在獨立評測出爐之前,這個說法仍未被證實。
為什麼雙硬體檢查點比表面上看來更重要
同時釋出昇騰與 NVIDIA 檢查點,是一項關於部署的宣示,而非單純的便利之舉。
中國的 AI 實驗室一直在取得先進晶片受限的環境下發展,其因應之道就是針對能取得的硬體全力最佳化。釋出同時能在華為昇騰 NPU 與 NVIDIA GPU 上運行的權重,意味著中國境外的團隊可以先在 NVIDIA 硬體上起步,日後再轉移到昇騰,而不必更換模型。這也意味著已採用昇騰的中國本土企業,無須購買新的加速器就能導入該模型。
這樣的轉換成本比聽起來更低。硬體決策具有黏著性,而一個同時相容兩套技術堆疊的模型,移除了原本會讓團隊留在現有供應商的一道障礙。對於在任一邊已有既有基礎設施的企業而言,這次釋出的重點不在基準分數,而在於它能否直接嵌入已經上架運轉的設備之中。
把背景納入考量,這一點就更為鮮明。中國的實驗室越來越常以釋出開放權重來競爭,而不只是販售封閉 API,而這套策略邏輯是雙向的。開放權重比封閉端點更快擴散採用率與制定標準的影響力。它們也讓本土硬體供應商能指著真正在其晶片上跑得好的模型說話——當替代方案只能在真空中自證時,這一點格外有用。
與更嚴苛授權的對照
一個有用的對照是另一個近期推出的開放圖像模型。Qwen-Image-2.1 釋出了 7B 檢查點,統一了文字生圖與編輯,可原生輸出帶 alpha 通道的 RGBA,並可接受最多 10 張參考圖像。它在兩個 Artificial Analysis 排行榜上於開放權重模型中名列第一。不過其權重是以嚴格的禁止商用授權釋出,這意味著商業專案必須走官方 API。
InternLumina-U2 則以 Apache 2.0 走相反的路。這讓它可直接用於商業產品,也讓該模型處於不同的競爭位置:這些是企業能合法在其上開發、無須進行授權協商的權重,即使它們並未站上排行榜首位。
值得理解的架構取捨
有兩項設計決策承載了大部分的重量。
第一是稀疏混合專家骨幹。總參數為 16B,每個 token 僅 1B 活躍,推論成本取決於活躍參數集合而非整個模型。這正是讓一個廣泛的多任務模型得以用可負擔的成本提供服務的原因,因為對任何給定輸入而言,網路中有很大一部分都處於閒置狀態。
第二是離散視覺表徵。AToken 上的 8 碼簿方案,既是建模決策,也同樣是壓縮決策。碼簿越少、組織得越好,代表每一步要預測的視覺資訊越少,這在活躍參數規模小、無法用算力換取品質的情況下特別有幫助。
這兩項選擇本身都算不上新穎。真正的賭注在於:在這個規模下把它們結合起來,能產生一個跨模態真正有用的模型,而不是一個樣樣通卻在實際工作中被繞道而過的雜而不精者。
為什麼發布形式本身就是訊息
任務清單雄心勃勃,但對於任何要決定在其上打造什麼的人來說,發布形式所承載的訊號更多。其中有三項選擇格外突出。
第一是規模。以當前開放權重競賽的標準來看,16B 總參數、1B 活躍參數的模型算是小的——前沿實驗室正在釋出 744B、甚至 2.8 兆參數的模型。一個能在容易取得的硬體上便宜運行的小模型,與一個需要整個叢集的大模型是不同的產品。它鎖定的是那些無法用錢買到能力的團隊,他們需要的是能經濟地提供服務的東西。
第二是授權。Apache 2.0 是允許商業使用、無須協商的寬鬆授權;對於正在決定能否以某個模型為基礎推出產品的企業而言,這比基準分數更重要。分數亮眼但授權嚴苛的模型,是你得繞道 API 使用的模型。授權寬鬆的模型,則是可以直接嵌入的模型。
第三是模態組合。多數被冠上「統一」之名的模型只涵蓋文字與圖像。把影片與 3D 理解加入同一框架,才讓這個詞名副其實,但風險也正在此處:一組小的活躍參數要服務的模態越多,分攤到各模態的容量就越稀薄。
綜合來看,這次釋出讀起來像是在賭部署現實,而非排行榜名次:小到足以提供服務、寬鬆到足以出貨、廣到足以取代管線中的好幾個模型。
值得觀察的重點
有三件事將決定這次釋出會如何被評價。技術報告問世時,理應附上完整的基準表格,而這些數字需要經過獨立複現才具有份量。第二是統一這條路在生成方面是否特別站得住腳,因為那正是專門模型最具優勢的領域。第三是硬體。如果昇騰檢查點在實務上證明具競爭力,雙硬體釋出就會成為一種範本,更多中國實驗室將預設釋出能同時運行於兩套堆疊的權重。
就目前而言,這次釋出最好被解讀為一份意圖聲明。中國的實驗室正同時在開放權重、硬體彈性與寬鬆授權三條戰線上競爭,而 InternLumina-U2 把這三者放進了同一張模型卡裡。