Bilibili 以 Apache-2.0 授權開源 150 語言翻譯模型系列

Bilibili 的 Index LLM 團隊於 9 月 30 日發布 Index-Translate,這是一系列以阿里 Qwen3.5 為基礎打造的多語言翻譯模型。文字模型涵蓋 150 種語言,包含中文與英文,並以 Apache-2.0 授權在 Hugging Face 與 ModelScope 上發布,提供 2B、9B 與 35B-A3B 三種規模,其中 35B-A3B 仍處於預覽階段,同時附上技術報告、GitHub 程式碼與線上 demo。
來自影片平台的翻譯模型系列值得多看一眼,因為這說明了該平台真正需要什麼。Bilibili 是中國的影片社群,擁有濃厚的字幕文化,對跨語言內容的需求也日益增長。對這樣一家公司而言,翻譯是基礎設施,而不是附帶的專案。
它為什麼不只是個翻譯模型
最直觀的部分是語言數量,這個數字很高,但並非前所未見。Index-Translate 的獨特之處,在於它在多大程度上是針對「翻譯以外」的那些環節來設計的。
這些模型能遵循關於術語、格式,以及必須保持原樣之內容的指令。在專案頁面上的一個例子中,9B 模型將一則 JSON 格式的遊戲維護公告翻譯成韓文,同時保留了其結構、星號符號,以及使用者要求保留的 hashtag。這聽起來沒什麼。但任何實際跑過本地化流程的人都知道,這絕非小事。標記、佔位符、產品名稱、法律樣板文字與行內格式,正是機器翻譯最常出錯的地方,也正是事後清理會吃掉自動化原本應該省下的時間的地方。
能否處理這些限制,正是模型從 demo 變成可接入生產環境的關鍵。一個會把 JSON 結構搞得亂七八糟的翻譯器,無論韓文句子多流暢,都無法使用。
三個分支,以及它們為何重要
這個系列將同一個多語言基礎延伸至三個專門方向,而這些分支正是這次發布真正有意思的地方。
Index-Echo 能產生保留原說話者聲音特徵的翻譯字幕或配音語音。其封裝好的語音轉語音版本涵蓋中文對英文、西班牙文與日文,以及反向翻譯。保留聲音的配音是個艱難問題,位於語音辨識、翻譯、聲音複製與語音合成的交會處,而每個階段的誤差都會層層累積。能讓聲音在另一種語言裡聽起來像同一個人,正是觀眾願意接受、還是直接關掉的配音之間的差別。
Index-Homura 會調整譯文以趨近目標音節數。這是大多數翻譯系統完全忽略的配音與字幕限制。當你要把字詞塞進動個不停的口型或固定長度的字幕框時,一個完全精準但長了 40% 的翻譯就是失敗的翻譯。在保留語意的同時限制長度,正是那種狹隘卻實用的問題,而它區分了研究模型與製作團隊真正能用的工具。
Index-NativeLong 以名為 Index-Nailong 的模型 ID 發布,能翻譯整份文件並維持其中各處指涉的一致性。文件層級的一致性解決了另一個常見的失誤:同一個術語在第二頁譯成一種說法,在第九頁又變成另一種,因為每一句都是被孤立地翻譯。對操作手冊、合約與長篇內容而言,這種不一致是正確性問題,而不是風格偏好。
選擇開放授權,以及它傳達的訊號
以 Apache-2.0 而非僅限研究或非商業授權發布,是個重要的決定。這意味著任何人都能在這些模型上進行商業開發,包括打造與模型開發平台競爭的產品。這是相當寬容的立場,而在這一波發布模型的中國實驗室之間,它正日益成為預設做法。
這個模式整個月都清晰可見。九月有多個中國團隊發布了開放權重模型,橫跨文字、圖像生成、影片與翻譯,而共同的脈絡就是寬容授權:這裡用 MIT,那裡用 Apache-2.0,權重可以下載而非租用。其策略邏輯是一致的。開放權重比單純提供 API 更能快速建立生態系的採用,而採用會形成一種開發者引力,在下一代產品中回報。
以 Qwen3.5 為基礎而非從零訓練,也頗具意義。Qwen 對許多中國模型發布而言,已接近一種共享的基底,就像 Llama 曾經在西方那樣。當多個獨立團隊匯聚到同一個基礎模型上,這個基礎就成了事實上的標準,而區分彼此的工夫則向上移到堆疊上層,進入像 Index-Translate 所含的這類專門分支。
本地化是影片工作中安靜的成本中心之一,而且一直很難在不讓品質崩壞的前提下自動化。字幕與配音各有各自的限制,忽略這些限制的流程只會產出得靠人力逐行修補的結果。這次發布把保留聲音的配音與受音節數限制的翻譯,和通用文字模型一起打包,直接瞄準了那道修補工序。它究竟能移除這道工序,或只是縮小它,只有真實的本地化工作流程才能揭示,但其意圖清楚可讀:讓機器的產出接近可用,使人的工作從重寫變成審閱。
對中國以外地區的意義
對中國生態系以外的團隊而言,實際的結果就是取用門檻降低。一個授權寬容、涵蓋 150 種語言、具備語音與文件分支、可下載並在地端執行的翻譯模型系列,對任何要把本地化做進產品的人來說都是真正有用的資產,尤其是在基於隱私或成本考量而無法把原文送往託管 API 的情況下。
從事影片工作的人尤其應該關注語音分支。保留聲音的配音與受音節數限制的翻譯,這兩項能力決定了自動化本地化產出的東西是能看的,還是每一行都得靠人修的。一個在 Apache-2.0 授權下同時處理這兩者的模型,降低了小型團隊將影片內容本地化的門檻,而這類內容過去往往需要一筆配音預算。
要注意的地方,跟任何剛發布的東西一樣。公布的基準測試來自打造這些模型的團隊,而獨立評測需要時間。35B-A3B 預覽版不等於完成版。寬容的授權也不會自動讓一個模型成為特定語言組合或領域的最佳選擇。這仍然得用你自己的內容去測試。
清楚的是方向。翻譯正被重新建構為一組受限制、需遵循指令的任務,而不是單一開放式的任務,而勝出的模型將會是那些尊重字幕、配音與文件結構這些棘手現實的模型。Index-Translate 正是針對這些現實的一次精準出擊,而且可以免費在其之上開發。