← 返回博客
Ai预计阅读 10 分钟

哔哩哔哩在 Apache-2.0 许可下开源 150 语言翻译模型家族

发布于 2026年10月2日
哔哩哔哩在 Apache-2.0 许可下开源 150 语言翻译模型家族

哔哩哔哩的 Index LLM 团队于 9 月 30 日发布了 Index-Translate,这是一个基于阿里巴巴 Qwen3.5 构建的多语言翻译模型家族。文本模型覆盖 150 种语言,其中包括中文和英文,并以 Apache-2.0 许可在 Hugging Face 和 ModelScope 上发布,提供 2B、9B 和 35B-A3B 三种规模,其中最后一个仍处于预览阶段,同时发布的还有一份技术报告、GitHub 上的代码以及一个在线演示。

来自一家视频平台的翻译模型家族值得再看一眼,因为它说明了该平台实际需要什么。哔哩哔哩是一个有着浓厚字幕文化、并且对跨越语言边界的内容需求日益增长的中国视频社区。对这样一家公司来说,翻译是基础设施,而不是副业项目。

它为何不止是一个翻译模型

最直观的部分是语言数量,这个数字很高,但并非史无前例。Index-Translate 的独特之处在于,它在很大程度上是围绕翻译中那些不属于翻译本身的部分来设计的。

这些模型能够遵循关于术语、格式以及必须保持原样不改动的内容的指令。在项目页面上的一个示例中,9B 模型将一条 JSON 格式的游戏维护公告翻译成韩语,同时保留了其结构、星号符号以及用户要求保留的话题标签。这听起来不算什么。任何运行过真正本地化流水线的人都知道并非如此。标记、占位符、产品名称、法律套话和行内格式,正是机器翻译最常出错的地方,而事后清理这些内容所耗费的时间,正是自动化本应节省下来的时间。

处理好这些约束,才能让一个模型从演示品变成可以接入生产环境的东西。一个把 JSON 结构搞乱的翻译器毫无用处,无论那句韩语有多流畅。

三个分支,以及它们为何重要

该家族将同一个多语言基座扩展到了三个专门方向,而这些分支才是这次发布真正有趣的地方。

Index-Echo 可生成保留原始说话人声音特征的翻译字幕或配音语音。其打包发布的语音到语音版本覆盖中文到英语、西班牙语和日语,以及反向翻译。保留声音的配音是一个难题,它处于语音识别、翻译、声音克隆和语音合成的交汇处,而错误会在每个阶段层层累积。让一个声音在另一种语言中听起来还是同一个人,决定了观众是接受一段配音还是直接关掉它。

Index-Homura 会将译文调整至目标音节数。这是大多数翻译系统完全忽略的配音和字幕约束。当你需要让文字匹配一张开合的嘴或一个固定的字幕窗口时,一个完全准确但长了 40% 的译文就是失败的译文。在保留含义的同时约束长度,正是那种能将研究模型与制作团队可用的工具区分开来的、狭窄而实际的问题。

Index-NativeLong 以名为 Index-Nailong 的模型 ID 发布,可翻译整份文档并保持其中引用的一致性。文档级一致性解决了另一个常见故障:同一个术语在第二页是一种译法,到第九页又变成另一种译法,因为每一句都是孤立翻译的。对于手册、合同和长文本内容而言,这种不一致是正确性问题,而不是风格偏好。

选择开放许可,以及它释放的信号

以 Apache-2.0 而非仅限研究或非商业许可发布,是一个重要的决定。这意味着任何人都可以基于这些模型进行商业开发,包括用于与打造它们的平台相竞争的产品。这是一种广泛宽松的立场,而且在中国实验室于这一轮周期中发布模型时,它正日益成为默认选项。

这种模式整个月都清晰可见。9 月有多家中国团队发布了开放权重的模型,涵盖文本、图像生成、视频和翻译,而共同点是宽松:这里 MIT,那里 Apache-2.0,权重可下载而非租用。其战略逻辑是一致的。开放权重比单纯的 API 能更快地建立生态采用,而采用会带来一种开发者引力,并在下一代产品中得到回报。

基于 Qwen3.5 构建而非从零训练也颇具意味。Qwen 已成为不少中国模型发布接近共享基座的存在,就像 Llama 曾经在西方那样。当多个独立团队汇聚到同一个基座模型上时,这个基座就成了事实标准,而让它们彼此区分的工作则向上移动到技术栈中,进入像 Index-Translate 所包含的这些专门分支。

本地化是视频工作中安静的成本中心之一,而且一直很难在不牺牲质量的情况下实现自动化。字幕和配音各自施加自己的约束,而忽视这些约束的流水线产出的内容需要人工逐行修复。通过将保留声音的配音和受音节数约束的翻译与通用文本模型打包在一起,这次发布直接瞄准了那个修复环节。它究竟是消除了这个环节,还是仅仅缩小了它,只有真正的本地化工作流才能揭示,但其意图是清晰的:让机器的输出足够接近可用,使人的工作从重写变成审校。

它对中国以外的地区意味着什么

对于中国生态系统之外的团队来说,实际后果是获取权。一个许可宽松、覆盖 150 种语言、带有语音和文档分支、可下载并在本地运行的翻译模型家族,对于任何将本地化构建进产品的人来说都是真正有用的资产,尤其是在出于隐私或成本原因不能把源文本发送给托管 API 的情况下。

语音分支尤其值得任何从事视频工作的人关注。保留声音的配音和受音节数约束的翻译,是决定自动化本地化产出的是可观看内容,还是需要人工修复每一行的内容的两种能力。一个能同时处理这两者、且以 Apache-2.0 许可发布的模型,降低了小团队本地化视频内容的门槛——这样的内容此前需要一笔配音预算。

需要提醒的问题是新发布模型常见的那些。已发布的基准测试来自构建这些模型的团队,而独立评估需要时间。35B-A3B 预览版与完成版模型不是一回事。而且宽松许可并不会自动使某个模型成为特定语言对或领域的最佳选择。这仍然需要针对你自己的内容进行测试。

清晰的是方向。翻译正在被重建为一组受约束的、遵循指令的任务,而不是单一的开放式任务,而胜出的模型将是那些尊重字幕、配音和文档结构这些棘手现实的模型。Index-Translate 正是一发瞄准这些现实的精准射击,而且可以免费在其基础上构建。

相关文章