← Voltar ao blog
Aicerca de 7 min de leitura

Bilibili disponibiliza em código aberto uma família de tradução para 150 idiomas sob Apache-2.0

Publicado 2 de out. de 2026
Bilibili disponibiliza em código aberto uma família de tradução para 150 idiomas sob Apache-2.0

A equipe Index LLM da Bilibili lançou o Index-Translate em 30 de setembro, uma família de modelos de tradução multilíngues construída sobre o Qwen3.5, da Alibaba. Os modelos de texto abrangem 150 idiomas, incluindo chinês e inglês, e são publicados sob a licença Apache-2.0 no Hugging Face e no ModelScope nos tamanhos 2B, 9B e 35B-A3B, sendo este último ainda uma prévia, junto com um relatório técnico, código no GitHub e uma demonstração online.

Uma família de modelos de tradução vinda de uma plataforma de vídeo merece uma segunda olhada, porque diz algo sobre o que a plataforma realmente precisa. A Bilibili é uma comunidade chinesa de vídeos com uma forte cultura de legendas e um apetite crescente por conteúdo que atravessa fronteiras linguísticas. Para uma empresa assim, tradução é infraestrutura, e não um projeto paralelo.

O que a torna mais do que um modelo de tradução

A parte mais óbvia é o número de idiomas, que é alto, mas não inédito. O que diferencia o Index-Translate é o quanto ele foi projetado em torno das partes da tradução que não são tradução.

Os modelos seguem instruções sobre terminologia, formatação e conteúdo que deve ser deixado intacto. Em um exemplo da página do projeto, o modelo 9B traduziu um aviso de manutenção de jogo em JSON para coreano, preservando sua estrutura, seus símbolos de estrela e uma hashtag que o usuário pediu para manter. Parece modesto. Qualquer pessoa que já tenha operado um pipeline real de localização sabe que não é. Marcação, espaços reservados, nomes de produtos, textos jurídicos padronizados e formatação embutida são onde a tradução automática mais frequentemente quebra as coisas, e onde a limpeza posterior consome o tempo que a automação deveria economizar.

Lidar com essas restrições é o que transforma um modelo de demonstração em algo que você pode integrar à produção. Um tradutor que deturpa uma estrutura JSON não é utilizável, por mais fluente que seja a frase em coreano.

Os três ramos, e por que eles importam

A família estende a mesma base multilíngue em três direções especializadas, e esses ramos são onde o lançamento fica genuinamente interessante.

O Index-Echo produz legendas traduzidas ou fala dublada que mantém as características de voz do falante de origem. Seu lançamento empacotado de fala para fala cobre chinês para inglês, espanhol e japonês, e o inverso. A dublagem que preserva a voz é um problema difícil que fica na interseção de reconhecimento de fala, tradução, clonagem de voz e síntese de fala, e os erros se acumulam em cada etapa. Fazer uma voz soar como a mesma pessoa em outro idioma é a diferença entre uma dublagem que os espectadores aceitam e uma que eles desligam.

O Index-Homura ajusta uma tradução para uma contagem-alvo de sílabas. Essa é uma restrição de dublagem e legendagem que a maioria dos sistemas de tradução ignora completamente. Quando você está encaixando palavras em uma boca em movimento ou em uma janela fixa de legenda, uma tradução perfeitamente precisa que é 40 por cento longa demais é uma tradução fracassada. Restringir o comprimento enquanto preserva o significado é exatamente o tipo de problema restrito e prático que separa um modelo de pesquisa de uma ferramenta que uma equipe de produção pode usar.

O Index-NativeLong, publicado sob IDs de modelo chamados Index-Nailong, traduz documentos inteiros e mantém as referências consistentes entre eles. A consistência em nível de documento aborda outra falha comum: um termo traduzido de uma maneira na página dois e de outra na página nove, porque cada frase foi traduzida isoladamente. Para manuais, contratos e conteúdo de formato longo, essa inconsistência é um problema de correção, não uma preferência de estilo.

A escolha da licença aberta, e o que ela sinaliza

Publicar sob Apache-2.0, em vez de uma licença apenas para pesquisa ou não comercial, é uma decisão significativa. Isso significa que qualquer pessoa pode construir sobre esses modelos comercialmente, inclusive para produtos que competem com a plataforma que os criou. Essa é uma postura amplamente permissiva, e ela é cada vez mais o padrão entre laboratórios chineses que lançam modelos neste ciclo.

O padrão tem sido visível durante todo o mês. Várias equipes chinesas lançaram modelos de pesos abertos em setembro, abrangendo texto, geração de imagens, vídeo e tradução, e o fio condutor era a permissividade: MIT aqui, Apache-2.0 ali, pesos baixáveis em vez de alugados. A lógica estratégica é consistente. Pesos abertos geram adoção do ecossistema mais rapidamente do que apenas uma API, e a adoção cria o tipo de gravidade de desenvolvedores que compensa na próxima geração de produtos.

Construir sobre o Qwen3.5 em vez de treinar do zero também é revelador. O Qwen se tornou algo próximo de uma base compartilhada para uma série de lançamentos de modelos chineses, como o Llama já foi no Ocidente. Quando várias equipes independentes convergem para um único modelo base, essa base se torna um padrão de facto, e o trabalho que as diferencia sobe na pilha para ramos especializados como os que o Index-Translate inclui.

A localização é um dos centros de custo silenciosos do trabalho com vídeo, e tem sido difícil automatizá-la sem que a qualidade desmorone. Legendagem e dublagem impõem suas próprias restrições, e um pipeline que as ignora produz resultados que um humano precisa reparar linha por linha. Ao empacotar dublagem que preserva a voz e tradução com restrição de sílabas junto com um modelo de texto geral, o lançamento mira diretamente essa etapa de reparo. Se ele elimina a etapa ou apenas a reduz é algo que só um fluxo real de localização revelará, mas a intenção é legível: fazer a saída da máquina ficar próxima o suficiente de utilizável para que o trabalho humano se torne revisão, e não reescrita.

O que isso significa fora da China

Para equipes fora do ecossistema chinês, a consequência prática é o acesso. Uma família de tradução com licença permissiva, de 150 idiomas, e com ramos de fala e de documentos, disponível para download e execução local, é um ativo genuinamente útil para qualquer pessoa que esteja incorporando localização a um produto, especialmente quando enviar o texto de origem para uma API hospedada não é aceitável por razões de privacidade ou custo.

Os ramos de fala merecem atenção especial de qualquer pessoa que trabalhe com vídeo. Dublagem que preserva a voz e tradução com restrição de sílabas são as duas capacidades que decidem se a localização automatizada produz algo assistível ou algo que precisa de um humano para corrigir cada linha. Um modelo que lida com ambos, sob uma licença Apache-2.0, reduz a barreira para equipes pequenas localizarem conteúdo de vídeo que antes exigiria um orçamento de dublagem.

As ressalvas são as habituais para um lançamento recente. Os benchmarks divulgados vêm da equipe que criou os modelos, e a avaliação independente leva tempo. Uma prévia do 35B-A3B não é o mesmo que um modelo finalizado. E uma licença permissiva não torna automaticamente um modelo a melhor escolha para um determinado par de idiomas ou domínio. Isso ainda precisa ser testado com o seu próprio conteúdo.

O que está claro é a direção. A tradução está sendo reconstruída como um conjunto de tarefas restritas, que seguem instruções, em vez de uma única tarefa aberta, e os modelos que vencerão serão os que respeitarem as realidades incômodas de legendas, dublagem e estrutura de documentos. O Index-Translate é uma aposta bem direcionada exatamente a essas realidades, e está livre para que outros construam sobre ele.

Artigos relacionados