Bilibili publie en open source une famille de traduction de 150 langues sous Apache-2.0

L'équipe Index LLM de Bilibili a publié Index-Translate le 30 septembre, une famille de modèles de traduction multilingues basés sur Qwen3.5 d'Alibaba. Les modèles texte couvrent 150 langues, dont le chinois et l'anglais, et sont publiés sous licence Apache-2.0 sur Hugging Face et ModelScope en tailles 2B, 9B et 35B-A3B, la dernière étant encore en préversion, accompagnés d'un rapport technique, du code sur GitHub et d'une démo en ligne.
Une famille de modèles de traduction issue d'une plateforme vidéo mérite un second regard, car elle dit quelque chose des besoins réels de la plateforme. Bilibili est une communauté vidéo chinoise avec une forte culture du sous-titrage et un appétit croissant pour les contenus qui traversent les frontières linguistiques. Pour une entreprise de ce type, la traduction est une infrastructure plutôt qu'un projet annexe.
Ce qui en fait plus qu'un simple modèle de traduction
La partie la plus évidente est le nombre de langues, élevé mais pas inédit. Ce qui distingue Index-Translate, c'est la part d'ingénierie consacrée aux aspects de la traduction qui ne relèvent pas de la traduction.
Les modèles suivent des instructions concernant la terminologie, le formatage et les contenus à laisser intacts. Dans un exemple de la page du projet, le modèle 9B a traduit en coréen un avis de maintenance de jeu au format JSON tout en préservant sa structure, ses symboles étoiles et un hashtag que l'utilisateur avait demandé de conserver. Cela peut sembler modeste. Quiconque a déjà fait tourner un vrai pipeline de localisation sait que ça ne l'est pas. Le balisage, les espaces réservés, les noms de produits, les mentions légales et le formatage en ligne sont là où la traduction automatique casse le plus souvent les choses, et où le nettoyage ultérieur engloutit le temps que l'automatisation était censée faire gagner.
Gérer ces contraintes, c'est ce qui transforme un modèle de démo en outil intégrable en production. Un traducteur qui massacre une structure JSON n'est pas utilisable, aussi fluide que soit la phrase coréenne.
Les trois branches, et pourquoi elles comptent
La famille étend la même base multilingue dans trois directions spécialisées, et c'est dans ces branches que la publication devient vraiment intéressante.
Index-Echo produit des sous-titres traduits ou de la parole doublée qui conserve les caractéristiques vocales du locuteur d'origine. Sa version packagée de speech-to-speech couvre le chinois vers l'anglais, l'espagnol et le japonais, et inversement. Le doublage préservant la voix est un problème difficile, à l'intersection de la reconnaissance vocale, de la traduction, du clonage vocal et de la synthèse vocale, et les erreurs s'accumulent à chaque étape. Faire en sorte qu'une voix semble appartenir à la même personne dans une autre langue fait la différence entre un doublage que les spectateurs acceptent et un doublage qu'ils coupent.
Index-Homura ajuste une traduction vers un nombre cible de syllabes. C'est une contrainte de doublage et de sous-titrage que la plupart des systèmes de traduction ignorent totalement. Quand il s'agit d'adapter des mots à une bouche en mouvement ou à une fenêtre de sous-titres fixe, une traduction parfaitement exacte mais 40 % trop longue est une traduction ratée. Contraindre la longueur tout en préservant le sens est exactement le type de problème étroit et pratique qui sépare un modèle de recherche d'un outil qu'une équipe de production peut utiliser.
Index-NativeLong, publié sous des identifiants de modèle nommés Index-Nailong, traduit des documents entiers et maintient la cohérence des références d'un bout à l'autre. La cohérence au niveau du document répond à un autre échec courant : un terme traduit d'une manière page deux et d'une autre page neuf, parce que chaque phrase a été traduite isolément. Pour les manuels, les contrats et les contenus longs, cette incohérence est un problème d'exactitude, pas une préférence stylistique.
Le choix de la licence ouverte, et ce qu'il signale
Publier sous Apache-2.0 plutôt que sous une licence réservée à la recherche ou non commerciale est une décision importante. Cela signifie que n'importe qui peut exploiter commercialement ces modèles, y compris pour des produits concurrents de la plateforme qui les a créés. C'est une position largement permissive, et elle devient de plus en plus la norme chez les laboratoires chinois qui publient des modèles dans ce cycle.
Le schéma a été visible tout le mois. Plusieurs équipes chinoises ont livré en septembre des modèles à poids ouverts dans le texte, la génération d'images, la vidéo et la traduction, et le fil conducteur était la permissivité : MIT ici, Apache-2.0 là, des poids téléchargeables plutôt que loués. La logique stratégique est cohérente. Les poids ouverts favorisent l'adoption par l'écosystème plus rapidement qu'une API seule, et l'adoption crée ce type d'attraction auprès des développeurs qui porte ses fruits dans la génération de produits suivante.
Le fait de partir de Qwen3.5 plutôt que d'un entraînement à partir de zéro est également révélateur. Qwen est devenu quelque chose comme un socle partagé pour un certain nombre de publications de modèles chinois, comme Llama l'a été un temps en Occident. Quand plusieurs équipes indépendantes convergent vers un même modèle de base, cette base devient un standard de facto, et le travail qui les différencie remonte la pile vers des branches spécialisées comme celles qu'inclut Index-Translate.
La localisation est l'un des centres de coûts discrets du travail vidéo, et il a été difficile de l'automatiser sans que la qualité s'effondre. Le sous-titrage et le doublage imposent chacun leurs propres contraintes, et un pipeline qui les ignore produit un résultat qu'un humain doit réparer ligne par ligne. En intégrant le doublage préservant la voix et la traduction contrainte par syllabes aux côtés d'un modèle de texte général, la publication cible directement cette étape de réparation. Savoir si elle supprime l'étape ou ne fait que la réduire, seul un véritable flux de localisation le révélera, mais l'intention est lisible : rendre la sortie de la machine suffisamment proche de l'utilisable pour que le travail humain devienne de la révision plutôt qu'une réécriture.
Ce que cela signifie hors de Chine
Pour les équipes en dehors de l'écosystème chinois, la conséquence pratique est l'accès. Une famille de traduction sous licence permissive, couvrant 150 langues, avec des branches parole et document, téléchargeable et exécutable localement, est un atout véritablement utile pour quiconque intègre la localisation à un produit, en particulier lorsque l'envoi de texte source à une API hébergée n'est pas acceptable pour des raisons de confidentialité ou de coût.
Les branches parole méritent une attention particulière de la part de quiconque travaille sur la vidéo. Le doublage préservant la voix et la traduction contrainte par syllabes sont les deux capacités qui déterminent si une localisation automatisée produit quelque chose de regardable ou quelque chose qu'un humain doit corriger à chaque ligne. Un modèle qui gère les deux, sous licence Apache-2.0, abaisse la barrière pour que les petites équipes localisent des contenus vidéo qui auraient auparavant nécessité un budget de doublage.
Les réserves sont les habituelles pour une nouvelle publication. Les benchmarks publiés viennent de l'équipe qui a conçu les modèles, et une évaluation indépendante prend du temps. Un aperçu 35B-A3B n'est pas la même chose qu'un modèle finalisé. Et une licence permissive ne fait pas automatiquement d'un modèle le meilleur choix pour une paire de langues ou un domaine donné. Cela doit encore être testé sur vos propres contenus.
Ce qui est clair, c'est la direction. La traduction est en train d'être reconstruite comme un ensemble de tâches contraintes, guidées par des instructions, plutôt qu'une seule tâche ouverte, et les modèles qui gagneront seront ceux qui respectent les réalités embarrassantes des sous-titres, du doublage et de la structure documentaire. Index-Translate est un tir bien ajusté sur précisément ces réalités, et il est libre d'utilisation pour construire dessus.
Articles associés
Agility Digit 5 arrive avec un dossier de sécurité, pas seulement une fiche technique
Un entrepôt n'est pas un laboratoire. La certification est la porte d'entrée, pas la démo.
Les agents de pointe ont terminé 30 % d’un flux de travail de recherche. C’est le chiffre qui compte.
Les agents peuvent exécuter de la recherche. Inventer la procédure reste hors de portée.
Figure AI engage 3,5 milliards de dollars de capacité de calcul avant même d'avoir un produit à vendre
Le pari : la généralisation est un problème de calcul. Le secteur n'a pas tranché.
OpenAI ajoute enfin les arrière-plans transparents à son API d’images
Une petite fonctionnalité qui supprime toute une étape du pipeline.