Bilibili veröffentlicht eine Übersetzungsfamilie für 150 Sprachen unter Apache-2.0 als Open Source

Das Index-LLM-Team von Bilibili hat am 30. September Index-Translate veröffentlicht, eine Familie mehrsprachiger Übersetzungsmodelle, die auf Alibabas Qwen3.5 aufbauen. Die Textmodelle decken 150 Sprachen ab, darunter Chinesisch und Englisch, und sind unter der Apache-2.0-Lizenz auf Hugging Face und ModelScope in den Größen 2B, 9B und 35B-A3B veröffentlicht, wobei die letzte davon noch in der Vorschau ist, zusammen mit einem technischen Bericht, Code auf GitHub und einer Online-Demo.
Eine Übersetzungsmodellfamilie von einer Videoplattform ist einen zweiten Blick wert, denn sie verrät etwas darüber, was die Plattform tatsächlich braucht. Bilibili ist eine chinesische Videocommunity mit ausgeprägter Untertitelkultur und wachsendem Appetit auf Inhalte, die Sprachgrenzen überschreiten. Für ein solches Unternehmen ist Übersetzung Infrastruktur und kein Nebenprojekt.
Was es zu mehr als einem Übersetzungsmodell macht
Der offensichtliche Teil ist die Sprachenzahl, die hoch, aber nicht beispiellos ist. Was Index-Translate auszeichnet, ist, wie sehr es auf die Teile der Übersetzung hin entwickelt wurde, die nicht Übersetzung sind.
Die Modelle folgen Anweisungen zu Terminologie, Formatierung und Inhalten, die unangetastet bleiben müssen. In einem Beispiel von der Projektseite übersetzte das 9B-Modell eine JSON-Wartungsankündigung für ein Spiel ins Koreanische, während es deren Struktur, die Sternsymbole und einen Hashtag beibehielt, den der Nutzer beibehalten wollte. Das klingt bescheiden. Wer schon einmal eine echte Lokalisierungs-Pipeline betrieben hat, weiß, dass es das nicht ist. Markup, Platzhalter, Produktnamen, juristische Standardformulierungen und Inline-Formatierung sind die Stellen, an denen maschinelle Übersetzung am häufigsten Dinge kaputt macht, und an denen das anschließende Aufräumen genau die Zeit frisst, die die Automatisierung eigentlich sparen sollte.
Der Umgang mit diesen Einschränkungen ist es, was ein Modell von einer Demo zu etwas macht, das man in die Produktion einbinden kann. Ein Übersetzer, der eine JSON-Struktur verhunzt, ist nicht brauchbar, egal wie flüssig der koreanische Satz ist.
Die drei Zweige und warum sie wichtig sind
Die Familie erweitert dieselbe mehrsprachige Basis in drei spezialisierte Richtungen, und genau in diesen Zweigen wird die Veröffentlichung wirklich interessant.
Index-Echo erzeugt übersetzte Untertitel oder synchronisierte Sprache, die die Stimmcharakteristik des Ausgangssprechers beibehält. Die paketierte Speech-to-Speech-Veröffentlichung deckt Chinesisch nach Englisch, Spanisch und Japanisch ab sowie umgekehrt. Stimmerhaltende Synchronisation ist ein schwieriges Problem an der Schnittstelle von Spracherkennung, Übersetzung, Voice-Cloning und Sprachsynthese, und Fehler summieren sich über jede Stufe hinweg. Eine Stimme so klingen zu lassen, als sei sie in einer anderen Sprache dieselbe Person, ist der Unterschied zwischen einer Synchronisation, die Zuschauer akzeptieren, und einer, die sie abschalten.
Index-Homura passt eine Übersetzung an eine Ziel-Silbenzahl an. Das ist eine Dubbing- und Untertitel-Einschränkung, die die meisten Übersetzungssysteme vollständig ignorieren. Wenn man Wörter an einen sich bewegenden Mund oder ein festes Untertitel-Fenster anpassen muss, ist eine vollkommen akkurate Übersetzung, die 40 Prozent zu lang ist, eine gescheiterte Übersetzung. Die Länge zu beschränken und dabei die Bedeutung zu bewahren, ist genau die Art eng gefasstes, praktisches Problem, das ein Forschungsmodell von einem Werkzeug trennt, das ein Produktionsteam verwenden kann.
Index-NativeLong, veröffentlicht unter Modell-IDs namens Index-Nailong, übersetzt ganze Dokumente und hält Referenzen über sie hinweg konsistent. Konsistenz auf Dokumentebene adressiert einen weiteren häufigen Fehler: Ein Begriff wird auf Seite zwei anders übersetzt als auf Seite neun, weil jeder Satz isoliert übersetzt wurde. Bei Handbüchern, Verträgen und langen Inhalten ist diese Inkonsistenz ein Korrektheitsproblem, keine Stilfrage.
Die Wahl der offenen Lizenz und was sie signalisiert
Die Veröffentlichung unter Apache-2.0 statt unter einer Lizenz nur für Forschung oder einer nichtkommerziellen Lizenz ist eine bedeutende Entscheidung. Sie bedeutet, dass jeder kommerziell auf diesen Modellen aufbauen kann, auch für Produkte, die mit der Plattform konkurrieren, die sie erstellt hat. Das ist eine breit permissive Haltung, und sie wird unter chinesischen Laboren, die in diesem Zyklus Modelle veröffentlichen, zunehmend zum Standard.
Das Muster war den ganzen Monat über sichtbar. Mehrere chinesische Teams lieferten im September Modelle mit offenen Gewichten in den Bereichen Text, Bildgenerierung, Video und Übersetzung aus, und der rote Faden war Permissivität: hier MIT, dort Apache-2.0, Gewichte herunterladbar statt gemietet. Die strategische Logik ist konsistent. Offene Gewichte schaffen schneller Ökosystem-Akzeptanz als eine reine API, und Akzeptanz erzeugt eine Sogkraft auf Entwickler, die sich in der nächsten Produktgeneration auszahlt.
Auf Qwen3.5 aufzubauen statt von Grund auf zu trainieren, ist ebenfalls aussagekräftig. Qwen ist für eine Reihe chinesischer Modellveröffentlichungen fast so etwas wie eine gemeinsame Grundlage geworden, so wie Llama es einst im Westen war. Wenn mehrere unabhängige Teams auf einem Basismodell konvergieren, wird diese Basis zum De-facto-Standard, und die Arbeit, die sie unterscheidet, verlagert sich im Stack nach oben in spezialisierte Zweige wie die, die Index-Translate enthält.
Lokalisierung ist einer der stillen Kostenfaktoren der Videoarbeit, und sie war schwer zu automatisieren, ohne dass die Qualität auseinanderfällt. Untertitelung und Synchronisation bringen jeweils eigene Einschränkungen mit sich, und eine Pipeline, die sie ignoriert, erzeugt Ausgaben, die ein Mensch Zeile für Zeile reparieren muss. Indem die Veröffentlichung stimmerhaltende Synchronisation und silbenbeschränkte Übersetzung zusammen mit einem allgemeinen Textmodell paketiert, zielt sie direkt auf diesen Reparaturschritt. Ob sie den Schritt beseitigt oder nur verkleinert, kann nur ein echter Lokalisierungs-Workflow zeigen, aber die Absicht ist erkennbar: die Ausgabe der Maschine nah genug an brauchbar zu bringen, dass die Aufgabe des Menschen zur Überprüfung statt zum Umschreiben wird.
Was es außerhalb Chinas bedeutet
Für Teams außerhalb des chinesischen Ökosystems ist die praktische Konsequenz Zugang. Eine permissiv lizenzierte Übersetzungsfamilie für 150 Sprachen mit Sprach- und Dokumentzweigen, herunterladbar und lokal ausführbar, ist ein wirklich nützliches Asset für alle, die Lokalisierung in ein Produkt integrieren, besonders dort, wo das Senden von Quelltext an eine gehostete API aus Datenschutz- oder Kostengründen nicht akzeptabel ist.
Die Sprachzweige verdienen besondere Aufmerksamkeit von allen, die mit Video arbeiten. Stimmerhaltende Synchronisation und silbenbeschränkte Übersetzung sind die beiden Fähigkeiten, die darüber entscheiden, ob automatisierte Lokalisierung etwas Sehenswertes produziert oder etwas, bei dem ein Mensch jede Zeile korrigieren muss. Ein Modell, das beides abdeckt, unter einer Apache-2.0-Lizenz, senkt die Hürde für kleine Teams, Videoinhalte zu lokalisieren, die zuvor ein Synchronisationsbudget erfordert hätten.
Die Vorbehalte sind die üblichen bei einer frischen Veröffentlichung. Veröffentlichte Benchmarks stammen von dem Team, das die Modelle entwickelt hat, und unabhängige Evaluierung braucht Zeit. Eine 35B-A3B-Vorschau ist nicht dasselbe wie ein fertiges Modell. Und eine permissive Lizenzierung macht ein Modell nicht automatisch zur besten Wahl für ein bestimmtes Sprachpaar oder Fachgebiet. Das muss weiterhin an den eigenen Inhalten getestet werden.
Klar ist die Richtung. Übersetzung wird als eine Reihe eingeschränkter, anweisungsbefolgender Aufgaben neu aufgebaut statt als eine einzige offene Aufgabe, und die Modelle, die gewinnen, werden diejenigen sein, die die unbequemen Realitäten von Untertiteln, Synchronisation und Dokumentstruktur respektieren. Index-Translate ist ein gut gezielter Schuss genau auf diese Realitäten, und es steht jedem frei, darauf aufzubauen.
Verwandte Artikel
Huawei Cloud hat seinen Stack um Agenten herum neu aufgebaut – und dann den Rechnungen ein Datum gegeben
Die Modellfähigkeiten sind konvergiert, und der Wert hat sich auf das verlagert, was sie umgibt.
Xiaomi veröffentlicht ein omnimodales Modell auf Frontier-Niveau – samt Trainingsrezept
Gewichte lassen dich ein Modell ausführen. Umgebungen lassen dich es neu trainieren.
Cadence setzt Agenten in den Chipentwurf ein und verkürzt einen fünfwöchigen Verifikationszyklus auf einen Tag
Agenten rufen daher mehr der zugrunde liegenden Engines auf, nicht weniger.
Roblox Build veröffentlichte in sechs Wochen 9.000 Spiele. Die interessante Zahl ist 71
Lesen Sie das als Rekrutierungszahl, nicht als Qualitätszahl.