← 블로그로
Ai약 12 분 읽기

빌리빌리, Apache-2.0 라이선스로 150개 언어 번역 패밀리 오픈소스 공개

게시일 2026년 10월 2일
빌리빌리, Apache-2.0 라이선스로 150개 언어 번역 패밀리 오픈소스 공개

빌리빌리(Bilibili)의 Index LLM 팀이 9월 30일 Index-Translate를 공개했다. 알리바바의 Qwen3.5를 기반으로 구축된 다국어 번역 모델 패밀리다. 텍스트 모델은 중국어와 영어를 포함해 150개 언어를 지원하며, Apache-2.0 라이선스로 Hugging Face와 ModelScope에 2B, 9B, 35B-A3B 크기로 게시되었다. 이 중 마지막 모델은 아직 프리뷰 단계이며, 기술 보고서와 GitHub 코드, 온라인 데모도 함께 공개되었다.

동영상 플랫폼이 내놓은 번역 모델 패밀리는 다시 한번 눈여겨볼 가치가 있다. 그 플랫폼이 실제로 무엇을 필요로 하는지를 말해주기 때문이다. 빌리빌리는 자막 문화가 강하고 언어 경계를 넘는 콘텐츠에 대한 수요가 커지고 있는 중국의 동영상 커뮤니티다. 그런 회사에게 번역은 사이드 프로젝트가 아니라 인프라다.

단순한 번역 모델 그 이상인 이유

가장 직관적으로 와닿는 부분은 언어 수다. 많기는 하지만 전례가 없는 수준은 아니다. Index-Translate를 차별화하는 것은 번역이 아닌, 번역의 영역에 얼마나 많은 엔지니어링이 들어갔느냐다.

이 모델들은 용어, 서식, 그리고 손대지 말아야 할 콘텐츠에 대한 지시를 따른다. 프로젝트 페이지의 한 예시에서 9B 모델은 JSON 형식의 게임 점검 공지를 구조와 별표 기호, 사용자가 유지해 달라고 요청한 해시태그까지 그대로 보존하면서 한국어로 번역했다. 대단해 보이지는 않는다. 하지만 실제 현지화 파이프라인을 운영해 본 사람이라면 그것이 결코 사소한 일이 아니라는 것을 안다. 마크업, 플레이스홀더, 제품명, 법적 상용구, 인라인 서식은 기계 번역이 가장 자주 망가뜨리는 지점이며, 이후의 정리 작업이 자동화가 절약해줄 것이라 기대했던 시간을 잡아먹는 지점이다.

이런 제약을 처리하는 능력이야말로 모델을 데모에서 프로덕션에 연결할 수 있는 무언가로 바꿔준다. JSON 구조를 망가뜨리는 번역기는 한국어 문장이 아무리 유창해도 쓸 수 없다.

세 가지 분기 모델, 그리고 그것이 중요한 이유

이 패밀리는 동일한 다국어 기반을 세 가지 특화 방향으로 확장하며, 바로 이 분기들이 이번 공개를 진짜 흥미롭게 만드는 지점이다.

Index-Echo는 원본 화자의 음성 특성을 유지한 번역 자막이나 더빙 음성을 생성한다. 패키지로 제공되는 음성-음성 릴리스는 중국어에서 영어, 스페인어, 일본어 방향과 그 반대 방향을 지원한다. 음성 보존 더빙은 음성 인식, 번역, 음성 복제, 음성 합성이 교차하는 지점에 놓인 어려운 문제이며, 각 단계마다 오류가 누적된다. 한 언어의 목소리가 다른 언어에서도 같은 사람처럼 들리게 하는 것은 시청자가 받아들이는 더빙과 꺼버리는 더빙을 가르는 차이다.

Index-Homura는 번역문을 목표 음절 수에 맞춰 조정한다. 대부분의 번역 시스템이 완전히 무시하는 더빙 및 자막 제약이다. 움직이는 입모양이나 고정된 자막 창에 단어를 맞춰 넣어야 할 때, 40퍼센트나 긴 완벽하게 정확한 번역은 실패한 번역이다. 의미를 보존하면서 길이를 제한하는 것은 연구용 모델과 프로덕션 팀이 쓸 수 있는 도구를 가르는, 바로 그런 좁고 실용적인 문제다.

Index-Nailong이라는 모델 ID로 공개된 Index-NativeLong은 문서 전체를 번역하고 문서 전반에 걸쳐 참조를 일관되게 유지한다. 문서 수준 일관성은 또 하나의 흔한 실패를 해결한다. 각 문장이 개별적으로 번역되기 때문에 2페이지에서는 어떤 용어를 한 방식으로, 9페이지에서는 다른 방식으로 옮기는 문제다. 매뉴얼, 계약서, 장문 콘텐츠에서 이런 불일치는 스타일 선호가 아니라 정확성 문제다.

오픈 라이선스 선택, 그리고 그것이 시사하는 것

연구 전용이나 비상업적 라이선스가 아닌 Apache-2.0으로 공개하는 것은 중요한 결정이다. 누구나 이 모델을 상업적으로 활용해 무언가를 만들 수 있다는 뜻이며, 이를 만든 플랫폼과 경쟁하는 제품을 만드는 경우도 포함된다. 이는 폭넓게 허용적인 태도이며, 이번 주기에 모델을 공개하는 중국 연구소들 사이에서 점점 기본값이 되고 있다.

이런 패턴은 한 달 내내 눈에 띄었다. 여러 중국 팀이 9월에 텍스트, 이미지 생성, 비디오, 번역 전반에 걸쳐 오픈 웨이트 모델을 내놓았고, 공통점은 허용성이었다. 여기서는 MIT, 저기서는 Apache-2.0, 가중치는 임대하는 것이 아니라 다운로드하는 방식이다. 전략적 논리는 일관된다. 오픈 웨이트는 API만으로는 미치지 못하는 속도로 생태계 도입을 이끌고, 그 도입은 차세대 제품에서 결실을 맺는 개발자 중력을 만들어낸다.

처음부터 학습하는 대신 Qwen3.5를 기반으로 삼은 점도 시사하는 바가 크다. Qwen은 한때 서구에서 Llama가 그랬던 것처럼, 다수의 중국 모델 공개에서 공유 기반에 가까운 존재가 되었다. 여러 독립적인 팀이 하나의 베이스 모델로 수렴하면 그 베이스는 사실상 표준이 되고, 이들을 차별화하는 작업은 스택 위쪽, 즉 Index-Translate가 포함한 것과 같은 특화 분기로 이동한다.

현지화는 영상 작업의 조용한 비용 센터 중 하나이며, 품질을 떨어뜨리지 않고 자동화하기가 어려웠다. 자막과 더빙은 각기 다른 제약을 부과하며, 이를 무시하는 파이프라인은 사람이 한 줄 한 줄 고쳐야 하는 결과물을 낸다. 음성 보존 더빙과 음절 제약 번역을 범용 텍스트 모델과 함께 패키징함으로써, 이번 공개는 바로 그 수정 단계를 겨냥한다. 그것이 그 단계를 없애는지 아니면 단지 줄이는지는 실제 현지화 워크플로만이 밝혀줄 수 있지만, 의도만은 분명히 읽힌다. 기계의 출력을 사람의 일이 재작성이 아니라 검토가 될 만큼 충분히 쓸 수 있는 수준으로 끌어올리겠다는 것이다.

중국 밖에서는 어떤 의미인가

중국 생태계 밖의 팀에게 실질적인 결과는 접근성이다. 음성 및 문서 분기를 갖춘 150개 언어 번역 패밀리가 허용적 라이선스로 제공되고, 로컬에서 다운로드해 실행할 수 있다는 것은 제품에 현지화를 넣으려는 누구에게나 진정으로 유용한 자산이다. 특히 개인정보 보호나 비용 문제로 원문을 호스팅 API로 보내는 것이 용납되지 않는 경우에는 더욱 그렇다.

음성 분기는 영상 작업을 하는 사람이라면 특히 주목할 만하다. 음성 보존 더빙과 음절 제약 번역은 자동화된 현지화가 볼 만한 결과물을 내는지, 아니면 사람이 모든 줄을 고쳐야 하는 결과물을 내는지를 결정하는 두 가지 역량이다. 두 가지를 모두 처리하면서 Apache-2.0 라이선스로 제공되는 모델은, 이전이라면 더빙 예산이 필요했을 영상 콘텐츠를 현지화하려는 소규모 팀의 진입 장벽을 낮춰준다.

주의할 점은 새로 나온 릴리스에서 늘 그렇듯 평범하다. 공개된 벤치마크는 모델을 만든 팀에서 나온 것이고, 독립적인 평가에는 시간이 걸린다. 35B-A3B 프리뷰는 완성된 모델과 같지 않다. 그리고 허용적 라이선스가 특정 언어 쌍이나 도메인에서 그 모델을 자동으로 최선의 선택으로 만들어주지는 않는다. 그것은 여전히 여러분의 콘텐츠로 직접 테스트해야 한다.

분명한 것은 방향성이다. 번역은 하나의 개방형 과제가 아니라 제약이 있고 지시를 따르는 일련의 작업들로 재구축되고 있으며, 승리하는 모델은 자막, 더빙, 문서 구조의 까다로운 현실을 존중하는 모델일 것이다. Index-Translate는 바로 그런 현실을 정조준한 시도이며, 자유롭게 활용해 무언가를 만들 수 있다.

관련 글