← 블로그로
Ai약 12 분 읽기

VibeVoice, 절반만 오픈소스화: 빠진 절반이 교훈이다

게시일 2026년 10월 11일
VibeVoice, 절반만 오픈소스화: 빠진 절반이 교훈이다

마이크로소프트의 VibeVoice 저장소는 MIT 라이선스를 갖고 있으며, 약 55,000개의 스타를 보유하고, 설명만 보면 약속처럼 들린다: 오픈소스 최전선 음성 AI. 하지만 실제로 담고 있는 것은 모델이 걱정할 만큼 강력해졌을 때 "오픈소스"가 무엇을 의미하는지에 대한 교훈이다.

이 이야기는 두 방향으로 흘러간다. 한 방향에서는 저장소가 계속 성장하고, 남아 있는 부분은 진정으로 유용하다. 다른 방향에서는 가장 성능이 뛰어난 부분이 사라졌다. 2025년 9월, 마이크로소프트는 사람들이 프로젝트 의도와 일치하지 않는다고 밝힌 방식으로 사용하는 것을 발견한 후 저장소에서 VibeVoice-TTS의 추론 코드를 제거했다. 해당 모델의 가중치는 여전히 Hugging Face에 있다. 하지만 이를 실행하는 코드는 없다. 오늘날 그 특정 모델을 원하는 사람은 스스로 해결해야 한다.

그 결정은 2026년에 저장소가 사용되는 방식 전부를 형성하며, 어떤 벤치마크보다도 더 많은 것을 알려준다.

실제로 상자 안에 들어 있는 것

오늘날 핵심은 VibeVoice-ASR로, 한 번에 최대 60분의 오디오를 전사하는 70억 매개변수 음성 인식 모델이다. 단순히 단어를 받아 적는 것이 아니다. 누가 말했는지, 언제 말했는지, 무엇을 말했는지 반환하여 화자 레이블과 타임스탬프가 포함된 구조화된 출력을 생성한다. 언어 플래그 없이 50개 이상의 언어를 처리하며, 사용자 정의 핫워드를 받아들여 예상되는 이름과 기술 용어를 전달하면 이를 더 이상 망가뜨리지 않는다.

그 핵심 주위에는 여러 가지 축소된 변형이 있다. 오디오가 아직 들어오는 동안 텍스트를 청크 단위로 내보내는 스트리밍 ASR 버전이 있는데, 전체 녹음을 기다릴 수 없을 때 유용하다. GPU 없이 CPU에서 실행되는 BitNet 빌드도 있으며, 약 1.58GB로 압축되어 있는데, 이 크기의 모델로서는 놀랍다. 그리고 VibeVoice-Realtime-0.5B가 있는데, 약 200~300밀리초 만에 첫 오디오에 도달하는 작은 스트리밍 텍스트-음성 변환 모델로, 사전 설정된 목소리를 제공하며 특히 음성 복제 기능은 없다.

파형이 선명한 밝은 절반과 희미하게 잠긴 절반으로 갈라지는 모습

7.5Hz 트릭

이 제품군을 하나로 묶는 기술적 아이디어는 비정상적으로 낮은 프레임 속도로 실행되는 음성 토크나이저다: 초당 7.5프레임. 대부분의 음성 토크나이저는 50Hz 이상으로 실행된다. 더 낮은 속도가 중요한 이유는 동일한 컨텍스트 윈도우에 훨씬 더 많은 오디오를 담을 수 있기 때문이다. 이것이 한 번의 실행으로 전체 1시간 대화를 커버할 수 있게 해준다. 초당 토큰 수가 적을수록 모델 메모리에 더 많은 초가 들어가기 때문이다.

낮은 프레임 속도는 일반적으로 충실도를 희생하지만, VibeVoice는 2단계 설계로 이를 해결한다. 언어 모델이 의미를 처리하여 무엇이 말해지고 누가 말하는지 결정하고, 확산 헤드가 세밀한 음향 디테일을 생성한다. 토크나이저는 확산 헤드가 제 역할을 할 수 있을 만큼의 오디오 품질만 보존하면 된다. 이는 깔끔한 분업이며, 모델이 동시에 긴 윈도우와 세밀함을 모두 가질 수 있는 이유다.

무엇을 만들 수 있고 만들 수 없는가

음성을 다루는 사람이라면 누구나 VibeVoice의 사용 가능한 절반은 상당하다. 화자 레이블이 있는 회의 전사, 팟캐스트 화자 분리, 누가 언제 무엇을 말했는지 알아야 하는 인터뷰 워크플로, 라이브 애플리케이션을 위한 스트리밍 인식, 그리고 적당한 하드웨어에서 실행되는 어시스턴트를 위한 경량 음성 등 오늘날 모두 실현 가능하다. 특히 CPU 빌드는 별도의 GPU 없이 머신에서 인식을 실행할 수 있는 문을 열어주는데, 이는 비용과 GPU가 부족한 곳에서의 배포에 중요하다.

사용할 수 없는 절반은 VibeVoice를 유명하게 만든 부분이다. 원래 VibeVoice-TTS는 최대 네 명의 서로 다른 화자와 함께 최대 90분의 음성을 합성할 수 있었는데, 이는 ICLR 2026에서 구두 발표 논문으로 채택된 진정한 연구 성과였다. 바로 그 기능을 오늘날 저장소에서 실행할 수 없다. 유명한 버전은 실제로 철회된 버전이었다.

스펙트럼으로서의 오픈소스

VibeVoice 사례는 업계가 즐겨 말하는 깔끔한 서사를 복잡하게 만든다. 한쪽에는 가중치를 다운로드할 수 있다는 의미에서 오픈이라고 불리는 모델이 있다. 다른 쪽에는 클로즈드라고 불리는 모델이 있다. VibeVoice는 그 사이에 있다. 가중치는 공개되어 있고 라이선스는 관대하지만, 가장 유망한 모델을 실제로 사용하는 데 필요한 코드는 사라졌다. 추론 코드 없이 가중치를 공개하는 것은 중간 경로이며, 위험이 커질수록 더 유능한 모델들이 이 지점에 도달할 수 있다.

실용적인 문제도 있다. 저장소는 완성된 제품이 아니라 연구 프레임워크라고 설명하므로 기대치를 맞춰야 한다. 해당 이름으로 PyPI에서 설치할 수 있는 공식 Python 패키지는 없으며, 같은 이름을 공유하는 패키지는 마이크로소프트의 프로젝트가 아니다. 또한 마이크로소프트는 라이선스 자체는 관대하지만, 추가 테스트 없이 상업적 사용을 권장하지 않으며 모델이 연구용이라고 조언한다. 이는 라이선스만 읽고 README를 건너뛰는 팀을 놀라게 하는 종류의 간극이다.

이 모든 것이 이번 릴리스를 실패로 만드는 것은 아니다. ASR 모델은 강력하고, 스트리밍 변형은 유용하며, CPU 빌드는 정말 영리하다. 하지만 이는 "오픈소스"가 이제 다양한 형태를 포괄하며, 특정 형태가 라벨보다 더 중요하다는 것을 상기시킨다. TTS 기능이 필요한 팀은 프로젝트를 계획하기 전에, 그 후가 아니라 미리 알아야 한다.

물어볼 가치가 있는 질문

VibeVoice가 제기하는 솔직한 질문은 코드 제거가 오용에 대한 올바른 대응인지다. 가중치는 여전히 공개되어 있으므로 모델을 실행하려는 사람은 방법을 찾을 수 있다. 반면, 주어진 라이선스에 따라 코드를 책임감 있게 사용했을 사람들은 접근 권한을 잃았다. 이는 유능한 모델이 확산되면서 모든 연구소가 직면하는 긴장이다: 도구를 제한하면 부주의한 사용자보다 신중한 사용자에게 더 불편을 주고, 도구를 열어두면 일부 오용이 발생한다는 것을 받아들이는 것이다.

마이크로소프트는 중간을 택했다. 유용한 음성 인식 작업은 공개로 유지하고 더 많은 위험을 수반하는 합성 코드는 철회했다. 다른 연구소들은 다른 결정을 내릴 것이며, 사용자들은 헤드라인을 믿는 대신 계속 세부 조항을 읽어야 할 것이다. VibeVoice는 이례적이어서가 아니라 기술이 성숙함에 따라 더 많은 릴리스가 어떻게 구성될지 미리 보여주기 때문에 연구할 가치가 있다.

오픈 모델을 기반으로 구축하는 사람이라면 누구에게나 교훈은 커밋하기 전에 확인하라는 것이다. 원하는 가중치에 이를 실행하는 코드가 함께 제공되는지 확인하라. 라이선스와 README를 읽어라. 둘이 일치하지 않을 수 있기 때문이다. 의존할 계획인 버전이 1년 후에도 유지보수 가능한지 확인하라. 이런 것 중 흥미로운 것은 없지만, 프로젝트를 시작한 지 6개월 만에 필요한 모델의 절반이 출시된 적이 없다는 것을 발견하는 것보다 모두 저렴하다. VibeVoice는 "오픈 가중치"와 "사용 가능" 사이의 구분을 놓칠 수 없게 만들어 이 분야에 도움을 주었다.

관련 글