Kandinsky 6.0, 한 번의 패스로 사운드를 생성하는 비디오 가중치를 오픈소스로 공개

--- title: Kandinsky 6.0, 한 번의 패스로 사운드를 생성하는 비디오 가중치를 오픈소스로 공개 meta_title: Kandinsky 6.0, 네이티브 오디오를 갖춘 비디오를 오픈소스로 공개 meta_description: Kandinsky Lab은 MIT 라이선스로 동기화된 오디오를 한 번의 패스로 생성하는 3B 및 29B 비디오 모델을 출시했으며, 출시 당일 vLLM-Omni 지원을 제공합니다. ---
대부분의 오픈 텍스트-투-비디오 시스템은 사운드를 다른 누군가의 문제로 취급합니다. 무음 영상을 생성한 뒤 나중에 사운드트랙을 덧붙이면, 입 움직임이 대사와 거의 맞지 않습니다. Kandinsky Lab이 이번 주 fal에 공개한 해답은 둘을 동시에 모델링하는 것입니다.
Kandinsky 6.0 Video는 두 가지 크기로 제공됩니다: 시네마틱 출력을 겨냥한 29B Pro 모델과 빠른 반복을 위한 3B Lite 버전입니다. 코드와 가중치는 MIT 라이선스로 공개되었으며, 이는 상업적 사용을 계획하는 사람에게 파라미터 수보다 더 중요합니다.
두 계층이 실제로 제공하는 것
두 모델 모두 숏폼 생성을 목표로 합니다. 클립은 최대 약 5초이며, 오디오는 44kHz 샘플 레이트로 출력됩니다. Pro는 품질 계층이고, Lite는 빠르게 반복해야 하며 속도와 비용을 위해 충실도를 기꺼이 포기하려는 팀을 겨냥합니다.
핵심 기능은 공동 생성입니다. 언어, 비전, 오디오가 파이프라인이 아니라 함께 모델링되므로, 발소리, 주변 효과, 입 모양이 화면에서 일어나는 일과 일치합니다. 이런 종류의 네이티브 동기화는 대부분 폐쇄형 상용 시스템의 영역이었기에, 오픈 릴리스가 주목할 만합니다.

vLLM-Omni는 출시 당일 추론 지원을 제공합니다. 이는 편의성을 넘어 중요합니다. 추론 스택이 몇 주 뒤가 아니라 출시 당일에 지원을 내놓으면, 팀은 초기 열기가 식기 전에 자체 워크로드에 모델을 평가할 수 있습니다.
fal에서는 모델이 통합 업스케일링과 독립형 비디오 초해상도 도구와 함께 번들로 제공됩니다. 따라서 실용적인 파이프라인은 텍스트나 이미지를 입력하고, 5초 클립을 출력한 뒤 업스케일하는 것입니다.
라이선스는 주의 깊게 읽어야 합니다
여기 주목할 만한 부분이 있습니다. 이번 릴리스를 다룬 보도는 MIT라고 설명하고, Kandinsky Lab의 자체 발표도 코드와 가중치가 MIT 라이선스로 제공된다고 밝힙니다. 하지만 독립적인 모델 추적기는 라이선스를 표준 허용형이 아니라 사용자 지정으로 표시합니다.
이 불일치는 누구든 이 가중치 위에 제품을 만들기 전에 해결할 가치가 있습니다. 진정한 허용형 라이선스는 별도 계약 없이 상업적 사용, 수정, 재배포를 의미합니다. 사용자 지정 라이선스는 언뜻 보기에 똑같이 개방적으로 보일 수 있지만, 나중에 드러나는 제한을 담고 있을 수 있으며, 흔히 지역, 규모, 다운스트림 재배포에 관한 제한입니다.
올해의 패턴은 중국 연구소들이 허용적으로 들리는 이름과 약관 속에 숨겨진 예외 조항을 붙여 오픈 가중치를 공개하는 것이었습니다. 예를 들어 MiniMax의 H3 라이선스는 미국, 유럽연합, 영국, 한국을 제외합니다. 모델 카드에서 배포 계획으로 넘어가는 사람은 실제 약관을 읽어야 합니다.
MIT 라이선스 비디오 가중치가 설명대로 유지된다면 의미 있는 진전이 될 것입니다. 허용형 비디오 라이선스는 허용형 언어 모델 라이선스보다 드문데, 일부는 비디오 모델이 학습 데이터에 관한 출처 문제가 더 복잡하고, 일부는 이를 만드는 연구소가 더 자주 상업적이기 때문입니다. 오디오도 처리하는 진정한 오픈 비디오 모델은 소규모 스튜디오에 API 계약이 필요 없는 경로를 제공할 것입니다.
동기화된 오디오가 더 어려운 문제인 이유
텍스트 프롬프트에서 그럴듯한 모션을 생성하는 것은 충분히 해결되어 흥미로운 작업은 다른 곳으로 옮겨갔습니다. 오픈 비디오 생성에서 만족스럽지 못한 부분은 오디오였습니다.
무음 생성이 사용자에게 떠넘기는 것을 생각해 보세요. 캐릭터가 말하지만 턱은 제멋대로 움직입니다. 누군가 걷지만 발소리는 후반 작업에서 수작업으로 프레임을 맞춰 추가해야 합니다. 문이 닫히지만 소리가 없고, 스톡 효과를 넣어도 올바른 프레임에 맞는 경우는 드뭅니다. 이들은 개별적으로는 작은 문제지만, 각각 편집자의 주의를 필요로 하기 때문에 집합적으로는 꾸준한 부담이 됩니다.
공동 모델링은 작업의 형태를 바꿉니다. 모델이 타이밍을 내부적으로 처리하므로, 출력은 완성된 클립에 더 가까운 형태로 도착합니다. 숏폼 콘텐츠, 소셜 광고, 캐릭터 애니메이션에서는 이것이 데모와 납품물의 차이입니다.
Pro가 실제로 긴밀한 동기화를 달성하는지는 아키텍처가 이를 지원하는지와는 별개의 질문이며, 이를 판가름할 독립 평가는 아직 나오지 않았습니다. 이번 릴리스는 주장을 하고 데모를 제공하지만, 그것을 증거로 받아들이기는 이릅니다.
오픈 비디오 동향에서의 위치
5초짜리 짧은 클립은 Kandinsky 6.0을 현재 오픈소스 비디오 생성 분야에서 앞서기보다는 바로 그 안에 위치시킵니다. 알리바바의 Wan 3.0은 Artificial Analysis의 재구성된 텍스트-투-비디오 보드에서 Elo 1157로 1위를 차지하고 있으며, 직접 실행할 가치가 있는 오픈 가중치 옵션, 특히 MiniMax H3는 이미 자리 잡았습니다.
따라서 공정한 평가는 혁명적이라기보다 경쟁력 있다는 것입니다. Kandinsky 6.0이 추가하는 것은 오픈 라이선스의 네이티브 오디오와 진지한 품질 계층부터 경량 계층까지 아우르는 크기 범위입니다. 특히 3B Lite 모델은 29B 디퓨전 모델을 호스팅하는 것을 정당화할 수 없었던 팀에게 문을 열어줍니다.
2계층 구조는 또한 팀에게 명시적으로 고려할 트레이드오프를 제공합니다. 프롬프트와 스토리보드를 반복하는 동안에는 Lite를 실행하세요, 5초 클립이 존재하기만 하면 되고 아름다울 필요는 없을 때입니다. 시퀀스가 확정되면 Pro로 이동하세요. 이는 폐쇄형 제공업체들이 한동안 지원해 왔고 오픈 가중치가 대체로 결여했던 워크플로 형태입니다.
지켜볼 것
6개월 후 이 릴리스가 중요한지 알려줄 세 가지가 있습니다.
첫째, 라이선스 조건입니다. 만약 진정으로 허용형으로 판명되면, 이 모델은 상업적 오픈 비디오 작업의 기본 옵션이 됩니다. 제한이 의미가 있다면, 도입은 제한이 적용되지 않는 지역에 집중될 것입니다.
둘째, 독립 벤치마크입니다. Artificial Analysis는 이미지-투-비디오 보드를 새로운 규모로 재구성하고 있으며, 그것이 나오면 모든 Elo가 움직입니다. Kandinsky 6.0이 그런 보드에 나타나기 전까지 품질 주장은 벤더 데모에 의존합니다. 현재 텍스트-투-비디오 리더보드는 Wan 3.0이 Elo 1157, 분당 $12 비용으로 1위이며, 20개 카테고리 중 10개에서 승리했는데, 이는 분야 정상이 얼마나 붐비는지 보여줍니다. Kandinsky 6.0은 그 수준에서 경쟁하지 않으며, 솔직한 질문은 그래야 할 필요가 있느냐입니다.
셋째, 오디오가 면밀한 검토를 견디는지입니다. 동기화는 사람이 카메라를 보고 말하는 5초 클립에서는 보여주기 쉽고, 소리가 겹치는 붐비는 장면에서는 보여주기 어렵습니다. 지금까지 공개된 데모는 쉬운 버전입니다.
이 위에 구축할 계획인 모든 팀에 적용되는 한 가지 고려 사항이 더 있습니다. 비디오 생성 모델은 실행 비용이 많이 들고, 29B 디퓨전 모델은 상당한 배포입니다. fal을 통해 용량을 임대하면 그 부담은 사라지지만, 오픈 가중치의 주요 장점인 직접 실행도 사라집니다. 대부분의 팀에게 3B Lite 계층이 더 흥미로운 옵션인데, 소규모 스튜디오가 이미 보유한 하드웨어에서 그럴듯하게 실행될 수 있는 계층이기 때문입니다.
지금으로서 흥미로운 사실은 구조적입니다. 완전히 허용형일 수도 아닐 수도 있는 라이선스 아래에서, 같은 날 추론 지원이 도착하는, 그림과 소리를 함께 생성하는 오픈 모델. 오픈과 폐쇄형 비디오 생성 사이의 격차는 이번 주 좁혀졌고, 라이선스 질문이 그 격차가 얼마나 폐쇄된 채로 남을지를 결정할 것입니다.
관련 글
구글 Flow와 Adobe Firefly, AI 비디오를 채팅창 밖으로 꺼내다
기본 모델 품질이 충분히 수렴하면서 차별화 요소는 모델을 둘러싼 것들로 옮겨갔습니다.
구글, 나노 바나나 2.1 출력 가격을 절반으로 인하하고 가장 취약한 기능을 개선하다
가장 중요한 세부 사항은 기능 목록 밖에 있으며, 바로 가격입니다.
Vida, AI 에이전트 요금을 사용량이 아닌 성과 기준으로 청구하려 한다
사용량 기반 청구는 에이전트가 더 오래 걸릴수록 공급업체의 수익이 늘어나게 합니다. 성과 기반 가격은 이를 뒤집습니다.
Decagon의 Voice 3와 PACT, 상대편에 있는 에이전트를 위한 고객 지원을 준비하다
고객 지원 시스템은 수십 년 동안 인간 행동을 모델링해 왔다. 이제 들어오는 요청 중 일부는 사람을 대신해 행동하는 기계다.