← Voltar ao blog
Aicerca de 8 min de leitura

Kandinsky 6.0 abre os pesos de vídeo que geram som na mesma passagem

Publicado 6 de out. de 2026
Kandinsky 6.0 abre os pesos de vídeo que geram som na mesma passagem

--- title: Kandinsky 6.0 abre os pesos de vídeo que geram som na mesma passagem meta_title: Kandinsky 6.0 disponibiliza vídeo com áudio nativo em código aberto meta_description: O Kandinsky Lab lançou modelos de vídeo de 3B e 29B que geram áudio sincronizado em uma única passagem, sob licença MIT, com suporte ao vLLM-Omni desde o primeiro dia. ---

A maioria dos sistemas abertos de texto para vídeo trata o som como problema de outra pessoa. Você gera uma filmagem silenciosa, depois encaixa uma trilha sonora por cima, e o movimento dos lábios raramente coincide com o diálogo. A resposta do Kandinsky Lab, lançada esta semana na fal, é modelar os dois ao mesmo tempo.

O Kandinsky 6.0 Video chega em dois tamanhos: um modelo Pro de 29B voltado para resultados cinematográficos e uma versão Lite de 3B para iteração rápida. O código e os pesos estão disponíveis sob licença MIT, o que importa mais do que a contagem de parâmetros para quem planeja uso comercial.

O que os dois níveis realmente entregam

Ambos os modelos são voltados para a geração de conteúdo de formato curto. Os clipes chegam a cerca de cinco segundos, e o áudio sai com taxa de amostragem de 44 kHz. O Pro é o nível de qualidade; o Lite é posicionado para equipes que precisam iterar rapidamente e aceitam trocar fidelidade por velocidade e custo.

O principal destaque é a geração conjunta. Linguagem, visão e áudio são modelados em conjunto, e não em um pipeline, de modo que passos, efeitos ambientes e o formato da boca se alinham com o que acontece na tela. Esse tipo de sincronização nativa tem sido, em grande parte, domínio de sistemas comerciais fechados, e é isso que torna um lançamento aberto notável.

Ondulações translúcidas sobrepostas em água escura iluminadas por luz âmbar quente e azul-petróleo fria

O vLLM-Omni oferece suporte de inferência desde o primeiro dia. Isso importa além da conveniência. Quando uma pilha de inferência passa a dar suporte no dia do lançamento, e não semanas depois, as equipes podem avaliar um modelo em sua própria carga de trabalho antes que o entusiasmo inicial se dissipe.

Na fal, o modelo vem acompanhado de upscaling integrado e de uma ferramenta autônoma de super-resolução de vídeo. Na prática, o fluxo é o seguinte: entra texto ou imagem, sai um clipe de cinco segundos e depois vem o upscale.

O licenciamento exige uma leitura cuidadosa

Eis a parte que merece atenção. A cobertura do lançamento o descreve como MIT, e o próprio anúncio do Kandinsky Lab afirma que o código e os pesos são fornecidos sob licença MIT. Um rastreador independente de modelos, porém, classifica o licenciamento como personalizado, e não como permissivo padrão.

Vale a pena resolver essa discrepância antes que alguém construa um produto sobre esses pesos. Uma licença genuinamente permissiva significa uso comercial, modificação e redistribuição sem um acordo separado. Uma licença personalizada pode parecer igualmente aberta à primeira vista e ainda assim trazer restrições que só aparecem depois, muitas vezes relacionadas a território, escala ou redistribuição a jusante.

O padrão deste ano tem sido laboratórios chineses publicarem pesos abertos com nomes que soam permissivos e exceções enterradas nos termos. A licença do H3 da MiniMax, por exemplo, exclui Estados Unidos, União Europeia, Reino Unido e Coreia do Sul. Quem passa do cartão do modelo para um plano de implantação deve ler os termos reais.

Pesos de vídeo sob licença MIT seriam um passo significativo se confirmarem o que é descrito. Licenças permissivas para vídeo são mais raras do que licenças permissivas para modelos de linguagem, em parte porque modelos de vídeo levantam questões de proveniência mais complexas em torno dos dados de treinamento e em parte porque os laboratórios que os produzem são, com mais frequência, comerciais. Um modelo de vídeo genuinamente aberto que também lidasse com áudio daria a estúdios menores um caminho que não exige contrato de API.

Por que o áudio sincronizado é o problema mais difícil

Gerar movimento plausível a partir de um prompt de texto já está resolvido o suficiente para que o trabalho interessante tenha migrado para outro lugar. A parte insatisfatória da geração aberta de vídeo tem sido o áudio.

Considere o que a geração silenciosa empurra para o usuário. Um personagem fala, mas o maxilar se move conforme a própria programação. Alguém caminha, mas os passos precisam ser adicionados na pós-produção, sincronizados quadro a quadro manualmente. Uma porta se fecha, mas não há som, e inserir um efeito de banco raramente cai no quadro certo. São problemas pequenos individualmente e um imposto constante no conjunto, porque cada um exige a atenção de um editor.

A modelagem conjunta muda a forma da tarefa. O modelo cuida do timing internamente, então a saída chega como algo mais próximo de um clipe finalizado. Para conteúdo de formato curto, anúncios para redes sociais e animação de personagens, essa é a diferença entre uma demonstração e uma entrega.

Se o Pro realmente alcança sincronização precisa é uma questão separada de a arquitetura suportar isso, e as avaliações independentes que resolveriam a dúvida ainda não saíram. O lançamento faz a afirmação e fornece demonstrações; tratá-las como prova seria prematuro.

Onde ele se posiciona no grupo de vídeo aberto

Clipes curtos de cinco segundos colocam o Kandinsky 6.0 exatamente no campo atual de geração de vídeo de código aberto, e não à frente dele. O Wan 3.0 da Alibaba ocupa o primeiro lugar no quadro de texto para vídeo reconstruído do Artificial Analysis, com Elo de 1157, e as opções de pesos abertos que vale a pena rodar por conta própria, notadamente o MiniMax H3, já estão estabelecidas.

Portanto, o enquadramento justo é competitivo, e não revolucionário. O que o Kandinsky 6.0 acrescenta é áudio nativo sob licença aberta e uma faixa de tamanhos que abrange um nível de qualidade sério e outro leve. O modelo Lite de 3B, em particular, abre a porta para equipes que nunca poderiam justificar hospedar um modelo de difusão de 29B.

A estrutura de dois níveis também dá às equipes um trade-off para ponderar explicitamente. Rode o Lite enquanto itera em prompts e storyboards, quando um clipe de cinco segundos precisa existir, mas não precisa ser bonito. Passe para o Pro quando a sequência estiver definida. Esse é um formato de fluxo de trabalho que os provedores fechados apoiam há algum tempo e que os pesos abertos em grande parte não tinham.

O que ficar de olho

Três coisas dirão se este lançamento importa daqui a seis meses.

Primeiro, os termos da licença. Se forem genuinamente permissivos, o modelo se torna uma opção padrão para trabalho comercial de vídeo aberto. Se as restrições forem significativas, a adoção se concentrará em territórios onde elas não incomodam.

Segundo, benchmarks independentes. O Artificial Analysis está reconstruindo seu quadro de imagem para vídeo em uma nova escala, e todos os Elos se movem quando ele chega. Até que o Kandinsky 6.0 apareça em um quadro como esse, as alegações de qualidade se apoiam em demonstrações do fornecedor. O ranking atual de texto para vídeo tem o Wan 3.0 no topo, com Elo de 1157 e custo de US$ 12 por minuto, com 10 de 20 vitórias por categoria, o que dá uma ideia de quão concorrido é o topo do campo. O Kandinsky 6.0 não compete nesse nível, e a pergunta honesta é se ele precisa.

Terceiro, se o áudio se sustenta sob escrutínio. A sincronização é fácil de mostrar em um clipe de cinco segundos de uma pessoa falando para a câmera, e difícil de mostrar em uma cena cheia, com sons sobrepostos. As demonstrações publicadas até agora são a versão fácil.

Mais uma consideração se aplica a qualquer equipe que planeje construir sobre isso. Modelos de geração de vídeo são caros de rodar, e um modelo de difusão de 29B é uma implantação séria. Alugar capacidade pela fal remove esse fardo, mas também remove a principal vantagem dos pesos abertos, que é rodá-los por conta própria. O nível Lite de 3B é a opção mais interessante para a maioria das equipes, porque é o que pode plausivelmente rodar no hardware que um pequeno estúdio já possui.

Por ora, o fato interessante é estrutural. Um modelo aberto que produz imagem e som juntos, sob uma licença que pode ou não ser totalmente permissiva, com suporte de inferência chegando no mesmo dia. A lacuna entre a geração de vídeo aberta e a fechada diminuiu esta semana, e a questão do licenciamento decidirá quanto dessa lacuna permanece fechada.

Artigos relacionados