Kandinsky 6.0 rende open source i pesi video che generano audio nella stessa passata

--- title: Kandinsky 6.0 rende open source i pesi video che generano audio nella stessa passata meta_title: Kandinsky 6.0 rende open source video con audio nativo meta_description: Kandinsky Lab ha rilasciato modelli video da 3B e 29B che generano audio sincronizzato in una sola passata, sotto licenza MIT, con supporto vLLM-Omni dal giorno zero. ---
La maggior parte dei sistemi open di text-to-video tratta il suono come un problema di qualcun altro. Generi filmati silenziosi, poi aggiungi una colonna sonora in un secondo momento, e il movimento delle labbra raramente si allinea con il dialogo. La risposta di Kandinsky Lab, rilasciata questa settimana su fal, è modellare entrambi contemporaneamente.
Kandinsky 6.0 Video è disponibile in due dimensioni: un modello Pro da 29B pensato per output cinematografici e una versione Lite da 3B per iterazioni rapide. Codice e pesi sono rilasciati sotto licenza MIT, il che conta più del numero di parametri per chiunque pianifichi un uso commerciale.
Cosa offrono effettivamente i due livelli
Entrambi i modelli sono pensati per la generazione short-form. Le clip durano fino a circa cinque secondi e l'audio viene emesso a una frequenza di campionamento di 44kHz. Pro è il livello di qualità; Lite è posizionato per team che necessitano di iterare rapidamente e sono disposti a scambiare fedeltà con velocità e costi.
La capacità principale è la generazione congiunta. Linguaggio, visione e audio sono modellati insieme anziché in una pipeline, quindi passi, effetti ambientali e forme della bocca si allineano con ciò che accade sullo schermo. Quel tipo di sincronizzazione nativa è stato per lo più dominio di sistemi commerciali chiusi, ed è ciò che rende notevole un rilascio open.

vLLM-Omni fornisce supporto per l'inferenza dal giorno zero. Questo conta al di là della comodità. Quando uno stack di inferenza fornisce supporto il giorno del rilascio anziché settimane dopo, i team possono valutare un modello rispetto al proprio carico di lavoro prima che l'entusiasmo iniziale svanisca.
Su fal, il modello è fornito con upscaling integrato e uno strumento autonomo di super-risoluzione video. Quindi la pipeline pratica è: input di testo o immagine, output di una clip di cinque secondi, poi upscale.
La licenza richiede un'attenta lettura
Ecco la parte che merita attenzione. La copertura del rilascio lo descrive come MIT, e l'annuncio stesso di Kandinsky Lab afferma che codice e pesi sono forniti sotto licenza MIT. Un tracker indipendente di modelli, tuttavia, elenca la licenza come personalizzata anziché standard permissiva.
Vale la pena risolvere questa discrepanza prima che qualcuno costruisca un prodotto su questi pesi. Una licenza veramente permissiva significa uso commerciale, modifica e ridistribuzione senza un accordo separato. Una licenza personalizzata può sembrare altrettanto aperta a prima vista e comunque portare restrizioni che emergono in seguito, spesso relative a territorio, scala o ridistribuzione a valle.
Quest'anno il modello è stato che i laboratori cinesi pubblicano pesi aperti con nomi che sembrano permissivi e eccezioni nascoste nei termini. La licenza H3 di MiniMax, ad esempio, esclude Stati Uniti, Unione Europea, Regno Unito e Corea del Sud. Chiunque passi da una model card a un piano di deployment dovrebbe leggere i termini effettivi.
Pesi video con licenza MIT sarebbero un passo significativo se si rivelassero come descritto. Le licenze video permissive sono più rare delle licenze permissive per modelli linguistici, in parte perché i modelli video hanno questioni di provenienza più complesse riguardo ai dati di addestramento e in parte perché i laboratori che li producono sono più spesso commerciali. Un modello video veramente aperto che gestisca anche l'audio darebbe agli studi più piccoli un percorso che non richiede un contratto API.
Perché l'audio sincronizzato è il problema più difficile
La generazione di un movimento plausibile da un prompt testuale è risolta abbastanza che il lavoro interessante si è spostato altrove. La parte insoddisfacente della generazione video aperta è stata l'audio.
Considera cosa la generazione silenziosa scarica sull'utente. Un personaggio parla, ma la mascella si muove con il suo ritmo. Qualcuno cammina, ma i passi devono essere aggiunti in post, allineati manualmente al frame. Una porta si chiude, ma non c'è suono, e inserire un effetto stock raramente cade sul frame giusto. Questi sono piccoli problemi individualmente e una tassa costante collettivamente, perché ognuno richiede l'attenzione di un editor.
La modellazione congiunta cambia la forma del compito. Il modello gestisce il timing internamente, quindi l'output arriva come qualcosa di più vicino a una clip finita. Per contenuti short-form, annunci social e animazione di personaggi, questa è la differenza tra una demo e un deliverable.
Se Pro raggiunga effettivamente una stretta sincronizzazione è una questione separata dal fatto che l'architettura la supporti, e le valutazioni indipendenti che potrebbero risolverla non sono ancora disponibili. Il rilascio fa l'affermazione e fornisce dimostrazioni; trattarle come prova sarebbe prematuro.
Dove si colloca nella coorte dei video aperti
Clip brevi di cinque secondi collocano Kandinsky 6.0 pienamente nel campo attuale della generazione video open source, piuttosto che davanti ad esso. Wan 3.0 di Alibaba detiene il primo posto nella classifica text-to-video ricostruita di Artificial Analysis con un Elo di 1157, e le opzioni open-weight che vale la pena eseguire autonomamente, in particolare MiniMax H3, sono già consolidate.
Quindi l'inquadramento equo è competitivo piuttosto che rivoluzionario. Ciò che Kandinsky 6.0 aggiunge è l'audio nativo con una licenza aperta e una gamma di dimensioni che spazia da un livello di qualità serio a uno leggero. Il modello Lite da 3B, in particolare, apre la porta a team che non potrebbero mai giustificare l'hosting di un modello di diffusione da 29B.
La struttura a due livelli offre anche ai team un compromesso da valutare esplicitamente. Usa Lite mentre iteri su prompt e storyboard, dove una clip di cinque secondi deve esistere ma non deve essere bella. Passa a Pro una volta che la sequenza è bloccata. Questa è una forma di workflow che i fornitori chiusi supportano da un po' e di cui i pesi aperti sono in gran parte privi.
Cosa tenere d'occhio
Tre cose ti direbbero se questo rilascio conta tra sei mesi.
Primo, i termini della licenza. Se si rivelano veramente permissivi, il modello diventa un'opzione predefinita per il lavoro video aperto commerciale. Se le restrizioni sono significative, l'adozione si concentrerà nei territori dove non hanno effetto.
Secondo, benchmark indipendenti. Artificial Analysis sta ricostruendo la sua classifica image-to-video su una nuova scala, e ogni Elo si muove quando viene pubblicata. Finché Kandinsky 6.0 non appare su una classifica del genere, le affermazioni sulla qualità si basano su dimostrazioni dei fornitori. L'attuale classifica text-to-video vede Wan 3.0 in cima con un Elo di 1157 e un costo di $12 al minuto, con 10 vittorie su 20 categorie, il che dà un'idea di quanto sia affollata la parte alta del campo. Kandinsky 6.0 non compete a quel livello, e la domanda onesta è se ne abbia bisogno.
Terzo, se l'audio regge sotto esame. La sincronizzazione è facile da mostrare in una clip di cinque secondi di una persona che parla alla telecamera, e difficile da mostrare in una scena affollata con suoni sovrapposti. Le demo pubblicate finora sono la versione facile.
Un'ultima considerazione si applica a qualsiasi team che pianifichi di costruire su questo. I modelli di generazione video sono costosi da eseguire, e un modello di diffusione da 29B è un deployment serio. Affittare capacità tramite fal rimuove quel fardello ma rimuove anche il principale vantaggio dei pesi aperti, ovvero eseguirli da soli. Il livello Lite da 3B è l'opzione più interessante per la maggior parte dei team, perché è quello che può plausibilmente girare su hardware che un piccolo studio già possiede.
Per ora, il fatto interessante è strutturale. Un modello aperto che produce immagini e suono insieme, sotto una licenza che potrebbe o meno essere completamente permissiva, con supporto per l'inferenza in arrivo lo stesso giorno. Il divario tra generazione video aperta e chiusa si è ridotto questa settimana, e la questione della licenza deciderà quanto di quel divario rimane chiuso.
Articoli correlati
Google Flow e Adobe Firefly portano il video AI fuori dalla chat
La qualità dei modelli di base si è sufficientemente uniformata che il fattore differenziante si è spostato su ciò che circonda il modello.
Google ha dimezzato il prezzo di output di Nano Banana 2.1 e ha corretto i suoi punti deboli
Il dettaglio più rilevante sta fuori dall'elenco delle funzionalità, ed è il prezzo.
Vida vuole fatturare gli agenti AI in base ai risultati anziché all'utilizzo
La fatturazione basata sull'utilizzo allinea i ricavi del fornitore con un agente che impiega più tempo. Il prezzo basato sui risultati ribalta tutto questo.
Voice 3 e PACT di Decagon preparano il supporto clienti per gli agenti dall'altra parte
I sistemi di supporto hanno passato decenni a modellare il comportamento umano. Ora una parte delle richieste in arrivo è costituita da macchine che agiscono per conto delle persone.