Kling VIDEO O1 trasforma la generazione video in un sistema di riferimento

--- title: Kling VIDEO O1 trasforma la generazione video in un sistema di riferimento slug: kling-video-o1-turns-video-generation-into-a-reference-system meta_title: Kling VIDEO O1 rende i riferimenti l'interfaccia meta_description: Il Kling VIDEO O1 di Kuaishou accetta testo, immagini, video, keyframe e riferimenti in qualsiasi combinazione, poi ti consente di estrarre elementi da una clip e portarli in un'altra. category: ai tags: Kling VIDEO O1,Kuaishou,generazione video,sistema di riferimento,keyframe,multimodale,Veo 3.1,Runway Aleph,coerenza ---
La divisione video di Kuaishou ha passato l'ultimo mese a rilasciare novità. Kling 4.0 è stato aperto ai tester, poi ha ottenuto una finestra di lancio più ampia. Ora arriva VIDEO O1 come qualcosa di più vicino a un cambio di categoria: un modello che accetta testo, immagini, clip video, keyframe e riferimenti di personaggi come input, e li tratta tutti come pezzi intercambiabili di un'unica richiesta.
L'etichetta che l'azienda usa è «multimodale unificato». La versione pratica è più facile da esprimere. Puoi allegare tre clip e scrivere: prendi il personaggio dal video uno, il movimento di camera dal video due, inserisci entrambi nel video tre e cambia lo stile in pixel art.
Un anno fa, quella singola richiesta avrebbe richiesto tre strumenti separati e un'attenta esportazione di file intermedi, con ogni passaggio che aggiungeva una compressione e una possibilità che il personaggio si discostasse.
Cosa ti offre davvero il riferimento tutto-in-uno
La coerenza di personaggi e oggetti è stato il problema ostinato nel video AI. I primi workaround concatenavano modelli, il che significava pagare per ogni passaggio e accettare qualsiasi deriva si accumulasse tra loro. L'approccio di Kling ripiega quella catena in un'unica generazione, così le immagini di riferimento, i keyframe e la direzione dello stile vengono risolti tutti insieme.
I numeri di Kling collocano O1 a un rapporto di vittorie del 247 percento contro la funzione «Ingredients to Video» di Veo 3.1 di Google nei compiti di riferimento immagini, e del 230 percento contro Runway Aleph nei compiti di trasformazione. Queste sono valutazioni interne, quindi vanno considerate indicative. L'affermazione sulle capacità è più verificabile: le scene di gruppo, dove più soggetti devono rimanere bloccati individualmente, sono gestite per soggetto anziché come un'unica media combinata.
La durata del video va da tre a dieci secondi, regolabile, il che ti consente di scandire il ritmo di un'inquadratura invece di accettare ciò che decide il modello. Sotto il cofano, l'azienda descrive un transformer multimodale con un lungo contesto multimodale, più un nuovo formato interno che chiama linguaggio visivo multimodale, che fonde segnali testuali, visivi e audio all'interno del transformer stesso. Il ragionamento chain-of-thought integrato serve a mantenere il movimento generato fisicamente plausibile.
I tipi di generazione elencati sembrano una checklist di tutto ciò che la categoria ha diviso in strumenti separati: text-to-video, image-to-video, video-to-video, keyframe-to-video, multiple-images-to-video e reference-to-video-to-video. Ognuno di questi era un prodotto. L'affermazione di O1 è che sono modalità di un unico sistema.
Perché l'interfaccia conta più del benchmark
La parte interessante è che O1 vince un confronto, ma la superficie di input del modello è il cambiamento che conta di più. Ora è una libreria di asset riutilizzabili. Un personaggio costruito da più angolazioni diventa un elemento che alleghi per nome invece di ridescriverlo in ogni prompt. Il movimento di camera diventa qualcosa che prendi in prestito da una clip invece di approssimarlo con aggettivi.

Questo cambia la forma del flusso di lavoro. La catena lineare di modello per immagini, poi modello video, poi editor, con un costo a ogni passaggio, si riduce a meno passaggi. Cambia anche il pubblico a cui è rivolto lo strumento: i team di post-produzione ricevono istruzioni in linguaggio naturale al posto di passaggi di tracking e mascheratura, e i team pubblicitari ottengono un modo per sostituire uno shoot senza ricostruire ogni inquadratura da zero.
Il vocabolario è l'altra metà dell'interfaccia. Allegare un elemento per nome significa che un team può concordare su come si chiama un personaggio prima di scrivere il prompt di una singola inquadratura, poi riutilizzare quel nome in tutta una campagna. Approssimare la stessa cosa con aggettivi funziona una volta e diventa più difficile a ogni revisione, perché non c'è traccia di quale combinazione di aggettivi abbia prodotto la versione che piaceva a tutti.
La documentazione del fornitore descrive i casi d'uso professionali in termini simili. La produzione cinematografica AI si affida alla libreria di elementi per mantenere coerenti personaggi e oggetti durante uno shoot. Pubblicità e moda la usano come sostituto del lavoro in location, incluse passerelle virtuali. La post-produzione la usa per apportare modifiche che in precedenza richiedevano rotoscoping fotogramma per fotogramma.
Qui c'è un effetto di autoselezione. Un modello con così tanti tipi di input non è più amichevole per i principianti; è più amichevole per chi sa già cosa vuole. È un cambiamento significativo per una categoria che ha passato due anni a ottimizzare l'esperienza al primo utilizzo.
Cosa sostituisce il sistema di riferimento
Il modo più chiaro per capire il cambiamento è guardare a cosa un team costruiva intorno a un modello debole. Le pipeline di coerenza erano catene di montaggio: genera un character sheet, inseriscilo in ogni inquadratura come prompt immagine, genera un animatic, poi rigenera ogni inquadratura con un frame iniziale preso dall'animatic. Ogni fase esisteva perché la precedente non riusciva a portare abbastanza contesto in avanti.
Il sistema di riferimento di O1 prende di mira la ragione per cui quelle fasi esistevano. Se il modello può mantenere l'identità di un personaggio attraverso una scena di gruppo mentre prende anche il movimento di camera da una clip separata, allora alcune di quelle fasi diventano opzionali anziché obbligatorie. Le fasi opzionali sono dove i budget si spostano davvero, perché una pipeline costruita attorno a un limite non scompare solo perché il limite si è attenuato.
La stessa logica vale per la sequenza delle inquadrature. I programmi che generano l'inquadratura precedente o successiva in base al footage esistente trasformano una libreria di clip in qualcosa di più simile a una scena. I montatori che lavorano già in timeline riconosceranno il valore: il costo di provare un'angolazione alternativa scende da un nuovo shoot a una generazione.
Il compromesso è reale
Kling dice che O1 ha una curva di apprendimento più ripida rispetto a Sora 2 o Veo 3.1, perché ci sono più capacità da capire prima che una qualsiasi di esse sia utile. È il costo standard di un'interfaccia più espressiva. Un modello che accetta qualsiasi cosa come riferimento ti chiede di decidere cosa dovrebbe essere referenziato.
L'azienda non ha risolto l'audio in O1. Kling 2.6 è il modello che gestisce la generazione audio per la piattaforma, completo di dialogo sincronizzato, musica ed effetti sonori. Quindi una produzione completa significa ancora abbinare due modelli, uno per il linguaggio visivo e uno per la colonna sonora. Il marketing di Kling per 2.6 si basa sull'idea di vedere il suono e sentire il visual, che è una descrizione corretta di una capacità che vive al di fuori di O1.
Anche il prezzo riflette dove la piattaforma vuole posizionarsi. I crediti al secondo pubblicati da Kling salgono da sei crediti a 720p senza audio a dodici a 1080p con audio, e la piattaforma promuove una politica di uso commerciale che si estende anche alle generazioni gratuite. Per un modello posizionato sui flussi di lavoro professionali, il punto di ingresso resta abbastanza basso da consentire a un piccolo team di testarlo prima di impegnarsi.
Cosa tenere d'occhio
Se il sistema di riferimento di O1 regge al di fuori delle demo controllate. Le affermazioni sulla coerenza tendono a sopravvivere a clip brevi e sessioni brevi, per poi degradare quando un progetto va avanti per settimane e accumula dozzine di elementi. Il concetto di libreria di elementi ripaga solo se gli elementi restano stabili lungo quell'arco di tempo.
Kuaishou ha già detto che 4.0 porta la generazione nativa da 30 secondi e fino a 10 keyframe. Se il livello di riferimento di O1 si compone con quei limiti anziché competere con essi, la coppia copre sia la domanda «quanto lungo» sia quella «di chi è la faccia». Quella combinazione è ciò che gli studio aspettavano.
Anche il quadro competitivo a breve termine conta. Gemini Omni 1.1 Flash detiene il primo posto nel text-to-video su Arena con 1516, con MiniMax H3 in testa nell'image-to-video e Wan 3.0 in cima alla classifica video di Artificial Analysis. O1 non entra in un campo vuoto. La sua differenziazione è la superficie di input anziché una posizione in classifica, cosa più difficile da spiazzare una volta che i team costruiscono librerie di elementi attorno ad essa.
Articoli correlati
Le foto satellitari sono ora dati di addestramento per i robot
Il collo di bottiglia nell'addestramento dell'IA fisica ha smesso di essere la potenza di calcolo o la capacità del modello. È diventata la qualità del mondo sintetico.
Gemini 3.5 Live Translate di Google elimina la pausa
Una traduzione che funziona in continuo, con la voce di chi parla, su un telefono già nella tua tasca, sposta la funzione da qualcosa che apri a qualcosa che è semplicemente attiva.
La Cina ha scritto il primo standard di sicurezza obbligatorio per gli agenti AI
La sicurezza passa dall'essere una funzionalità che pubblicizzi a un cancello che devi superare. L'inventario dei rischi si attesta su 13 categorie e 97 voci.
I contenuti generati dall'AI iniziano a dover dichiarare la propria identità
Questo passo non risolve tutti i problemi, ma trasforma «generato dall'AI» da un'opzione che si poteva nascondere a una domanda a cui è obbligatorio rispondere.