Vidu Q3 ha diviso il reference-to-video in tre prodotti. È una decisione di packaging tanto quanto una decisione di modello.

La maggior parte dei lanci di modelli video viene annunciata una volta e poi compare ovunque sotto un unico nome. Vidu ha fatto l'opposto con la sua linea reference-to-video Q3.
Il 14 settembre, Model Studio di Alibaba Cloud ha listato tre modelli Vidu Q3 reference-to-video distinti. Il primo, viduq3-mix, è un modello general-purpose che prende immagini di riferimento e un prompt testuale e fonde i soggetti di quelle immagini nella scena descritta. Il secondo, viduq3-ad, è costruito per la pubblicità, con tagli di scena di livello marketing, movimenti di camera e output audio diretto; carichi le immagini del prodotto e ottieni un video pubblicitario. Il terzo, viduq3-drama, è pensato per la produzione di drama e manga AI, con coerenza dei personaggi, effetti di movimento ed espressività emotiva calibrati per contenuti narrativi.
Tutti e tre funzionano a 0,14 $ al secondo per 720p o 1080p, con un limite di 5 richieste al secondo. Il prezzo è identico per tutti e tre, il che ti dice che la differenziazione non sta nel costo ma nel comportamento dell'output.
Il problema che Vidu si è effettivamente posta di risolvere
Vidu nasce da Shengshu Technology, a Pechino. Il suo modello Q3 è stato lanciato il 30 gennaio 2026 e ha subito fatto il giro dei benchmark. Artificial Analysis lo ha classificato primo in Cina e secondo a livello globale al lancio, davanti a Runway Gen-4.5, Google Veo 3.1 e Sora 2 di OpenAI, con un punteggio di 1241.
Vale la pena nominare i tre cambiamenti tecnici dietro quella classifica. Q3 è stato tra i primi modelli video long-form a produrre dialoghi sincronizzati, effetti sonori e musica di sottofondo nello stesso passaggio delle immagini, invece di aggiungere l'audio in post-produzione. Ha esteso le clip in singola esecuzione a 16 secondi, la durata più lunga tra i modelli principali all'epoca. E ha costruito un sistema reference-to-video in cui gli utenti caricano da tre a sette immagini di un personaggio, oggetto o stile e il modello le usa come ancore visive nelle generazioni successive.
Il sistema di riferimento è quello interessante. La maggior parte dei modelli video nel 2026 compete sullo stesso asse: far sembrare impressionante una singola clip. La scommessa di Vidu era diversa. Il messaggio non è mai stato «guarda che inquadratura splendida». Era «guarda lo stesso personaggio in dieci inquadrature e nota che sembra ancora la stessa persona».
È un problema più difficile, ed è quello da cui dipende davvero il contenuto seriale. In un confronto con Runway Gen-4, Kling 3.0, Luma Ray, Pika 2.0 e Sora 2 usando lo stesso prompt di personaggio su sei variazioni di scena, Vidu Q3 ha mantenuto la coerenza di volto e abbigliamento in cinque dei sei test.
La coerenza è ciò che distingue uno strumento per clip estemporanee da uno strumento per una serie. Per i creator di anime, i produttori di short drama e chiunque costruisca contenuti di brand attorno a un personaggio ricorrente, cambia ciò che è possibile fare.
Perché tre SKU contano
Dividere una famiglia di modelli in tre prodotti con nomi distinti sembra una scelta di marketing. È più simile a una decisione di approvvigionamento.

Un team pubblicitario e uno studio di short drama non comprano la stessa cosa, anche se il transformer sottostante è simile. L'acquirente pubblicitario ha bisogno di fedeltà del prodotto, transizioni di scena pulite e un audio che possa stare sotto una voce di brand. L'acquirente di drama ha bisogno di un personaggio che mantenga la propria identità tra episodi e inquadrature, con espressioni che si leggano come performance. Confezionare tutto questo come ID di modello separati, con documentazione separata, permette a ciascun acquirente di valutare e preventivare esattamente un solo compito, invece di leggere un elenco di funzionalità general-purpose e tirare a indovinare.
Il modello mix general-purpose serve poi tutti quelli fuori da entrambe le caselle: una struttura ragionevole per un mercato in cui l'acquirente è sempre più un team di produzione con una scadenza, piuttosto che un hobbista che testa prompt.
Vidu Claw e il livello di pipeline
Confezionare i modelli è metà della strategia. L'altra metà è un livello di assemblaggio. Vidu Claw è un motore di automazione della creazione AI costruito sul framework open source OpenClaw e alimentato da Q3. Colleghi i tuoi token Vidu, definisci le Skill e automatizzi il percorso dall'idea al video finito. Un singolo prompt come «crea un annuncio short-form per una scarpa da running rivolta a giovani donne su Instagram» basta a Vidu Claw per generare concept, script, storyboard, immagini, voiceover, musica e montaggio finale.
Le recensioni indipendenti sono state contrastanti in modo utile. Un recensore che l'ha testato su uno spot di prodotto ha trovato la piattaforma davvero gratuita e accessibile per studenti e principianti, ma ha riferito che faticava con dettagli strutturali precisi. In un caso continuava a renderizzare un dettaglio in un modo che risaltava anche dopo ripetute correzioni del prompt, e l'output aveva un sapore di AI evidente, con luci e colori che sembravano economici.
Questo è il compromesso onesto. Vidu Claw è uno strumento di produttività per creator individuali e piccoli team di marketing che devono passare rapidamente dal concept a una bozza utilizzabile, più che un sostituto di un team di produzione professionale. Quando funziona, comprime un ciclo di produzione pubblicitaria di cinque giorni in uno. Quando non funziona, i problemi di qualità sono difficili da ignorare.
L'ecosistema attorno a cui Vidu sta costruendo
L'attenzione al reference-to-video si collega a una storia di distribuzione. A febbraio 2026, la software house Wondershare ha annunciato un investimento strategico in Shengshu, con i due che pianificano di lavorare insieme sul manga AI. Il modello Vidu Q3 è stato integrato in una piattaforma di produzione manga AI a filiera completa, usata per mantenere coerenti personaggi, voci e scene tra gli episodi. Anche la piattaforma Bailian di Alibaba Cloud ha aggiunto Vidu Q3 come modello di terze parti a maggio 2026.
Il modello viaggia quindi attraverso almeno tre canali: accesso diretto via web e API, una piattaforma di creazione rivolta a manga e short drama, e un marketplace di modelli cloud. Ogni canale ha un acquirente diverso con una definizione diversa di «abbastanza buono».
Dove stanno davvero i soldi
Lo spostamento verso i contenuti seriali non è una preferenza creativa. È dove stanno i budget. Uno short drama è un prodotto multi-episodio con un cast ricorrente, e la sua economia dipende dal produrre molto più girato di un singolo spot o di una clip una tantum. Se un modello costringe il creator a ripartire da zero sull'aspetto del personaggio a ogni inquadratura, i risparmi ottenuti dal girato generato vengono mangiati dalle correzioni di coerenza. La scommessa di Vidu è che il team disposto a pagare 0,14 $ al secondo non stia comprando una singola inquadratura bellissima, ma un modo per mantenere la stessa persona riconoscibile lungo un'intera serie.
È anche per questo che il sistema di riferimento conta più del punteggio di qualità grezzo. Un modello che si classifica secondo al mondo su un benchmark è impressionante, ma il benchmark misura clip. La funzione di riferimento misura serie. I due non sono lo stesso acquisto, e Vidu vende al secondo.
Dove non arriva ancora
La coerenza dei riferimenti non è perfetta, e cinque su sei non è sei su sei. Nel caso in cui il sesto test è fallito, lo strumento ha prodotto un volto e un abbigliamento che si allontanavano dalla fonte, che è esattamente il tipo di errore che rompe una serie. Il costo è reale a 0,14 $ al secondo, che si accumula in fretta su una clip da 16 secondi e diventa significativo alla scala di una serie, dove sono in gioco centinaia di inquadrature. Il livello di pipeline produce bozze più che spot finiti, e i recensori hanno rilevato che non riesce a correggere in modo affidabile un dettaglio strutturale nemmeno con ripetute correzioni del prompt.
C'è anche un limite strutturale che vale la pena nominare. Il reference-to-video ancora l'identità, ma non risolve ancora la continuità per un'intera produzione. Qualcuno deve comunque fare le scelte registiche che trasformano un insieme di clip coerenti in una storia, e il modello non ha opinioni su ritmo, copertura o se una scena debba esistere.
Cosa tenere d'occhio
La struttura a tre SKU è la parte che altri fornitori probabilmente copieranno. Se il reference-to-video diventa il modo predefinito di realizzare contenuti seriali, aspettatevi che sempre più famiglie di modelli propongano varianti specifiche per compito invece di un unico flagship. Le domande che contano adesso sono se la coerenza regge su durate più lunghe e movimenti di camera più difficili, e se il livello di pipeline diventerà abbastanza buono da vendere a uno studio invece che a un creator individuale.
Articoli correlati
Gli strumenti video AI ottengono 9 su 10 per facilità d'uso. Il punteggio di conformità è un'altra storia.
Gli utenti adorano i generatori video AI. I reparti legali non sono ancora stati interpellati.
InternLumina-U2 riunisce testo, immagini, video e 3D in un unico modello da 16B, poi distribuisce due set di pesi
L'elenco delle attività è ambizioso. Il formato di rilascio porta più segnali.
HappyOyster vende un mondo in cui puoi entrare, non una clip da guardare
La maggior parte dei modelli video ti consegna un file. Questo ti consegna una stanza con dentro una porta.
Luma Ray3 Modify mantiene la performance e rinegozia il mondo che la circonda
Il problema più difficile nell'editing video con AI non è l'effetto. È non rovinare la ripresa che hai già pagato.