← Torna al blog
Aicirca 7 min di lettura

Wan 3.0 guida la classifica video ricostruita, e Kling 3.0 ne diventa l'ancora

Pubblicato 7 ott 2026
Wan 3.0 guida la classifica video ricostruita, e Kling 3.0 ne diventa l'ancora

Artificial Analysis ha ricostruito la sua classifica text-to-video il 30 settembre. La nuova scala, AA-Video-T2V v2.0, valuta ogni modello a 1080p e si basa su oltre 68.000 voti di preferenza umana su circa 1.000 prompt, raggruppati in dieci categorie d'uso e dieci assi di capacità. Wan 3.0 è primo con audio con un Elo di 1.156, e conquista il primo posto in dieci delle venti classifiche di categoria.

Il numero che dice di più sullo stato del mercato è quello in fondo. Kling 3.0 a 1080p è l'ancora fissa a 1.000. Nessuno è classificato sotto di esso perché la scala è fissata lì. Il precedente flagship di Kuaishou era lo standard nazionale per i video AI; su questa classifica è il punto di riferimento su cui tutto il resto viene misurato.

Un gruppo, non un podio

I primi quattro modelli sono entro 18 punti l'uno dall'altro, con barre di errore di circa nove o dieci. Wan 3.0 guida a 1.156. Utopai X, che è post-addestrato su MiniMax H3 e non ha API pubblica, è secondo a 1.148. Dreamina Seedance 2.5 segue a 1.142, e MiniMax H3 a 768p è quarto a 1.138. H3 Max di fal completa il gruppo a 1.134.

Leggi quei numeri come un gruppo, non come una scala. Un modello che ottiene un punteggio entro una barra di errore dal leader non è misurabilmente peggiore del leader. Tre dei primi cinque sono H3 o basati su di esso, che è il fatto più interessante: la base open-weight rilasciata da MiniMax è diventata il substrato su cui altri team fanno post-training, allo stesso modo in cui tre anni fa si costruiva su Stable Diffusion.

C'è una storia di distribuzione sotto la classifica che la classifica rende visibile per la prima volta. Un anno fa, la vetta di una classifica video era una lista di modelli chiusi di una manciata di laboratori ben finanziati. Oggi i primi cinque includono una base open-weight e due modelli post-addestrati su di essa da team più piccoli. Utopai X non ha API pubblica, quindi il modello che si trova secondo in una classifica pubblica resta fuori portata per chiunque sia fuori dall'azienda. È un nuovo tipo di artefatto di classifica, e dice qualcosa su quanto velocemente un buon ciclo di post-training possa portare una base aperta in competizione.

Nella classifica complementare senza audio, lanciata lo stesso giorno, Wan 3.0 guida a 1.129 con H3 e H3 Max che occupano il secondo e terzo posto. Rimuovere l'audio restringe il campo, il che suggerisce che il vantaggio dei modelli cinesi passi dalla loro gestione dell'audio piuttosto che solo dagli elementi visivi. Inoltre ribalta l'interpretazione della classifica: uno studio che ha bisogno solo di filmati muti vede un quadro competitivo diverso rispetto a uno che ha bisogno di dialoghi con sincronizzazione labiale.

Cosa dice la colonna del prezzo

La classifica riporta anche un prezzo al minuto, e quella colonna si legge diversamente dalla colonna Elo. Wan 3.0 costa 12 $ al minuto di video. Seedance 2.5 è il modello più costoso nella top ten a 34,12 $ al minuto. MiniMax H3, che chiunque può scaricare, costa 4,80 $ al minuto.

Una scheda di valutazione bianca e vuota appoggiata su una scrivania di quercia chiara con una singola matita sottile appoggiata in diagonale, la scheda completamente senza segni

Quindi il modello open-weight al terzo posto costa un quarto di quanto chiede il leader e un settimo di quanto chiede il modello commerciale al secondo posto. Per un team che lancia un prodotto, quel divario conta più di diciannove punti Elo. La domanda si sposta da “qual è il modello migliore” a “qual è il modello abbastanza buono che il costo al minuto non uccida il business case”. H3 è la risposta per molti team che un anno fa avrebbero pagato per Seedance.

Il dato di 34,12 $ al minuto di Seedance 2.5 merita un secondo sguardo, perché è la voce più costosa della top ten e si classifica terzo. Il prezzo implica un cliente che dà abbastanza valore alla qualità da pagare sette volte la tariffa open-weight, e quei clienti esistono nella pubblicità e nel cinema. Ciò che la classifica non può mostrare è se quel premio sopravvive al contatto con un budget. Se una produzione richiede duecento inquadrature, la differenza tra 34 $ e 4,80 $ al minuto è la differenza tra un progetto e un problema di foglio di calcolo.

Il vantaggio di Wan 3.0 ha un'avvertenza: è in beta commerciale ad accesso su invito. H3 è quello che puoi effettivamente acquistare oggi a un prezzo pubblicato. Una posizione in classifica per un modello a cui non puoi accedere è un segnale su dove sta andando il settore, non una decisione di acquisto.

La classifica di video-editing aggiunge una seconda dimensione. Wan 3.0 detiene il primo posto lì con un Elo di 1.188, strappando la categoria a MiniMax H3, che l'aveva detenuta dal suo debutto ad agosto. L'editing è dove vivono i flussi di lavoro pratici, perché la maggior parte del lavoro video commerciale parte da filmati già esistenti. Un modello che guida nella generazione ma è indietro nell'editing è meno utile per un team di produzione rispetto a un modello forte in entrambi. Wan 3.0 attualmente guida in entrambi, che è la posizione più forte che qualsiasi modello abbia detenuto su questa classifica.

Kling 4.0 è stato lanciato come una scheda tecnica

L'altra cosa che questa classifica chiarisce è quanto del recente lancio di Kling 4.0 esista al di fuori di un comunicato stampa. L'account di Kuaishou ha annunciato il modello il 28 settembre: fino a 4K, HDR a 10 bit, 15 riferimenti multimodali, 10 keyframe, generazione nativa da 30 secondi, audio stereo. La data di uscita era “in arrivo questo ottobre”.

Ciò che è stato effettivamente distribuito è Kling 4.0 Flash, disponibile per gli abbonati Ultra Yearly. La pagina delle funzionalità non riporta prezzo, data, testo sulla risoluzione né menzione di ottobre. La voce Kling più recente su qualsiasi classifica di Artificial Analysis è ancora 3.0. Un post di un creator che ha rivelato che Kling lo ha pagato dice che l'output di lancio è a 1080p ed è più economico di Seedance, il che è in conflitto con il titolo “fino a 4K”.

Niente di tutto ciò rende false le capacità annunciate. Significa che il divario tra un annuncio e un modello utilizzabile è dove vive la maggior parte del lavoro, e questo lancio non l'ha ancora colmato. Una scheda tecnica che elenca 4K, HDR, quindici riferimenti e dieci keyframe descrive un set di capacità che, se distribuito, sarebbe il più forte sul mercato aperto. Descrive anche una serie di funzionalità a cui ogni concorrente dovrà rispondere entro un trimestre.

Lo schema è familiare dagli ultimi due anni di lanci di modelli. Gli annunci stabiliscono aspettative, e l'intervallo prima della disponibilità generale è dove viene costruito il prodotto reale. Per un acquirente, il consiglio pratico è lo stesso di sempre: non pianificare una pipeline di produzione intorno a una pagina di funzionalità. Pianificala intorno a ciò che puoi chiamare oggi.

Cosa tenere d'occhio

Il prossimo segnale è se Wan 3.0 lascia la beta ad accesso su invito e pubblica un prezzo. Se lo fa, il divario tra il leader e il gruppo open-weight diventa una vera decisione di budget anziché una teorica.

Il secondo segnale è Kling 4.0 stesso. Il suo ultimo flagship ha fissato l'ancora su questa scala. Il prossimo è già prezzato nelle aspettative prima che qualcuno fuori da Kuaishou lo abbia provato. Quando arriverà, arriverà contro una classifica in cui tre dei primi cinque posti sono già occupati da modelli che costano meno.

Il terzo è cosa succede all'ancora stessa. Kling 3.0 si trova a 1.000 per definizione. Se Kling 4.0 viene distribuito e si posiziona sopra, il punto fisso della scala si sposta e ogni Elo sulla classifica diventa un confronto con una nuova baseline. Quello è il momento in cui questa classifica smette di descrivere settembre e inizia a descrivere dove sta andando l'anno.

Articoli correlati