La classifica dei modelli video che nessuno pubblicizza: dove vanno davvero le richieste

Ogni settimana porta una nuova classifica di generazione video, e quasi tutte sono costruite allo stesso modo. I ricercatori raccolgono gli output di modelli concorrenti, li sottopongono a dei votanti e pubblicano una tabella Elo. Quelle tabelle sono utili per confrontare la qualità. Non dicono quasi nulla su ciò che fanno gli acquirenti.
Un tipo diverso di classifica è ora pubblico. OpenRouter pubblica i volumi di richieste dei modelli video attraverso il suo servizio di routing, aggregati dall'utilizzo reale. I numeri della settimana che termina il 1° ottobre raccontano una storia che le classifiche di qualità non raccontano.
La tabella dei volumi
Veo 3.1 Lite di Google ha mantenuto il primo posto con circa 41.000 richieste, in aumento di circa il 15 per cento. Seedance 2.5 di ByteDance era secondo con circa 30.000 richieste, in aumento di circa il 28 per cento. Seedance 2.0 Fast era terzo con 22.000. Veo 3.1 Fast era quarto con 17.000, in aumento di quasi il 95 per cento rispetto alla settimana precedente. HeyGen Video è entrato nella lista come nuovo arrivato con circa 17.000 richieste.
Sotto i primi cinque, Wan 2.7 di Alibaba ha registrato la variazione più ampia della classifica, con un aumento di oltre il 300 per cento fino a circa 12.000 richieste. Wan 3.0 si è attestato all'incirca sullo stesso volume. Video v3.0 Pro di Kling è entrato nella top ten con circa 10.000 richieste.

Ora confrontatelo con le tabelle di qualità. Nella classifica text-to-video di Arena, Gemini Omni 1.1 Flash è in testa. MiniMax H3 guida la categoria image-to-video. Kling 3.0 è in cima a diverse classifiche commerciali sul valore. Nessuno di questi modelli compare in cima alla lista dei volumi di richieste.
I livelli Lite stanno vincendo perché il lavoro è cambiato
Lo schema che spiega gran parte della tabella è prezzo e velocità. Veo 3.1 Lite è il livello più economico e veloce di Google, ed è il modello più richiesto del servizio. Veo 3.1 Fast ha quasi raddoppiato il suo volume in una settimana. Seedance 2.0 Fast e Mini, entrambi livelli di efficienza, insieme totalizzano più richieste del Seedance 2.0 completo.
Ecco come appare un mercato che passa dalla valutazione alla produzione. Quando le persone testano un modello, scelgono il migliore. Quando devono rilasciare qualcosa, scelgono quello che fa funzionare l'economia unitaria. Un modello che produce una clip leggermente meno impressionante a una frazione del costo vince quando l'output finisce in una pipeline anziché in un demo reel.
L'ingresso di HeyGen Video è lo stesso segnale da un'angolazione diversa. HeyGen ha lanciato il suo modello video universale con un prezzo al secondo di circa un centesimo per il periodo promozionale, all'incirca metà della tariffa standard, e lo ha reso disponibile immediatamente attraverso i router per sviluppatori. In pochi giorni era nella top five per volume. Prezzo e distribuzione, non la posizione nei benchmark, hanno prodotto quel risultato.
Il balzo di Wan riguarda l'apertura
La variazione più ampia rispetto alla settimana precedente appartiene a Wan 2.7 di Alibaba, cresciuto di oltre il 300 per cento. La famiglia Wan include modelli con pesi aperti, e i pesi aperti cambiano il modo in cui un modello si diffonde. Chiunque può ospitarlo, stabilire il proprio prezzo e offrirlo come opzione. Quando i pesi sono disponibili, il modello non ha bisogno del permesso del fornitore originale per raggiungere gli utenti.
Questo è il meccanismo alla base della strategia video con pesi aperti. Il volume di un modello chiuso è limitato dalla capacità e dalle decisioni di prezzo del fornitore. Il volume di un modello aperto è limitato da quanti provider scelgono di servirlo. Il secondo tetto è di solito più alto.
La crescita di Wan suggerisce anche qualcosa su dove viene usata la generazione video. I modelli economici e auto-ospitabili tendono a comparire in applicazioni ad alto volume: contenuti social, varianti per l'e-commerce, asset di gioco. Questi non hanno bisogno di qualità cinematografica. Hanno bisogno di output sufficiente a basso costo, e un modello aperto servito da molti provider è adatto.
Utilizzo e qualità misurano cose diverse
Niente di tutto ciò significa che i leader di qualità stanno fallendo. Significa che competono per un segmento diverso. Uno studio che produce uno spot ha bisogno del miglior output e pagherà per averlo. Una piattaforma che genera migliaia di clip al giorno ha bisogno di costo per clip, latenza e disponibilità.
I due segmenti sono grandi e tirano in direzioni opposte. Ecco perché una singola classifica dei modelli video è fuorviante. Un modello può guidare una tabella ed essere quasi invisibile sull'altra, ed entrambi i risultati possono essere corretti.
C'è una terza considerazione che i dati sui volumi catturano bene: l'affidabilità. I conteggi delle richieste riflettono il lavoro completato, e un modello che produce una clip utilizzabile al primo tentativo vale più di uno che richiede tre rigenerazioni. Su milioni di richieste, quella differenza si manifesta come volume.
Cosa non possono dirti i numeri
Il volume delle richieste ha punti ciechi, e vale la pena nominarli prima di trarre conclusioni.
I dati coprono i modelli serviti attraverso un unico servizio di routing, non l'intero mercato. Un laboratorio che serve il proprio modello alla propria app, come fanno diversi tra i più grandi, non compare affatto. Un modello popolare all'interno di un singolo grande cliente è sottostimato. E i conteggi delle richieste non distinguono tra un utente che genera mille clip e mille utenti che ne generano una ciascuno, il che è una differenza significativa per un fornitore che decide dove investire.
I numeri sono anche in ritardo rispetto ai lanci. Un modello rilasciato la settimana scorsa e uno rilasciato l'anno scorso possono mostrare lo stesso volume mentre si muovono in direzioni opposte, e le variazioni percentuali lo catturano solo se le si legge. Il quasi raddoppio di Veo 3.1 Fast di Google in una settimana dice più della sua posizione assoluta.
Quindi la tabella va letta soprattutto come un segnale direzionale su dove sta andando il traffico di produzione, non come una misurazione della quota di mercato. Risponde alla domanda su quali modelli le persone stanno effettivamente chiamando, una domanda che le classifiche di qualità non hanno mai posto.
Come appare il mercato alla fine del 2026
Quattro osservazioni, tratte dai numeri anziché dalle dichiarazioni di qualsiasi fornitore.
Ora sono i livelli Fast a guidare la categoria. I modelli video più richiesti sono quelli economici, il che significa che gli acquirenti con il volume maggiore ottimizzano sul costo per secondo utilizzabile.
I pesi aperti hanno un vantaggio distributivo. Il tasso di crescita di Wan è la prova più chiara che rilasciare i pesi espande il mercato indirizzabile più rapidamente di quanto un modello chiuso possa espandere la propria capacità.
I nuovi entranti possono raggiungere la scala in pochi giorni. HeyGen è passata dal lancio a una posizione nella top five in una settimana combinando un prezzo basso, un'integrazione amichevole per gli sviluppatori e una base di clienti esistente. I canali di distribuzione sono diventati la via più rapida per ottenere volume.
Le classifiche di qualità contano ancora per la fascia alta. I modelli in cima alle tabelle di Arena servono clienti per cui una clip migliore vale più di una più economica.
Chiunque scelga un modello video dovrebbe leggere entrambe. Le tabelle di qualità dicono cosa un modello può ottenere, e i volumi di richieste dicono quanto costa ottenerlo su larga scala. Nessuna singola classifica cattura entrambe le cose, ed è una delle ragioni per cui i fornitori continuano a pubblicare le tabelle di qualità.
Articoli correlati
Ai2 ha reso open source lo stack di training, non l'ennesimo set di pesi
È facile regalare i pesi, difficile imparare da essi.
Il Qwen3.8-Max di Alibaba sostiene di poter programmare da solo per due settimane
Il numero di parametri ha smesso da tempo di fare notizia. Dodici giorni è il numero che vale la pena esaminare.
PixelUMM elimina i due componenti da cui dipende ogni modello AI visivo
La diffusione a livello di pixel è stata proposta prima e si è ripetutamente scontrata con la potenza di calcolo.
I data center AI ora aspettano le linee elettriche, non le consegne di chip
I progetti che apriranno in tempo nel 2027 saranno quelli che avranno risolto per primi la connessione e l'allocazione di memoria.