Lo stack degli annunci video si è scisso in specialisti, e Boreal-H3 mostra perché

Creatify Labs ha lanciato Boreal-H3 il 2 ottobre, un modello video creato tramite post-training di MiniMax H3 in collaborazione con MiniMax e pensato per un unico compito: produrre clip pubblicitarie. La parte interessante sta nel benchmark che Creatify ha inventato per venderlo, e in ciò che quel benchmark implica su dove sta andando la generazione video.
La proposta, in numeri
Boreal-H3 ottiene 133,3 sull'Ads Quality Index di Creatify, dove MiniMax H3 è normalizzato a 100. Il set di confronto lo mette davanti a Gemini Omni 1.1 Flash a 122,2, Seedance 2.5 a 118,1 e Wan 3.0 Prime a 111,1.
Sulla fedeltà al riferimento (misurata con una soglia più severa di 7 su 10) Boreal-H3 ha raggiunto l'85,3 per cento, davanti a MiniMax H3 all'82,4 per cento, Wan 3.0 Prime al 79,4 per cento, Seedance 2.5 al 71,9 per cento e Omni 1.1 Flash al 70,6 per cento.
Rispetto alla propria base, il ciclo di post-training ha portato la coerenza del soggetto dall'83,3 al 94,4 per cento, aumentato il completamento del brief dal 27,8 al 50,0 per cento su una serie di brief di produzione difficili e ridotto i difetti visibili da 1,11 a 0,33 per clip, una riduzione del 70 per cento.
I dati su costo e velocità sono il punto in cui la proposta si affina. A 768p, Boreal-H3 genera a 1,1 secondi per secondo video, quindi una clip di 10 secondi richiede circa 11 secondi e costa 0,40 $. Seedance 2.5 viaggia a 46,5 secondi per secondo video e circa 0,47 $ al secondo. Su una demo prodotto di 15 secondi, Boreal-H3 ha renderizzato in 84 secondi contro i 411 secondi di Seedance 2.5.
Perché il benchmark conta più del modello
L'Ads Quality Index misura qualcosa di specifico: quanto spesso un modello produce una clip che funziona come annuncio. Una clip passa solo quando aderenza al prompt, coerenza del riferimento e realismo visivo ottengono ciascuno 6 su 10 o più. Il tasso di superamento di ogni modello viene poi indicizzato rispetto a MiniMax H3.
Questa è una domanda diversa da quella che pongono la maggior parte dei benchmark video. Artificial Analysis e classifiche simili valutano gli output in base a qualità generale e attrattiva estetica. Se una clip mantiene leggibile l'etichetta di un prodotto, tiene stabile la silhouette della confezione e preserva il volto del creator dal primo all'ultimo fotogramma non è ciò che quelle classifiche misurano, ed è ciò che un inserzionista controlla per primo.
Il caveat onesto è che Creatify ha creato l'indice, lo gestisce e vende il modello che lo vince. L'azienda afferma che i suoi giudici automatizzati sono stati validati rispetto alle preferenze umane e che gli studi umani hanno usato output anonimizzati e randomizzati. È un'affermazione metodologica ragionevole ed è comunque un'affermazione di prima parte, del fornitore, sul prodotto del fornitore. Non esiste ancora alcuna replica indipendente.
C'è anche un dettaglio più silenzioso: il confronto include Seedance 2.5 e Wan 3.0 Prime, entrambi forti modelli video general-purpose valutati su criteri specifici per la pubblicità. Perdere un benchmark specializzato contro un modello specializzato è previsto. Il dato che sarebbe allarmante è se Boreal-H3 perdesse contro un modello generale sul proprio terreno.
La divisione in specialisti è reale ed è strutturale
Dove si colloca Boreal-H3 è più interessante di se vince.
La generazione video nel 2026 si è visibilmente divisa. Da un lato ci sono i generalisti cinematografici (Veo di Google, Kling, Gen-4.5 di Runway) che vendono qualità, controllo della camera e audio nativo a chiunque abbia una storia da raccontare. Dall'altro ci sono gli specialisti della pubblicità: Creatify, Arcads, HeyGen, tutti costruiti attorno a video di creator in stile UGC e demo di prodotto, venduti a performance marketer che hanno bisogno di volume e velocità di iterazione più che di un'inquadratura da protagonista.
L'economia spiega la divisione. Una campagna pubblicitaria performance ha bisogno di decine di varianti per trovare l'hook che funziona. Se ogni variante costa 5 $, i conti non tornano. Se ognuna costa 40 centesimi e viene renderizzata in 11 secondi, puoi testare una dozzina di hook prima di pranzo. Qualità cinematografica e capacità di iterazione sono prodotti diversi, e cercare di venderli entrambi da un unico modello significa scendere a compromessi su ciò che interessa di più all'acquirente.
HeyGen ha preso una strada simile la stessa settimana, lanciando un modello video universale a un centesimo al secondo, anch'esso sottoposto a post-training su MiniMax H3. Due aziende hanno deciso indipendentemente che la base di MiniMax era il substrato giusto su cui specializzarsi, il che dice qualcosa su dove si trova la frontiera open-weight.
Cosa il modello ancora non riesce a fare
La sezione che la maggior parte dei fornitori salta: la deformazione del prodotto.
La forma di una bottiglia può cambiare sottilmente tra i fotogrammi, o tra varianti generate separatamente dello stesso prodotto. I marchi vengono resi in modo apparentemente plausibile ma tecnicamente sbagliato: un logo con proporzioni errate, un wordmark estruso con una lettera che non esiste davvero. La coerenza della confezione tra generazioni è abbastanza comune che i flussi di lavoro seri bloccano un'immagine di riferimento per vincolarla invece di fidarsi di una descrizione testuale.
Creatify afferma di aver risolto questo problema e ha pubblicato una riduzione del tasso di difetti. Ciò che l'affermazione non copre è la modalità di guasto che conta di più in una campagna a pagamento: un difetto che sopravvive alla revisione perché sembra corretto alla dimensione di una miniatura e sbagliato a dimensione piena. Giudici automatizzati che valutano il realismo visivo 6 su 10 non coglieranno in modo affidabile un logo disegnato male. Un essere umano che confronta l'output con il prodotto fisico sì.
Il consiglio sul flusso di lavoro che segue è poco glamour. Inizia ogni scatto di prodotto da una fotografia del prodotto reale invece che da una descrizione testuale, perché un prompt solo testuale fa sì che il modello inventi l'etichetta insieme all'oggetto. Scrivi prompt per il movimento (cosa si muove, come si muove la camera, cosa fa la luce) perché la foto porta già il prodotto. Metti ogni clip accanto all'oggetto fisico prima di pubblicarla.
Cosa si guadagna con la specializzazione, e cosa costa
L'argomento a favore di un modello come Boreal-H3 è diretto: se il tuo output è pubblicità, un modello messo a punto sulla pubblicità ti farà risparmiare cicli di iterazione che un modello generale spende in capacità di cui non hai bisogno.
L'argomento contro è un lock-in di tipo specifico. Un modello sottoposto a post-training sul ciclo di valutazione di un'azienda è ottimizzato per la definizione che quell'azienda dà di buon annuncio, e quella definizione non è pubblicata in una forma che altri possano verificare. L'Ads Quality Index è un proxy ragionevole per «funziona come spot?». Se sia correlato a «questa campagna performa?» è una domanda a cui solo i media buyer possono rispondere, e risponderanno con i loro budget nei prossimi due trimestri.
C'è un effetto di secondo ordine che vale la pena anticipare. Quando un modello viene sottoposto a post-training su uno specifico obiettivo commerciale, tende a migliorare nei pattern che quell'obiettivo premia e a peggiorare in quelli che non misura. Un modello focalizzato sulla pubblicità ottimizzato per fedeltà del prodotto e coerenza del creator può allontanarsi dall'inventiva visiva che rende memorabile una campagna. L'Ads Quality Index non ha alcuna componente che misuri se una clip è interessante, e questa è una scelta deliberata di perimetro con conseguenze.
Il requisito di materiale di riferimento è l'altro vincolo pratico. Il controllo dei keyframe e il controllo multi-riferimento richiedono entrambi che l'inserzionista fornisca buoni input: uno scatto pulito del prodotto, un creator coerente, uno stile visivo consolidato. Va bene per i brand che hanno già una libreria fotografica e un design system. Per un piccolo venditore che genera creatività da zero, la specializzazione è meno utile, perché gli input di cui il modello ha bisogno sono gli input che il venditore non ha.
Ciò che Boreal-H3 dimostra davvero è che il mercato della generazione video è maturato oltre il punto in cui una singola classifica decide qualcosa. La domanda rilevante per un acquirente alla fine del 2026 non è più quale modello sia il migliore. È quale modello sia il migliore nella cosa specifica che stai producendo, e se puoi misurarlo da solo invece di fidarti dell'indice del fornitore.
Quest'ultima clausola è quella che conta di più. I fornitori che costruiscono modelli pubblicitari sono anche i fornitori che vendono i benchmark che li classificano. L'unica valutazione affidabile è un test controllato sul tuo set di prodotti, con i tuoi criteri di revisione, e un essere umano che confronta ogni output con l'oggetto fisico. È più lento che leggere una classifica e considerevolmente più utile.
Articoli correlati
Meta ottiene in licenza la tecnologia di immagini e video di Midjourney, e il motivo è rivelatore
I benchmark si muovono ogni trimestre. Il giudizio di una comunità su ciò che è bello no.
AssemblyAI ha ridotto la latenza del parlato in tempo reale a 91 millisecondi. Ecco perché quel numero conta
Il vincolo sulla voce non è mai stato il tasso di errore di parole. È stato l'alternanza dei turni.
Nano Banana 2.1 di Google è un aggiornamento di funzionalità, non un flagship
Un rilascio di fascia media ti dice cosa un laboratorio pensa che la maggior parte dei suoi utenti abbia davvero bisogno: un segnale più utile di un flagship.
OpenAI ha pubblicato 722 risultati matematici derivati dall'IA. I matematici si chiedono a chi vada il merito.
Un assistente di dimostrazione verifica che un argomento sia valido, non che sia quello che qualcuno crede che sia.