← Torna al blog
Newscirca 6 min di lettura

HeyGen Video 1 vs Tavus Griffin: quanto vale un secondo di umano generato

Pubblicato 2 ott 2026
HeyGen Video 1 vs Tavus Griffin: quanto vale un secondo di umano generato

Due lanci di prodotto sono arrivati a trentasei ore di distanza l'uno dall'altro alla fine di settembre, nello stesso angolo di mercato. Entrambi generano un essere umano convincente sullo schermo. La cosa più utile dell'abbinamento non è che un acquirente sceglierebbe tra i due, perché al momento del lancio solo uno dei due poteva essere acquistato. È che la differenza tra loro spiega a cosa serviva ciascuno, e quanto vale un secondo di umano sintetico in ciascun caso.

HeyGen Video è andato live il 30 settembre, al prezzo di un centesimo al secondo fino a ottobre. Tavus Griffin è stato annunciato il 1° ottobre con uno studio dal vivo faccia a faccia in cui 26 dei 54 partecipanti credevano che il loro interlocutore fosse una persona reale. Griffin è disponibile solo per alcuni tester fidati selezionati tramite un modulo di richiesta, senza identificatore pubblico, senza endpoint e senza prezzo.

Uno vende una clip, l'altro vende una conversazione

HeyGen Video è un modello video generico che si trova a essere insolitamente bravo con le persone. Accetta un prompt, o un prompt più un'immagine, o un prompt più fino a nove immagini di riferimento, tre video di riferimento e tre clip audio di riferimento. Restituisce una clip lunga tra cinque e quindici secondi a 480p o 768p, 24 fotogrammi al secondo, con audio AAC che trasporta dialogo, ambiente ed effetti generati. Tre modalità coprono il condizionamento: text-to-video, image-to-video e reference-to-video, che è quella predefinita. I campi sconosciuti nella richiesta vengono rifiutati anziché ignorati, e un seed serve a rendere ripetibile un'inquadratura mentre si cambia una clausola alla volta.

Questo è uno strumento di produzione con un perimetro deterministico. Si sa cosa si è chiesto, si sa cosa è tornato indietro, e lo si può riprodurre.

Griffin inverte quasi tutte queste proprietà. Genera 720p in blocchi da 320 millisecondi a 25 fotogrammi al secondo da una singola fotografia di riferimento, e riproduce ogni blocco mentre lo decodifica. Non c'è una lunghezza della clip da specificare e nessun file restituito. Un motore continuo di modellazione conversazionale acquisisce audio e video e rivaluta lo scambio a intervalli inferiori al secondo, decidendo se restare in silenzio, segnalare, fare backchannel o prendere il turno. I suoi controlli espressivi pilotano un generatore vocale in streaming e un generatore video in streaming in parallelo, così una decisione presa a metà frase si manifesta nella voce e nel volto nello stesso mini-turno.

Non si scrive un prompt. Si parla con esso, e risponde a una pausa, a uno sguardo distolto o a un'interruzione. Ecco perché i due non sono sostituti anche se entrambi generano un umano. A HeyGen Video si chiede che aspetto ha un momento descritto. A Griffin si chiede cosa dovrebbe succedere dopo.

Il prezzo, e perché è la notizia principale

Il prezzo di lancio di HeyGen è un centesimo al secondo, che l'azienda descrive come uno sconto del 50 percento su un prezzo standard di due centesimi. Il grafico dei costi nella stessa pagina, con nota a piè di pagina che indica il prezzo di listino al secondo a 768p con audio prima delle promozioni di lancio, lo colloca a tre centesimi. C'è un divario del cinquanta percento tra il testo e il grafico sul materiale stesso del fornitore. Finché HeyGen non pubblica una pagina di prezzi API, la lettura sicura è che la cifra di un centesimo è confermata perché è attiva, e che il numero post-ottobre si colloca da qualche parte tra due e tre centesimi.

Facciamo i conti per mille secondi, cioè cento clip da dieci secondi e l'unità in cui ragiona davvero un team che lavora in grandi volumi. HeyGen Video a ottobre arriva a dieci dollari. Dopo ottobre sono venti a due centesimi, o trenta ai tre del grafico. MiniMax H3, il modello base da cui è stato messo a punto, è listato a otto centesimi al secondo, quindi gli stessi mille secondi costerebbero ottanta dollari. Kling 3.0 Pro arriva a 168 dollari, e Veo 3.1 a 400.

Il motivo per cui quell'aritmetica è la notizia principale è il tasso di scarto. Nella generazione video, la clip che si tiene è raramente la clip generata per prima. I team generano diverse versioni e ne buttano via la maggior parte. Un modello che costa poco al secondo ma richiede sei tentativi costa più di uno più caro che arriva al primo o al secondo tentativo. HeyGen sta effettivamente scommettendo che a un centesimo al secondo, l'iterazione smetta di essere la parte costosa.

Il numero che dovrebbe arrivare con un avvertimento

La cifra principale di Tavus è quella dei 26 partecipanti su 54 che credevano che il loro interlocutore fosse umano. È un risultato reale di uno studio controllato, ed è anche il tipo di numero che è facile sovrainterpretare. Le condizioni di uno studio non sono le condizioni di un'implementazione. I partecipanti a un esperimento faccia a faccia sono predisposti a fare una conversazione, non a verificarla. Un tasso di successo del 48 percento nel passare per umano, presentato in un contesto favorevole, dice che la tecnologia sta avanzando senza dire come si comporterà quando qualcuno cercherà di rilevarla, o quando la conversazione durerà venti minuti invece di pochi.

Ciò che rende Griffin interessante è il modello di interazione, non il tasso di inganno. Un umano digitale che decide in tempo reale se parlare, e che riflette una decisione presa a metà frase sul suo volto nello stesso battito, è una classe di prodotto diversa da un generatore video. È più vicino a un avatar in tempo reale per un call center, un tutor o un'applicazione di compagnia. Quelli sono mercati in cui il valore è nel ciclo, non nella clip.

Il fatto che Griffin non sia acquistabile non è un'avvertenza da poco. I programmi per tester fidati esistono proprio perché il prodotto non è ancora abbastanza stabile o prevedibile da essere venduto. È una fase ragionevole in cui trovarsi, e significa anche che qualsiasi confronto con HeyGen Video oggi è un confronto tra un prodotto in spedizione e una promessa.

A cosa serve davvero ciascuno

Mettiamo i due fianco a fianco e il mercato si divide nettamente.

Se hai bisogno di una libreria di clip finite, che siano spot pubblicitari, video social o frammenti di marketing localizzati, HeyGen Video è lo strumento che esiste oggi, con un prezzo che puoi mettere in un foglio di calcolo e un perimetro deterministico attorno a cui costruire una pipeline.

Se hai bisogno di qualcosa che si comporti come una persona in una chiamata dal vivo, che risponda invece di renderizzare, Griffin è quello che punta in quella direzione, e non è ancora un prodotto che puoi integrare.

Il punto più ampio riguarda dove sta andando il video sintetico. Per due anni i benchmark riguardavano il realismo in un singolo fotogramma. La frontiera ora riguarda il comportamento nel tempo: come una persona generata risponde, ricorda e rimane coerente durante un'interazione. HeyGen compete sul costo e sull'affidabilità nel flusso di lavoro «renderizza e tieni». Tavus compete sul fatto che l'interazione sembri davvero un'interazione. Entrambi possono vincere, perché non vendono lo stesso secondo.

Articoli correlati