HeyGen Video 1 vs Tavus Griffin : ce que vaut une seconde d’humain généré

Deux lancements de produits ont eu lieu à trente-six heures d’intervalle fin septembre, dans le même coin du marché. Tous deux génèrent un être humain convaincant à l’écran. Ce qui est le plus utile dans ce rapprochement, ce n’est pas qu’un acheteur doive choisir entre eux, car au moment du lancement, un seul des deux pouvait être acheté. C’est que leur différence explique à quoi chacun a été conçu, et ce que vaut une seconde d’humain de synthèse dans chaque cas.
HeyGen Video est entré en service le 30 septembre, au prix d’un centime par seconde jusqu’à fin octobre. Tavus Griffin a été annoncé le 1er octobre, avec une étude en face à face en direct dans laquelle 26 des 54 participants croyaient que leur interlocuteur était une personne réelle. Griffin n’est disponible que pour une sélection de testeurs de confiance, derrière un formulaire de demande, sans identifiant public, sans point de terminaison et sans prix.
HeyGen Video est un modèle vidéo polyvalent qui se trouve être exceptionnellement doué pour les personnes. Il prend un prompt, ou un prompt plus une image, ou un prompt plus jusqu’à neuf images de référence, trois vidéos de référence et trois clips audio de référence. Il renvoie un clip de cinq à quinze secondes en 480p ou 768p, à 24 images par seconde, avec un audio AAC transportant des dialogues, une ambiance et des effets générés. Trois modes couvrent le conditionnement : texte-vers-vidéo, image-vers-vidéo et référence-vers-vidéo, ce dernier étant celui par défaut. Les champs inconnus dans la requête sont rejetés plutôt qu’ignorés, et une graine est présente pour rendre un plan reproductible pendant que vous modifiez une clause à la fois.
C’est un outil de production avec une enveloppe déterministe. Vous savez ce que vous avez demandé, vous savez ce qui est revenu, et vous pouvez le reproduire.
Griffin inverse presque toutes ces propriétés. Il génère de la 720p par segments de 320 millisecondes à 25 images par seconde à partir d’une seule photographie de référence, et lit chaque segment au fur et à mesure qu’il le décode. Il n’y a pas de durée de clip à spécifier et aucun fichier renvoyé. Un moteur de modélisation conversationnelle continue ingère l’audio et la vidéo et réévalue l’échange à des intervalles inférieurs à la seconde, décidant s’il faut rester silencieux, signaler, émettre un retour ou prendre la parole. Ses commandes expressives pilotent en parallèle un générateur de parole en flux et un générateur vidéo en flux, de sorte qu’une décision prise en milieu de phrase apparaît dans la voix et le visage dans le même mini-tour de parole.
Vous n’écrivez pas de prompt. Vous lui parlez, et il réagit à une pause, à un regard détourné ou à une interruption. C’est pourquoi les deux ne sont pas des substituts, même si tous deux génèrent un humain. On demande à HeyGen Video à quoi ressemble un moment décrit. On demande à Griffin ce qui doit se passer ensuite.
Le prix de lancement de HeyGen est d’un centime par seconde, ce que l’entreprise décrit comme une réduction de 50 % par rapport à un tarif standard de deux centimes. Le tableau des coûts sur la même page, avec en note le prix catalogue par seconde en 768p avec audio avant les promotions de lancement, l’établit à trois centimes. C’est un écart de cinquante pour cent entre le texte et le tableau sur les propres documents d’un fournisseur. Tant que HeyGen ne publie pas de page tarifaire pour l’API, l’interprétation prudente est que le chiffre d’un centime est confirmé parce qu’il est en vigueur, et que le montant d’après octobre se situe entre deux et trois centimes.
Faites le calcul pour mille secondes, soit cent clips de dix secondes, l’unité à laquelle une équipe travaillant en volume pense réellement. HeyGen Video en octobre revient à dix dollars. Après octobre, c’est vingt à deux centimes, ou trente au tarif de trois centimes indiqué dans le tableau. MiniMax H3, le modèle de base à partir duquel il a été affiné, est affiché à huit centimes par seconde, donc les mêmes mille secondes coûteraient quatre-vingts dollars. Kling 3.0 Pro monte à 168 dollars, et Veo 3.1 à 400.
La raison pour laquelle cette arithmétique fait la une, c’est le taux de rejet. Dans la génération vidéo, le clip que vous gardez est rarement celui que vous avez généré en premier. Les équipes génèrent plusieurs prises et en jettent la plupart. Un modèle bon marché à la seconde mais qui exige six tentatives coûte plus cher qu’un modèle plus onéreux qui aboutit à la première ou à la deuxième tentative. HeyGen parie en réalité qu’à un centime la seconde, l’itération cesse d’être la partie coûteuse.
Le chiffre phare de Tavus est celui des 26 participants sur 54 qui croyaient que leur interlocuteur était humain. C’est un résultat réel d’une étude contrôlée, et c’est aussi le genre de chiffre qu’il est facile de surinterpréter. Les conditions d’une étude ne sont pas celles d’un déploiement. Les participants à une expérience en face à face sont conditionnés à avoir une conversation, pas à l’auditer. Un taux de réussite de 48 % à passer pour un humain, présenté dans un cadre favorable, vous dit que la technologie progresse sans vous dire comment elle se comportera quand quelqu’un cherchera à la détecter, ou quand la conversation durera vingt minutes au lieu de quelques instants.
Ce qui rend Griffin intéressant, c’est le modèle d’interaction, pas le taux de tromperie. Un humain numérique qui décide en temps réel s’il doit parler, et qui reflète une décision prise en milieu de phrase sur son visage dans le même temps, appartient à une autre catégorie de produit qu’un générateur vidéo. Il est plus proche d’un avatar temps réel pour un centre d’appels, un tuteur ou une application compagnon. Ce sont des marchés où la valeur réside dans la boucle, pas dans le clip.
Le fait que Griffin ne soit pas disponible à l’achat n’est pas non plus un petit bémol. Les programmes de testeurs de confiance existent précisément parce que le produit n’est pas encore assez stable ou prévisible pour être vendu. C’est une étape raisonnable, et cela signifie aussi que toute comparaison avec HeyGen Video aujourd’hui est une comparaison entre un produit commercialisé et une promesse.
Mettez les deux côte à côte et le marché se scinde nettement.
Si vous avez besoin d’une bibliothèque de clips finis — spots publicitaires, vidéos sociales ou fragments marketing localisés —, HeyGen Video est l’outil qui existe aujourd’hui, avec un prix que vous pouvez mettre dans un tableur et une enveloppe déterministe autour de laquelle vous pouvez construire un pipeline.
Si vous avez besoin de quelque chose qui se comporte comme une personne lors d’un appel en direct, en répondant plutôt qu’en générant un rendu, Griffin est celui qui pointe dans cette direction, et ce n’est pas encore un produit que vous pouvez intégrer.
Le point plus large concerne la direction que prend la vidéo de synthèse. Pendant deux ans, les benchmarks portaient sur le réalisme d’une image unique. La frontière porte désormais sur le comportement dans le temps : comment une personne générée réagit, se souvient et reste cohérente tout au long d’une interaction. HeyGen rivalise sur le coût et la fiabilité dans le flux de travail « générer puis conserver ». Tavus rivalise sur la question de savoir si l’interaction ressemble vraiment à une interaction. Les deux peuvent gagner, parce qu’ils ne vendent pas la même seconde.
Articles associés
Claude Sonnet 5.5 est 30 % moins cher. C'est une histoire d'achats, pas une histoire de modèle.
Les affirmations de remise des fournisseurs sont généralement mesurées sur une charge de travail représentative, et la vôtre ne l'est pas.
HPE vient de vendre 1,2 milliard de dollars de matériel parce que le réseau est devenu l'essentiel
Une commande de 1,2 milliard de dollars dont la répartition entre cinq catégories n'est pas divulguée n'équivaut pas à 1,2 milliard de marge.
Le malware qui soumet sa prochaine action au vote de quatre modèles
L'infrastructure de commande et contrôle se résume à une poignée d'API publiques et à un webhook Discord.
Shopify laisse les agents IA cliquer sur Acheter. Le marchand encaisse toujours le litige.
La plateforme d'agents négocie l'intention. Le marchand porte le risque.