← Volver al blog
Newsaprox. 7 min de lectura

HeyGen Video 1 vs Tavus Griffin: cuánto vale un segundo de humano generado

Publicado 2 oct 2026
HeyGen Video 1 vs Tavus Griffin: cuánto vale un segundo de humano generado

Dos lanzamientos de productos aterrizaron con treinta y seis horas de diferencia a finales de septiembre, en el mismo segmento del mercado. Ambos generan un ser humano convincente en pantalla. Lo más útil de la comparación no es que un comprador elegiría entre ellos, porque en el momento del lanzamiento solo uno de ellos se podía comprar. Es que la diferencia entre ellos explica para qué se construyó cada uno y cuánto vale un segundo de humano sintético en cada caso.

HeyGen Video se lanzó el 30 de septiembre, con un precio de un centavo por segundo hasta octubre. Tavus Griffin se anunció el 1 de octubre con un estudio en vivo cara a cara en el que 26 de 54 participantes creyeron que su interlocutor era una persona real. Griffin solo está disponible para selectos evaluadores de confianza a través de un formulario de solicitud, sin identificador público, sin endpoint y sin precio.

Uno vende un clip, el otro vende una conversación

HeyGen Video es un modelo de video de propósito general que resulta ser inusualmente bueno con las personas. Acepta un prompt, o un prompt más una imagen, o un prompt más hasta nueve imágenes de referencia, tres videos de referencia y tres clips de audio de referencia. Devuelve un clip de entre cinco y quince segundos a 480p o 768p, 24 fotogramas por segundo, con audio AAC que contiene diálogo, ambiente y efectos generados. Tres modos cubren el condicionamiento: texto a video, imagen a video y referencia a video, que es el predeterminado. Los campos desconocidos en la solicitud se rechazan en lugar de ignorarse, y hay una semilla para hacer que una toma sea repetible mientras cambias una cláusula a la vez.

Esa es una herramienta de producción con un comportamiento determinista. Sabes qué pediste, sabes qué recibiste y puedes reproducirlo.

Griffin invierte casi todas esas propiedades. Genera 720p en fragmentos de 320 milisegundos a 25 fotogramas por segundo a partir de una sola fotografía de referencia, y reproduce cada fragmento a medida que se decodifica. No hay una longitud de clip que especificar ni un archivo que se devuelva. Un motor continuo de modelado conversacional ingiere audio y video y reevalúa el intercambio a intervalos de menos de un segundo, decidiendo si permanecer en silencio, señalizar, hacer retroalimentación o tomar el turno. Sus controles expresivos impulsan un generador de voz en streaming y un generador de video en streaming en paralelo, de modo que una decisión tomada a mitad de frase aparece en la voz y en el rostro dentro del mismo mini-turno.

No escribes un prompt. Le hablas, y responde a una pausa, a una mirada hacia otro lado o a una interrupción. Por eso los dos no son sustitutos aunque ambos generen un humano. A HeyGen Video se le pregunta cómo se ve un momento descrito. A Griffin se le pregunta qué debería pasar después.

El precio, y por qué es el titular

El precio de lanzamiento de HeyGen es de un centavo por segundo, que la empresa describe como un 50 por ciento de descuento sobre un precio estándar de dos centavos. El gráfico de costos en la misma página, con la nota al pie de precio de lista por segundo a 768p con audio antes de las promociones de lanzamiento, lo sitúa en tres centavos. Eso es una brecha del cincuenta por ciento entre el texto y el gráfico en el propio material de un proveedor. Hasta que HeyGen publique una página de precios de API, la lectura segura es que la cifra de un centavo está confirmada porque está activa, y que el número posterior a octubre se sitúa en algún lugar entre dos y tres centavos.

Hagamos los cálculos para mil segundos, que son cien clips de diez segundos y la unidad en la que realmente piensa un equipo de gran volumen. HeyGen Video en octubre llega a diez dólares. Después de octubre son veinte a dos centavos, o treinta a los tres del gráfico. MiniMax H3, el modelo base del que se derivó, tiene un precio de lista de ocho centavos por segundo, por lo que los mismos mil segundos costarían ochenta dólares. Kling 3.0 Pro llega a 168 dólares, y Veo 3.1 a 400.

La razón por la que esa aritmética es el titular es la tasa de descarte. En la generación de video, el clip que conservas rara vez es el clip que generaste primero. Los equipos generan varias tomas y desechan la mayoría. Un modelo que es barato por segundo pero requiere seis intentos cuesta más que uno que es más caro y acierta en el primer o segundo intento. HeyGen efectivamente apuesta a que, a un centavo por segundo, la iteración deja de ser la parte cara.

El número que debería venir con una salvedad

La cifra principal de Tavus son los 26 de 54 participantes que creyeron que su interlocutor era humano. Ese es un resultado real de un estudio controlado, y también es el tipo de número que es fácil de sobreinterpretar. Las condiciones de un estudio no son las condiciones de un despliegue. Los participantes en un experimento cara a cara están predispuestos a tener una conversación, no a auditarla. Una tasa de éxito del 48 por ciento al pasar por humano, presentada en un entorno favorable, te dice que la tecnología está avanzando sin decirte cómo se comportará cuando alguien intente detectarla, o cuando la conversación dure veinte minutos en lugar de unos pocos.

Lo que hace interesante a Griffin es el modelo de interacción, no la tasa de engaño. Un humano digital que decide en tiempo real si hablar, y que refleja una decisión a mitad de frase en su rostro en el mismo instante, es una clase de producto diferente a un generador de video. Está más cerca de un avatar en tiempo real para un centro de llamadas, un tutor o una aplicación de compañía. Esos son mercados donde el valor está en el bucle, no en el clip.

Que Griffin no esté disponible para su compra tampoco es una salvedad menor. Los programas de evaluadores de confianza existen precisamente porque el producto aún no es lo suficientemente estable o predecible como para venderse. Es una etapa razonable en la que estar, y también significa que cualquier comparación con HeyGen Video hoy es una comparación entre un producto ya disponible y una promesa.

Para qué sirve cada uno en realidad

Pon los dos uno al lado del otro y el mercado se divide claramente.

Si necesitas una biblioteca de clips terminados, ya sean anuncios, video para redes sociales o fragmentos de marketing localizados, HeyGen Video es la herramienta que existe hoy, con un precio que puedes poner en una hoja de cálculo y un comportamiento determinista sobre el que puedes construir un pipeline.

Si necesitas algo que se comporte como una persona en una llamada en vivo, que responda en lugar de renderizar, Griffin es el que apunta en esa dirección, y todavía no es un producto que puedas integrar.

El punto más amplio es hacia dónde se dirige el video sintético. Durante dos años, los benchmarks trataban sobre el realismo en un solo fotograma. La frontera ahora trata sobre el comportamiento a lo largo del tiempo: cómo responde una persona generada, recuerda y se mantiene consistente a lo largo de una interacción. HeyGen compite en costo y confiabilidad en el flujo de trabajo de renderizar y conservar. Tavus compite en si la interacción se siente como una interacción en absoluto. Ambos pueden ganar, porque no venden el mismo segundo.

Artículos relacionados