← Voltar ao blog
Newscerca de 7 min de leitura

HeyGen Video 1 vs Tavus Griffin: Quanto Vale um Segundo de Humano Gerado

Publicado 2 de out. de 2026
HeyGen Video 1 vs Tavus Griffin: Quanto Vale um Segundo de Humano Gerado

Dois lançamentos de produto aconteceram com trinta e seis horas de diferença no final de setembro, no mesmo canto do mercado. Ambos geram um ser humano convincente na tela. A coisa mais útil nesse pareamento não é que um comprador escolheria entre eles, porque no momento do lançamento apenas um deles podia ser comprado. É que a diferença entre eles explica para que cada um foi construído, e quanto vale um segundo de humano sintético em cada caso.

O HeyGen Video entrou no ar em 30 de setembro, com preço de um centavo por segundo até outubro. O Tavus Griffin foi anunciado em 1º de outubro com um estudo presencial ao vivo no qual 26 de 54 participantes acreditaram que seu parceiro de conversa era uma pessoa real. O Griffin está disponível apenas para testadores confiáveis selecionados, por trás de um formulário de solicitação, sem identificador público, sem endpoint e sem preço.

Um vende um clipe, o outro vende uma conversa

O HeyGen Video é um modelo de vídeo de uso geral que, por acaso, é excepcionalmente bom com pessoas. Ele aceita um prompt, ou um prompt mais uma imagem, ou um prompt mais até nove imagens de referência, três vídeos de referência e três clipes de áudio de referência. Ele retorna um clipe de cinco a quinze segundos em 480p ou 768p, 24 quadros por segundo, com áudio AAC carregando diálogo, ambiente e efeitos gerados. Três modos cobrem o condicionamento: texto para vídeo, imagem para vídeo e referência para vídeo, que é o padrão. Campos desconhecidos na requisição são rejeitados em vez de ignorados, e há uma seed para tornar uma tomada repetível enquanto você altera uma cláusula por vez.

Essa é uma ferramenta de produção com um envelope determinístico. Você sabe o que pediu, sabe o que voltou e pode reproduzir.

O Griffin inverte quase todas essas propriedades. Ele gera 720p em blocos de 320 milissegundos a 25 quadros por segundo a partir de uma única fotografia de referência, e reproduz cada bloco conforme o decodifica. Não há duração de clipe a especificar nem arquivo a ser entregue. Um motor contínuo de modelagem conversacional ingere áudio e vídeo e reavalia a troca em intervalos de menos de um segundo, decidindo se permanece em silêncio, se sinaliza, se faz backchannel ou se assume o turno. Seus controles expressivos acionam um gerador de fala em streaming e um gerador de vídeo em streaming em paralelo, de modo que uma decisão tomada no meio da frase aparece na voz e no rosto dentro do mesmo mini-turno.

Você não escreve um prompt. Você conversa com ele, e ele responde a uma pausa, a um desviar de olhar ou a uma interrupção. É por isso que os dois não são substitutos, ainda que ambos gerem um humano. Ao HeyGen Video se pergunta como é um momento descrito. Ao Griffin se pergunta o que deve acontecer em seguida.

O preço, e por que ele é a manchete

O preço de lançamento do HeyGen é de um centavo por segundo, que a empresa descreve como 50 por cento de desconto sobre um padrão de dois centavos. O gráfico de custos na mesma página, com nota de rodapé indicando preço de tabela por segundo em 768p com áudio antes das promoções de lançamento, o coloca em três centavos. Há uma diferença de cinquenta por cento entre o texto e o gráfico no próprio material do fornecedor. Até que o HeyGen publique uma página de preços de API, a leitura segura é que o número de um centavo está confirmado porque está no ar, e que o número pós-outubro fica em algum lugar entre dois e três centavos.

Faça as contas para mil segundos, o que equivale a cem clipes de dez segundos — a unidade em que uma equipe de volume realmente pensa. O HeyGen Video em outubro sai por dez dólares. Depois de outubro, são vinte a dois centavos, ou trinta a três centavos do gráfico. O MiniMax H3, o modelo base a partir do qual ele foi ajustado, tem preço de tabela de oito centavos por segundo, então os mesmos mil segundos custariam oitenta dólares. O Kling 3.0 Pro chega a 168 dólares, e o Veo 3.1 a 400.

A razão pela qual essa aritmética é a manchete é a taxa de descarte. Na geração de vídeo, o clipe que você mantém raramente é o clipe que você gerou primeiro. As equipes geram várias tomadas e descartam a maioria. Um modelo barato por segundo, mas que exige seis tentativas, custa mais do que um mais caro que acerta na primeira ou na segunda tentativa. O HeyGen está, na prática, apostando que, a um centavo por segundo, a iteração deixa de ser a parte cara.

O número que deveria vir com uma ressalva

O número de destaque da Tavus são os 26 de 54 participantes que acreditaram que seu parceiro era humano. Esse é um resultado real de um estudo controlado, e também é o tipo de número fácil de superinterpretar. As condições de um estudo não são as condições de uma implantação. Participantes de um experimento presencial estão predispostos a ter uma conversa, não a auditá-la. Uma taxa de sucesso de 48 por cento em passar por humano, apresentada em um cenário favorável, diz que a tecnologia está avançando sem dizer como ela se comportará quando alguém estiver tentando detectá-la, ou quando a conversa durar vinte minutos em vez de alguns.

O que torna o Griffin interessante é o modelo de interação, não a taxa de engano. Um humano digital que decide em tempo real se deve falar, e que reflete uma decisão tomada no meio da frase em seu rosto dentro da mesma batida, é uma classe de produto diferente de um gerador de vídeo. Ele está mais próximo de um avatar em tempo real para um call center, um tutor ou um aplicativo de companhia. Esses são mercados em que o valor está no ciclo, não no clipe.

O fato de o Griffin não estar disponível para compra também não é uma ressalva pequena. Programas de testadores confiáveis existem justamente porque o produto ainda não é estável ou previsível o suficiente para ser vendido. É um estágio razoável em que se estar, e também significa que qualquer comparação com o HeyGen Video hoje é uma comparação entre um produto já disponível e uma promessa.

Para que cada um serve, de fato

Coloque os dois lado a lado e o mercado se divide de forma clara.

Se você precisa de uma biblioteca de clipes finalizados, sejam spots publicitários, vídeos para redes sociais ou fragmentos de marketing localizados, o HeyGen Video é a ferramenta que existe hoje, com um preço que você pode colocar numa planilha e um envelope determinístico em torno do qual você pode construir um pipeline.

Se você precisa de algo que se comporte como uma pessoa em uma chamada ao vivo, respondendo em vez de renderizando, o Griffin é o que aponta nessa direção, e ainda não é um produto que você possa integrar.

O ponto mais amplo é sobre para onde o vídeo sintético está indo. Por dois anos, os benchmarks eram sobre realismo em um único quadro. A fronteira agora é sobre comportamento ao longo do tempo: como uma pessoa gerada responde, lembra e se mantém consistente ao longo de uma interação. O HeyGen compete em custo e confiabilidade no fluxo de trabalho de renderizar e manter. A Tavus compete em se a interação parece uma interação. Ambos podem vencer, porque não estão vendendo o mesmo segundo.

Artigos relacionados