← Voltar ao blog
Newscerca de 7 min de leitura

Tavus Griffin passou por humano em 48% das vezes, e a empresa não vai lançá-lo

Publicado 7 de out. de 2026
Tavus Griffin passou por humano em 48% das vezes, e a empresa não vai lançá-lo

A Tavus lançou o Griffin em 1º de outubro, descrevendo-o como o primeiro Modelo de Interação Humana: um sistema full-duplex de vídeo para vídeo que ouve, reage e fala em tempo real. Em um estudo de chamada de vídeo ao vivo, 26 dos 54 participantes acreditaram que o Griffin-Lite era humano após um minuto de conversa. A geração anterior do sistema conseguiu 1 em 41, ou 2,4%.

Isso é aproximadamente uma melhoria de vinte vezes na capacidade de convencer as pessoas de que um participante sintético é real. A Tavus declarou claramente que não abrirá o Griffin ao público até que os mecanismos de segurança estejam prontos. Dado o que o modelo faz e como se parecem os modos de falha, essa decisão merece mais atenção do que o vídeo de demonstração.

O quadro técnico

O Griffin roda a 720p e 25 quadros por segundo, com latência de áudio para vídeo de cerca de 0,43 segundos. Na trilha de percepção do benchmark VideoFDB da NVIDIA, ele ocupa o primeiro lugar com 3,73, contra uma linha de base humana de 4,20. Ele ocupa o segundo lugar em precisão de sincronia labial e é mais lento para responder do que uma pessoa.

O limiar de acesso é a parte que importa. Uma única fotografia mais dez segundos de áudio bastam para gerar um gêmeo digital funcional. A API da Tavus tem cerca de 150.000 desenvolvedores e empresas registrados.

Coloque esses dois fatos lado a lado e o perfil de risco deixa de ser hipotético. Dados da Surfshark apontam perdas com fraudes de deepfake de US$ 1,1 bilhão em 2025, o triplo do número de 2024. No caso da Arup em Hong Kong, em 2024, um funcionário entrou em uma videoconferência na qual todos os outros participantes eram fabricações de IA, e a empresa perdeu US$ 25 milhões.

O Griffin não torna os deepfakes possíveis; isso já é factível há anos. Ele os torna interativos. Uma falsificação pré-gravada só consegue responder às perguntas que o criador previu. Um sistema em tempo real responde a qualquer coisa que lhe perguntem, em uma conversa que a outra parte acredita estar tendo com um colega.

O que muda quando a falsificação consegue improvisar

O caso da Arup funcionou porque os fraudadores prepararam um cenário e o alvo o aceitou. A geração em tempo real elimina a restrição de preparação. Um interlocutor agora pode improvisar diante de uma pergunta inesperada (perguntar sobre um detalhe de projeto, referenciar uma reunião compartilhada, reagir a uma piada) e gerar uma resposta plausível em menos de meio segundo.

É aí que o número de 0,43 segundo de latência deixa de ser um item de ficha técnica. A troca de turnos conversacional em humanos gira em torno de 200 milissegundos de intervalo. Com 430 milissegundos, o Griffin é visivelmente lento, mas não está fora do intervalo de alguém em uma conexão ruim ou em uma sala barulhenta. A lacuna é mascarável pelo contexto, o que é exatamente o que a torna perigosa: os usuários a atribuem às condições de rede, não a algo que está errado.

A decisão da Tavus de não lançar reflete uma leitura precisa disso. A empresa está entre duas posições. A tecnologia é demonstravelmente capaz de enganar a maioria dos participantes em um estudo controlado. As contramedidas (marcação de procedência, detecção de vivacidade, identidade verificada em chamadas) não estão em vigor na escala que a tecnologia exigiria.

O benchmark tem uma linha de base humana, e é esse o ponto

Vale notar que o VideoFDB reporta uma pontuação humana de 4,20 contra 3,73 do Griffin. O modelo está em primeiro lugar entre os sistemas e ainda assim abaixo das pessoas. Essa lacuna é o estado da arte atual, e está encolhendo a um ritmo que faz de "abaixo de humano" um consolo em declínio.

O número mais útil é a taxa de crença dos participantes ao longo do tempo. O estudo mediu a crença após um minuto. A maioria das estratégias de detecção depende de o observador notar algo em uma janela mais longa: um gesto repetido, uma resposta que não se encaixa no histórico da conversa, uma pergunta evitada duas vezes. Um sistema que sobrevive ao primeiro minuto e se degrada ao longo de cinco é uma ameaça diferente de um que se sustenta por uma hora, e o número publicado cobre apenas o primeiro.

O que as organizações deveriam estar fazendo agora

O conselho defensivo é pouco glamouroso e majoritariamente organizacional.

A verificação por texto de qualquer instrução financeira não é mais suficiente, e a voz também não. Retornar a ligação para um número conhecido é melhor do que uma videochamada com um participante desconhecido, porque o canal é verificado mesmo quando a pessoa nele pode não ser. Segredos compartilhados funcionam até vazarem, o que acontece.

A medida mais forte é processual: instruções de alto valor devem exigir um segundo canal independente, e esse segundo canal tem de ser um que o solicitante não possa iniciar. Essa é a prática padrão em operações de tesouraria exatamente por esse motivo, e ela se aplica a um mundo em que qualquer participante de vídeo pode ser sintético.

Para operadores de plataforma, a pressão está sobre vivacidade e procedência. Manifestos C2PA e marcas d'água SynthID anexam procedência à mídia gerada, e nenhum dos dois sobrevive de forma confiável a uma recodificação. Vídeo em tempo real não tem manifesto algum, o que significa que a verificação precisa acontecer no lado receptor, durante a chamada, com base em sinais comportamentais que são exatamente o que o Griffin é treinado para produzir de forma plausível.

Há uma circularidade desagradável aqui que vale nomear. Os sinais comportamentais que as pessoas usam para julgar se um participante de vídeo é real (pausas naturais, microexpressões, reações apropriadas a conteúdo inesperado) são os mesmos sinais que um modelo em tempo real é otimizado para reproduzir. A detecção baseada nesses sinais coloca os defensores em uma posição permanentemente atrasada, sempre procurando os indícios da geração anterior depois que a atual aprendeu a evitá-los.

Os sinais mais difíceis de falsificar são os que estão fora do controle do modelo: se a alegação de identidade é verificável por um canal independente, se a conta tem histórico, se a mesma pessoa pode ser alcançada uma segunda vez por uma rota diferente. Infraestrutura de identidade, em vez de detecção comportamental.

O padrão de divulgação é a verdadeira disputa

A contenção da Tavus é uma decisão da empresa, e decisões de empresa são reversíveis. A questão duradoura é qual deveria ser o padrão quando um sistema consegue se passar por humano na maioria das interações curtas.

A comparação a fazer é com o AI Act da União Europeia e os regimes de rotulagem de conteúdo sintético que agora entram em vigor globalmente. Essas regras foram concebidas em torno de mídia que pode ser marcada após a geração, com metadados e rótulos visíveis. Vídeo sintético em tempo real não é isso. Não há nada a rotular, porque a saída é efêmera e conversacional. A divulgação tem de ser uma propriedade do sistema que faz a chamada, uma identidade registrada e verificável para o participante automatizado, que a parte receptora possa checar.

Esse é um problema de engenharia solucionável, e ninguém o lançou ainda. Até que alguém o faça, o estado honesto das coisas é que uma empresa construiu algo capaz de convencer a maioria das pessoas de que uma máquina é uma pessoa em uma videochamada, publicou os dados mostrando que funciona e se recusou a lançá-lo. Esse é um desfecho melhor do que a alternativa, e é uma decisão que se sustenta apenas enquanto uma empresa quiser que se sustente.

Artigos relacionados