← Retour au blog
NewsEnviron 8 min de lecture

Le Griffin de Tavus est passé pour un humain dans 48 % des cas, et l'entreprise ne le commercialise pas

Publié le 7 oct. 2026
Le Griffin de Tavus est passé pour un humain dans 48 % des cas, et l'entreprise ne le commercialise pas

Tavus a dévoilé Griffin le 1er octobre, le présentant comme le premier modèle d'interaction humaine : un système vidéo-vers-vidéo en duplex intégral qui écoute, réagit et parle en temps réel. Dans une étude menée lors d'appels vidéo en direct, 26 des 54 participants ont cru que Griffin-Lite était un humain après une minute de conversation. La génération précédente du système n'y parvenait que dans 1 cas sur 41, soit 2,4 %.

Cela représente une amélioration d'environ un facteur vingt dans la capacité à convaincre qu'un participant synthétique est réel. Tavus a clairement indiqué qu'il n'ouvrirait pas Griffin au public tant que les mécanismes de sécurité ne seraient pas prêts. Compte tenu de ce que fait le modèle et de l'allure de ses modes de défaillance, cette décision mérite plus d'attention que la bande démo.

Le tableau technique

Griffin fonctionne en 720p à 25 images par seconde, avec une latence audio-vidéo d'environ 0,43 seconde. Sur le volet perception du benchmark VideoFDB de NVIDIA, il se classe premier avec 3,73, contre une référence humaine de 4,20. Il occupe la deuxième place pour la précision de la synchronisation labiale et répond plus lentement qu'une personne.

Le seuil d'accès est l'élément qui compte. Une seule photographie et dix secondes d'audio suffisent pour générer un double numérique fonctionnel. L'API de Tavus compte environ 150 000 développeurs et entreprises inscrits.

Mettez ces deux faits côte à côte et le profil de risque n'a rien d'hypothétique. Les données de Surfshark évaluent les pertes liées à la fraude par deepfake à 1,1 milliard de dollars en 2025, soit trois fois le chiffre de 2024. Dans l'affaire Arup à Hong Kong en 2024, un employé a participé à une visioconférence où tous les autres participants étaient des fabrications d'IA, et l'entreprise a perdu 25 millions de dollars.

Griffin ne rend pas les deepfakes possibles ; cela est réalisable depuis des années. Il les rend interactifs. Un faux préenregistré ne peut répondre qu'aux questions anticipées par son créateur. Un système en temps réel répond à tout ce qu'on lui demande, dans une conversation que l'autre partie croit avoir avec un collègue.

Ce qui change quand le faux peut improviser

L'affaire Arup a fonctionné parce que les fraudeurs avaient préparé un scénario et que la cible l'a accepté. La génération en temps réel supprime la contrainte de préparation. Un appelant peut désormais improviser face à une question inattendue (demander un détail sur un projet, faire référence à une réunion commune, réagir à une plaisanterie) et générer une réponse plausible en moins d'une demi-seconde.

C'est là que le chiffre de 0,43 seconde de latence cesse d'être une simple ligne de fiche technique. Chez l'humain, l'alternance des tours de parole s'établit autour de 200 millisecondes d'écart. À 430 millisecondes, Griffin est sensiblement lent, mais pas au-delà de ce qu'on observe chez quelqu'un dont la connexion est mauvaise ou qui se trouve dans une pièce bruyante. Cet écart peut être masqué par le contexte, et c'est précisément ce qui le rend dangereux : les utilisateurs l'attribuent aux conditions réseau, et non à quelque chose qui cloche.

La décision de Tavus de ne pas commercialiser reflète une lecture juste de la situation. L'entreprise est prise entre deux positions. La technologie est manifestement capable de tromper une majorité de participants dans une étude contrôlée. Les contre-mesures (marquage de provenance, détection de vivacité, identité vérifiée dans les appels) ne sont pas en place à l'échelle que la technologie exigerait.

Le benchmark comporte une référence humaine, et c'est tout l'enjeu

Il faut noter que VideoFDB rapporte un score humain de 4,20 contre 3,73 pour Griffin. Le modèle est classé premier parmi les systèmes et reste néanmoins en dessous des humains. Cet écart correspond à l'état actuel de la technique, et il se réduit à un rythme qui fait de « inférieur à l'humain » un réconfort de plus en plus fragile.

Le chiffre plus utile est le taux de croyance des participants dans le temps. L'étude a mesuré la croyance après une minute. La plupart des stratégies de détection reposent sur le fait que l'observateur remarque quelque chose sur une fenêtre plus longue : un geste répété, une réponse qui ne cadre pas avec l'historique de la conversation, une question esquivée deux fois. Un système qui survit à la première minute et se dégrade au bout de cinq constitue une menace différente de celui qui tient une heure, et le chiffre publié ne couvre que la première.

Ce que les organisations devraient faire dès maintenant

Les conseils défensifs manquent de panache et sont surtout d'ordre organisationnel.

La vérification par écrit de toute instruction financière ne suffit plus, et la voix non plus. Un rappel vers un numéro connu vaut mieux qu'un appel vidéo avec un participant inconnu, car le canal est vérifié même si la personne qui l'utilise ne l'est peut-être pas. Les secrets partagés fonctionnent jusqu'à ce qu'ils fuient, ce qui finit toujours par arriver.

La mesure la plus solide est procédurale : les instructions de grande valeur devraient exiger un second canal indépendant, et ce second canal doit être un que le demandeur ne peut pas déclencher lui-même. C'est la pratique standard des opérations de trésorerie, précisément pour cette raison, et elle s'applique à un monde où tout participant à une vidéo peut être synthétique.

Pour les opérateurs de plateformes, la pression porte sur la vivacité et la provenance. Les manifestes C2PA et les filigranes SynthID rattachent une provenance aux médias générés, et ni l'un ni l'autre ne survit de manière fiable à un réencodage. La vidéo en temps réel n'a aucun manifeste, ce qui signifie que la vérification doit se faire du côté du destinataire, pendant l'appel, sur la base de signaux comportementaux qui sont exactement ce que Griffin est entraîné à produire de façon plausible.

Il y a ici une circularité désagréable qu'il vaut la peine de nommer. Les signaux comportementaux que les gens utilisent pour juger si un participant à une vidéo est réel (pauses naturelles, micro-expressions, réactions appropriées à un contenu inattendu) sont les mêmes signaux qu'un modèle temps réel est optimisé à reproduire. Une détection fondée sur ces signaux place les défenseurs en position de retard permanent, à chercher les indices de la génération précédente alors que la génération actuelle a appris à les éviter.

Les signaux plus difficiles à falsifier sont ceux qui échappent au contrôle du modèle : la revendication d'identité est-elle vérifiable via un canal indépendant, le compte a-t-il un historique, la même personne peut-elle être jointe une seconde fois par un autre chemin. De l'infrastructure d'identité, plutôt que de la détection comportementale.

La norme de divulgation est le vrai combat

La retenue de Tavus est une décision d'entreprise, et les décisions d'entreprise sont réversibles. La question durable est de savoir quelle devrait être la règle par défaut lorsqu'un système peut passer pour un humain dans une majorité d'interactions courtes.

La comparaison qui s'impose est celle avec l'AI Act européen et les régimes d'étiquetage des contenus synthétiques qui entrent en vigueur partout dans le monde. Ces règles ont été conçues autour de médias qui peuvent être marqués après génération, avec des métadonnées et des étiquettes visibles. La vidéo synthétique en temps réel n'est pas cela. Il n'y a rien à étiqueter, car la sortie est éphémère et conversationnelle. La divulgation doit être une propriété du système qui passe l'appel : une identité enregistrée et vérifiable pour le participant automatisé, que la partie réceptrice peut contrôler.

C'est un problème d'ingénierie résoluble, et personne ne l'a encore livré. Tant que ce n'est pas le cas, l'état réel des choses est qu'une entreprise a construit quelque chose capable de convaincre la plupart des gens qu'une machine est une personne lors d'un appel vidéo, a publié les données montrant que cela fonctionne, et a refusé de le diffuser. C'est un meilleur résultat que l'alternative, et c'est une décision qui ne tient que tant qu'une seule entreprise le souhaite.

Articles associés