Tavus Griffin wurde in 48 Prozent der Fälle für einen Menschen gehalten, und das Unternehmen veröffentlicht es nicht

Tavus veröffentlichte Griffin am 1. Oktober und beschrieb es als erstes Human Interaction Model: ein Vollduplex-Video-zu-Video-System, das in Echtzeit zuhört, reagiert und spricht. In einer Live-Videoanrufstudie hielten 26 von 54 Teilnehmenden Griffin-Lite nach einer Minute Gespräch für einen Menschen. Die vorherige Generation des Systems schaffte 1 von 41, also 2,4 Prozent.
Das ist eine etwa zwanzigfache Verbesserung darin, Menschen davon zu überzeugen, dass ein synthetischer Teilnehmer real ist. Tavus hat klar erklärt, dass Griffin nicht für die Öffentlichkeit zugänglich gemacht wird, bis Sicherheitsmechanismen bereit sind. Angesichts dessen, was das Modell leistet und wie die Fehlermodi aussehen, verdient diese Entscheidung mehr Aufmerksamkeit als der Demo-Reel.
Das technische Bild
Griffin läuft mit 720p und 25 Bildern pro Sekunde, mit einer Audio-zu-Video-Latenz von etwa 0,43 Sekunden. Im Perception-Track von NVIDIAs VideoFDB-Benchmark belegt es mit 3,73 den ersten Platz, gegenüber einer menschlichen Baseline von 4,20. Bei der Lippen-Synchronisationsgenauigkeit belegt es den zweiten Platz und reagiert langsamer als ein Mensch.
Die Zugangsschwelle ist der entscheidende Teil. Ein einziges Foto plus zehn Sekunden Audio reichen aus, um einen funktionierenden digitalen Doppelgänger zu erzeugen. Die API von Tavus hat etwa 150.000 registrierte Entwickler und Unternehmen.
Stellt man diese beiden Fakten nebeneinander, ist das Risikoprofil nicht hypothetisch. Daten von Surfshark beziffern die Verluste durch Deepfake-Betrug im Jahr 2025 auf 1,1 Milliarden US-Dollar, dreimal so viel wie 2024. Im Arup-Fall 2024 in Hongkong nahm ein Mitarbeiter an einer Videokonferenz teil, bei der jeder andere Teilnehmer eine KI-Fälschung war, und das Unternehmen verlor 25 Millionen US-Dollar.
Griffin macht Deepfakes nicht möglich; das ist seit Jahren machbar. Es macht sie interaktiv. Eine vorab aufgezeichnete Fälschung kann nur die Fragen beantworten, die der Ersteller vorhergesehen hat. Ein Echtzeitsystem beantwortet, was auch immer gefragt wird, in einem Gespräch, von dem die andere Partei glaubt, sie führe es mit einer Kollegin oder einem Kollegen.
Was sich ändert, wenn die Fälschung improvisieren kann
Der Arup-Fall funktionierte, weil die Betrüger ein Szenario vorbereitet hatten und die Zielperson es akzeptierte. Echtzeit-Generierung beseitigt den Vorbereitungszwang. Ein Anrufer kann jetzt durch eine unerwartete Frage improvisieren (nach einem Projektdetail fragen, auf ein gemeinsames Meeting verweisen, auf einen Witz reagieren) und in weniger als einer halben Sekunde eine plausible Antwort erzeugen.
Hier hört die Latenzzahl von 0,43 Sekunden auf, ein Eintrag im Datenblatt zu sein. Der Sprecherwechsel bei Menschen liegt bei etwa 200 Millisekunden Pause. Bei 430 Millisekunden ist Griffin merklich langsam, aber nicht außerhalb des Bereichs von jemandem mit schlechter Verbindung oder in einem lauten Raum. Die Lücke lässt sich durch den Kontext kaschieren, und genau das macht sie gefährlich: Nutzer schreiben sie den Netzwerkbedingungen zu, nicht einem Fehler.
Tavus' Entscheidung, nicht zu veröffentlichen, spiegelt eine zutreffende Einschätzung davon wider. Das Unternehmen steht zwischen zwei Positionen. Die Technologie ist nachweislich in der Lage, in einer kontrollierten Studie die Mehrheit der Teilnehmenden zu täuschen. Die Gegenmaßnahmen (Herkunftskennzeichnung, Lebendigkeitserkennung, verifizierte Identität in Anrufen) sind nicht in dem Maßstab vorhanden, den die Technologie benötigen würde.
Der Benchmark hat eine menschliche Baseline, und das ist der Punkt
Erwähnenswert ist, dass VideoFDB einen menschlichen Score von 4,20 gegenüber Griffins 3,73 ausweist. Das Modell steht unter den Systemen an erster Stelle und liegt dennoch unter Menschen. Diese Lücke ist der aktuelle Stand der Technik, und sie schrumpft mit einer Geschwindigkeit, die „unter menschlichem Niveau“ zu einem schwindenden Trost macht.
Die nützlichere Zahl ist die Überzeugungsrate der Teilnehmenden über die Zeit. Die Studie maß die Überzeugung nach einer Minute. Die meisten Erkennungsstrategien hängen davon ab, dass der Beobachter über ein längeres Zeitfenster etwas bemerkt: eine wiederholte Geste, eine Antwort, die nicht zur Gesprächshistorie passt, eine zweimal ausgewichene Frage. Ein System, das die erste Minute übersteht und über fünf Minuten hinweg schwächer wird, ist eine andere Bedrohung als eines, das eine Stunde lang standhält, und die veröffentlichte Zahl deckt nur die erste Minute ab.
Was Organisationen jetzt tun sollten
Der defensive Rat ist unspektakulär und größtenteils organisatorisch.
Eine textbasierte Verifizierung jeglicher Finanzanweisung reicht nicht mehr aus, und Stimme ebenso wenig. Ein Rückruf an eine bekannte Nummer ist besser als ein Videoanruf mit einem unbekannten Teilnehmer, weil der Kanal verifiziert ist, auch wenn die Person daran es möglicherweise nicht ist. Gemeinsame Geheimnisse funktionieren so lange, bis sie durchsickern – und das tun sie.
Die stärkere Maßnahme ist prozedural: Anweisungen mit hohem Wert sollten einen zweiten, unabhängigen Kanal erfordern, und dieser zweite Kanal muss einer sein, den der Anfordernde nicht initiieren kann. Das ist in Treasury-Operationen aus genau diesem Grund Standardpraxis, und es lässt sich auf eine Welt übertragen, in der jeder Video-Teilnehmer synthetisch sein kann.
Für Plattformbetreiber liegt der Druck auf Lebendigkeit und Herkunft. C2PA-Manifeste und SynthID-Wasserzeichen versehen generierte Medien mit Herkunftsinformationen, und keines von beiden übersteht eine Neukodierung zuverlässig. Echtzeitvideo hat überhaupt kein Manifest, was bedeutet, dass die Verifizierung auf der Empfängerseite stattfinden muss, während des Anrufs, auf Grundlage von Verhaltenssignalen, die genau das sind, was Griffin darauf trainiert ist, plausibel zu erzeugen.
Es gibt hier eine unangenehme Zirkularität, die es wert ist, benannt zu werden. Die Verhaltenssignale, mit denen Menschen beurteilen, ob ein Video-Teilnehmer real ist (natürliche Pausen, Mikroexpressionen, angemessene Reaktionen auf unerwartete Inhalte), sind dieselben Signale, auf deren Reproduktion ein Echtzeitmodell optimiert ist. Erkennung auf Basis dieser Signale bringt Verteidiger in eine dauerhafte Nachhutposition, in der sie immer nach den verräterischen Signalen der letzten Generation suchen, nachdem die aktuelle gelernt hat, sie zu vermeiden.
Die Signale, die schwerer zu fälschen sind, liegen außerhalb der Kontrolle des Modells: ob die Identitätsbehauptung über einen unabhängigen Kanal verifizierbar ist, ob das Konto eine Historie hat, ob dieselbe Person ein zweites Mal über einen anderen Weg erreicht werden kann. Identitätsinfrastruktur statt Verhaltenserkennung.
Der Offenlegungsstandard ist der eigentliche Kampf
Tavus' Zurückhaltung ist eine Unternehmensentscheidung, und Unternehmensentscheidungen sind umkehrbar. Die dauerhafte Frage ist, was die Voreinstellung sein sollte, wenn ein System in einer Mehrheit kurzer Interaktionen als Mensch durchgehen kann.
Der zu ziehende Vergleich ist der EU AI Act und die weltweit jetzt in Kraft tretenden Regelungen zur Kennzeichnung synthetischer Inhalte. Diese Regeln wurden für Medien konzipiert, die nach der Generierung markiert werden können, mit Metadaten und sichtbaren Kennzeichnungen. Echtzeit-Synthetikvideo ist das nicht. Es gibt nichts zu kennzeichnen, weil die Ausgabe flüchtig und dialogisch ist. Die Offenlegung muss eine Eigenschaft des Systems sein, das den Anruf tätigt, eine registrierte, verifizierbare Identität für den automatisierten Teilnehmer, die die empfangende Partei überprüfen kann.
Das ist ein lösbares Ingenieursproblem, und niemand hat es auf den Markt gebracht. Bis jemand es tut, ist der ehrliche Stand der Dinge, dass ein Unternehmen etwas gebaut hat, das die meisten Menschen davon überzeugen kann, dass eine Maschine in einem Videoanruf ein Mensch ist, die Daten veröffentlicht hat, die zeigen, dass es funktioniert, und es abgelehnt hat, es freizugeben. Das ist ein besseres Ergebnis als die Alternative, und es ist eine Entscheidung, die nur so lange Bestand hat, wie ein einzelnes Unternehmen sie aufrechterhalten möchte.
Verwandte Artikel
Indien schreibt seine eigenen KI-Sicherheitsregeln und lehnt es ab, Washingtons zu kopieren
Nur auf Englisch zu testen, würde einen Rahmen hervorbringen, der nichts über die meisten Einsätze zertifiziert, die er abzudecken vorgibt.
Anthropic fand 129.000 Schwachstellen – und verschärfte dann den Zugang
Das Unternehmen wählte auf dem Höhepunkt einer Sicherheitsdemonstration genau diesen Moment, um den Zugang weiter einzuschränken – und das ist kein Widerspruch.
Kein echter Mensch auf der Damenmode-Detailseite: KI-Models treiben das Vertrauen im E-Commerce an den Abgrund
Bilder sind nicht vertrauenswürdig, also steigt die Retourenquote; die Retourenquote steigt, also senken Händler die Fotokosten noch stärker; sinkende Kosten machen die Bilder noch unglaubwürdiger. Dieser Kreis ist kein technisches Problem – das Anreizsystem ist kaputt.
Sechs Zeitungen verklagen Microsoft und OpenAI wegen Paywall-Artikeln im Trainingsdatensatz
Der Paywall-Vorwurf ist der schärfste Teil: Ein Crawl, der über eine Bezahlschranke hinausgeht, umgeht die Zugangsbedingung selbst.