Tavus Griffinは48%の確率で人間と見なされたが、同社は提供しない

Tavusは10月1日にGriffinを公開し、初のHuman Interaction Model(ヒューマン・インタラクション・モデル)と説明した。リアルタイムで聞き、反応し、話す全二重のビデオ対ビデオ・システムである。ライブビデオ通話の調査では、54人中26人の参加者が1分間の会話の後、Griffin-Liteを人間だと思った。前世代のシステムでは41人中1人、つまり2.4%だった。
これは、合成参加者が本物であると人々に信じ込ませる点で約20倍の改善である。Tavusは、安全メカニズムが整うまでGriffinを一般公開しないと明言している。このモデルの能力と故障モードがどのようなものかを踏まえると、この決定はデモ映像よりも注目に値する。
技術的な全体像
Griffinは720p、25フレーム/秒で動作し、音声から映像への遅延は約0.43秒である。NVIDIAのVideoFDBベンチマークの知覚トラックでは、3.73で1位となり、人間のベースライン4.20と対比される。リップシンク精度では2位で、人間より応答が遅い。
重要なのはアクセスのしきい値だ。写真1枚と10秒の音声があれば、機能するデジタル・ダブルを生成できる。TavusのAPIには約15万の開発者および企業が登録している。
この2つの事実を並べると、リスク・プロファイルは仮説ではない。Surfsharkのデータでは、2025年のディープフェイク詐欺による損失は11億ドルで、2024年の3倍である。2024年の香港のArupの事例では、従業員が他の参加者全員がAIによる偽造だったビデオ会議に参加し、同社は2500万ドルを失った。
Griffinがディープフェイクを可能にするわけではない。それは何年も前から実現可能だった。Griffinはそれをインタラクティブにする。事前録画された偽物は、作成者が想定した質問にしか答えられない。リアルタイム・システムは、相手が同僚と会話していると信じている会話の中で、どんな質問にも答える。
偽物が即興できるようになると何が変わるか
Arupの事例が成立したのは、詐欺師がシナリオを準備し、標的がそれを受け入れたからだ。リアルタイム生成は準備という制約を取り除く。発信者は今や、予期しない質問(プロジェクトの詳細を尋ねる、共有した会議に言及する、冗談に反応する)を通して即興で対応し、0.5秒未満でもっともらしい応答を生成できる。
ここで0.43秒という遅延の数値は、仕様書の項目ではなくなる。人間の会話のターンテイキングは約200ミリ秒の間隔で進む。430ミリ秒では、Griffinは明らかに遅いが、接続が悪い人や騒がしい部屋にいる人の範囲を超えてはいない。この間隔は文脈によって覆い隠せる。まさにそれが危険な理由である。ユーザーはそれをネットワーク状況のせいにして、何かおかしいせいだとは思わない。
Tavusが出荷しないという決定は、これを正確に読み取ったものだ。同社は2つの立場の間にある。この技術は、管理された調査で参加者の過半数を欺けることが実証されている。対策(来歴マーキング、ライブネス検出、通話における本人確認)は、この技術が必要とする規模では整っていない。
ベンチマークには人間のベースラインがあり、そこが要点だ
注目すべきは、VideoFDBが人間のスコア4.20に対してGriffinの3.73を報告していることだ。このモデルはシステムの中で1位でありながら、依然として人間を下回っている。この差が現在の最先端であり、それは「人間未満」という安心が薄れていく速度で縮まっている。
より有用な数値は、時間経過に伴う参加者の信じ込み率である。この調査は1分後の信じ込みを測定した。ほとんどの検出戦略は、観察者がより長い時間枠で何かに気づくことに依存している。繰り返される仕草、会話履歴に合わない応答、2度回避された質問などだ。最初の1分を乗り切り、5分で劣化するシステムは、1時間持ちこたえるシステムとは異なる脅威であり、公表された数値は最初の1分しかカバーしていない。
組織が今すべきこと
防御に関する助言は地味で、ほとんどが組織的なものだ。
あらゆる金融指示のテキストベースの確認はもはや十分ではなく、音声も同様だ。未知の参加者へのビデオ通話より、既知の番号への折り返し電話のほうがよい。通話相手が本人でなくても、チャネルは検証されているからだ。共有シークレットは漏れるまで機能するが、実際に漏れる。
より強力な対策は手続き上のものである。高額の指示には第二の独立したチャネルを要求すべきであり、その第二チャネルは要求者が開始できないものでなければならない。これはまさにこの理由から財務オペレーションで標準的な慣行であり、あらゆるビデオ参加者が合成であり得る世界にも拡張できる。
プラットフォーム運営者にとっての圧力は、ライブネスと来歴にある。C2PAマニフェストとSynthIDウォーターマークは生成メディアに来歴を付与するが、どちらも再エンコードを確実には生き延びない。リアルタイム映像にはマニフェストがまったくない。つまり検証は受信側で、通話中に、Griffinがもっともらしく生成するよう訓練されている行動シグナルに基づいて行わなければならない。
ここには名指しする価値のある不快な循環がある。人々がビデオ参加者が本物かどうかを判断するために使う行動シグナル(自然な間、微表情、予期しない内容への適切な反応)は、リアルタイム・モデルが再現するよう最適化されているのと同じシグナルである。それらのシグナルに基づく検出は、防御側を恒久的に後追いの立場に置く。現世代が回避を学習した後で、常に前世代の兆候を探すことになる。
偽造しにくいシグナルは、モデルの制御外にあるものだ。本人性の主張が独立したチャネルを通じて検証可能か、そのアカウントに履歴があるか、同じ人物に別の経路で二度目に連絡できるか。行動検出ではなく、アイデンティティ基盤である。
本当の争点は開示基準だ
Tavusの自制は企業判断であり、企業判断は覆り得る。持続的な問いは、システムが短いやり取りの過半数で人間として通用するとき、デフォルトはどうあるべきかである。
引き合いに出すべき比較対象は、EU AI法と、今や世界で効力を持ち始めている合成コンテンツ表示制度である。それらの規則は、生成後にメタデータと可視ラベルでマークできるメディアを前提に設計された。リアルタイムの合成映像はそうではない。出力は一時的で会話的なので、ラベルを付けるものがない。開示は、通話を発信するシステムの属性でなければならない。自動参加者に登録済みで検証可能なアイデンティティがあり、受信側が確認できるようにするのである。
それは解決可能なエンジニアリング問題であり、誰もまだ実装していない。誰かが実装するまで、正直な状況はこうだ。ある企業が、ビデオ通話上で機械が人間であるとほとんどの人を納得させられるものを作り、それが機能することを示すデータを公表し、そして公開を控えている。それは代替案より良い結果であり、ある一社が望む限りにおいてのみ維持される決定である。
関連記事
インドは独自のAI安全ルールを策定し、ワシントンの模倣を拒否する
英語だけでテストすると、対象と称する展開の大半について何も保証しないフレームワークが出来上がる。
Anthropic、12万9000件の脆弱性を発見—その後、門戸を狭める
セキュリティ実証のピークにあった企業が、まさにその時点でアクセスをさらに制限することを選んだ。その理由は矛盾しない。
レディースウェアの商品ページに実在の人物はいない:AIモデルがECの信頼を崖っぷちに追いやる
画像が信頼できないから返品率が上がり、返品率が上がるから店舗は撮影コストをさらに削り、コストを削ると画像がさらに信頼できなくなる。この循環は技術の問題ではなく、インセンティブ構造が壊れているのだ。
6社の新聞社、学習データ内のペイウォール記事をめぐりマイクロソフトとOpenAIを提訴
ペイウォールに関する主張が最も鋭い部分だ。ペイウォールを越えて到達するクロールは、アクセス条件そのものを回避している。