Google、SynthID Detectorを一般公開。ただし細則をよく読むこと

Googleは10月7日、SynthID Detectorを一般公開し、誰でも画像、動画、音声ファイルに隠されたAIウォーターマークを確認できるようにした。synthid.comのポータルは世界中で英語版が公開されている。Google、OpenAI、Appleのいずれかのアカウントでサインインし、ファイルをアップロードするだけだ。
これは以前の状況からの真の改善だ。以前は、Googleの信頼できるテスター向けプログラム以外でSynthIDを確認する唯一の方法は、Geminiに尋ね、返ってきた内容を解釈することだった。ウォーターマークの検出に、それを付与したモデルとの会話が必要であるべきではない。今週までは、この検出ツールは昨年のGoogle I/Oでアクセス権を得た記者、メディア関係者、研究者のテストグループ向けで、答えはしばしば、欲しかった1ビットの情報ではなく、長ったらしい文章として返ってきた。
スケールの実像
SynthIDの背後にある数字は大きい。2023年の開始以来、Googleは1,800億以上の画像と動画、さらに24万年分の音声コンテンツにウォーターマークを付与したと述べている。検証はSearch、Geminiアプリ、Chromeで実行され、現在は1日あたり100万件を超えるリクエストを処理している。
興味深いのはその仕組みだ。SynthIDは、剥がせるメタデータではなく、画像や動画のピクセル、音声の周波数成分に直接シグナルを埋め込む。画像と動画では、ウォーターマークは作成時点で書き込まれ、トリミング、フィルター、フレームレート変更、非可逆圧縮に耐えるよう設計されている。音声では、追加ノイズ、MP3圧縮、再生速度変更に耐えるよう作られている。Geminiアプリによるテキストのウォーターマークは仕組みが異なり、モデルが候補語に割り当てる確率スコアを調整することで、表示される出力を変えないようにする。
シグナルがどこに存在するかの違いが、SynthIDがメタデータを完全に剥ぎ取る操作に耐える理由だ。スクリーンショット、再エンコード、メタデータの削除はいずれも来歴タグを除去するが、ピクセル値そのものに織り込まれたパターンは除去しない。その代償は、ピクセルレベルのシグナルが激しい変換で最も劣化しやすいことでもあり、だからこそ検出ツールは手持ちで最も高品質なファイルを求めている。
対応フォーマットは幅広い。画像はJPG、PNG、WEBP、HEICほか複数の種類、動画はMP4、MOV、WEBM、音声はWAV、MP3、OGG、FLAC、AAC、M4Aに対応する。
本質的な拡大はパートナーシップ
以前の検出ツールはGoogle自身のSynthIDのみをチェックしていた。ChatGPTの画像にもSynthIDは付与されていたが、Googleのツールはそれらを検出しなかった。その制限はなくなった。検出ツールは現在、OpenAI、NVIDIA、Kakaoを含むすべてのSynthIDパートナーのウォーターマークに対応し、Appleもまもなく加わる。
実用的な効果として、1回のアップロードで複数の大手プロバイダーの出力を識別でき、各社の独自の検証ページで別々に確認する必要がなくなった。OpenAIは依然として独自ページを維持しているため、ChatGPTの画像が疑われる場合は確認先が2つある。
限界にも同等の注意を
このサイトは、自分が汎用的なAI検出ツールではないと明言しており、その免責事項は機能そのものより重要だ。識別できるのは、SynthIDを採用した企業のメディアだけである。MicrosoftとMetaは独自のウォーターマークと検証基準を運用しており、どちらもパートナーリストに載っていない。Metaの検出ツールは、自社の切り取られたAI画像の一部を見逃していたことがすでに判明している。
さらにオープンウェイトの問題がある。誰でも自分のハードウェアでオープンモデルを動かし、ウォーターマークもメタデータラベルも一切ない出力を生成できる。そうしたコンテンツは検出ツールに決して表示されない。
したがって、陰性の結果はファイルの出所が不明であることを意味する。ファイルが本物であることを意味しない。パートナーネットワーク外のモデルに由来する可能性もあれば、激しい改変によってシグナルが検出できないほど劣化した可能性もある。サイト自身のガイダンスでは、入手可能な最高品質のバージョンをアップロードし、結論を出す前に複数のデータポイントを集めるよう求めている。
サイトは、あまり注目されない逆の失敗モードについても言及している。まれに、検出ツールがウォーターマークを一切帯びていないコンテンツに対して誤って反応することがある。偽陽性は偽陰性よりも有害なエラーだ。本物の写真を合成画像だと非難するきっかけを与えるからである。誤りは双方向に存在し、どちらもファイルの出所を確認することの代わりにはならない。
アクセスは意図的に制限されている
このツールは無料だが制限付きだ。ユーザーは1日あたりおよそ10件の画像、動画、音声チェック枠を得られ、サインインが必須である。Googleのエンジニアによれば、この制限は人々がチェック機能をSynthID除去ツールの開発に利用するのを防ぐために存在する。非常に似たファイルを多数チェックしていると、システムがより早くロックアウトする可能性があるため、割当数はおおまかにしか説明されていない。そうしたパターンは、誰かが回避策を調整しているように見える。
プライバシー通知によれば、アップロードされたメディアはリアルタイムで処理され、結果が返された後に削除される。ただし、割当を執行するためにファイルのデジタル署名は24時間保持される。利用規約は、検出ロジックのリバースエンジニアリング、クエリの自動化、制限を回避するための複数アカウント作成を禁止している。
来歴をめぐる2つの思想
SynthIDは事後対応ではなく先回りのウォーターマーキング、つまりAIコンテンツにラベルを付ける手法だ。対照的なアプローチは、代わりに本物のコンテンツにラベルを付けるもので、C2PAのような暗号標準を使い、撮影時点で来歴情報をファイルに署名として埋め込む。GoogleのPixelスマートフォンは、これを行う数少ないデバイスの一つだ。
この2つのアプローチは異なる形で失敗する。ウォーターマーキングは生成側の協力に依存するが、オープンウェイトモデルには協力するインセンティブがない。暗号署名は撮影デバイスの協力に依存し、その機能を搭載したハードウェアに限定される。どちらも単独では問題全体をカバーできない。実践的な助言は、両方を使い、さらに地味な作業である出所、日付、文脈の確認も行うことだ。
ウォーターマーキングのアプローチが最初に出荷されたのには構造的な理由がある。新しいハードウェアも、コンテンツの消費方法の変更も必要ない。既存のモデルにアップデートで後付けできる。暗号学的な来歴には、標準に同意する撮影デバイス、編集ツール、ビューアーのエコシステムが必要だが、そのエコシステムはまだほとんど理想にとどまっている。より簡単な道が先に作られ、より簡単な道にはより大きな盲点がある。
さらに、誰も良い答えを持っていない敵対的な問題がある。ウォーターマークは耐久性を持つよう設計されているが、それは除去不可能であることと同じではない。あらゆる公開検出ツールは、それを打ち負かそうとする者にとっての訓練シグナルを提供する。まさにそれが、Googleが割当を制限し、自動クエリを禁止している理由だ。検出ツールは有用であり、同時に、マークを消そうとする者たちにとっての地図でもある。
持ち帰るべきこと
有用なメンタルモデルは、SynthIDは強い「はい」を1つと、非常に弱い「いいえ」を1つ与えるということだ。陽性の一致は特定のプロバイダー群を指し示す。陰性の一致はほとんど何も教えてくれない。後者をお墨付きとして扱う人は、ツールを誤用している。Google自身のドキュメントも、その点については異例なほど率直だ。
検出へのアクセス拡大は、メディアリテラシーにとって確かな勝利だ。ただしその勝利は、発表が思わせるほど広いものではなく、実際の有用性は注意書きの中にある。
関連記事
メモリチップが今やAIコンピューティングのボトルネックになっている
ロジックのロードマップは公開され、予測可能だ。メモリのロードマップは、パッケージング歩留まり、何年もかけて培われる人材基盤、そして3社の設備投資計画によって制約されている。
AI音楽にライセンスが付いた。実際に何をカバーしているのかを読む
安価なトラックは今も存在する。消えつつあるのは、プロンプトから生成されたトラックには権利主張がないという前提だ。それは決して真実ではなく、今では明らかに誤りである。
横店のスタジオは無人、アジアのAI映画製作ラインは稼働中
横店の空のステージこそ、観客が同意するかどうかにかかわらず、業界がすでに賭けを終えている証拠だ。
グーグル、データセンターに電力を供給するため原子力890メガワットを購入
計算能力は利用可能だ。電力を、サプライチェーンを整えるのと同じように何年も前から手配しなければならないのだ。