バイトダンス、動画の入手方法をめぐる訴訟を振り払えず

一群のYouTuberが、バイトダンスがテキスト・トゥ・ビデオモデルの学習のために数百万本の動画をスクレイピングしたと主張して同社を提訴した。バイトダンスはカリフォルニア州の連邦裁判所に訴えの却下を求めた。10月2日、Jacqueline Scott Corley判事はこれを認めなかった。
この判断は、AI学習をめぐる議論で脇に置かれてきた著作権法の条文に基づいている。これまで誰もがフェアユース、すなわち第107条について議論してきた。YouTuberらが争っているのは第1201条で、これは著作物へのアクセスを制御する技術的措置を回避することを禁じている。
それは別の訴訟であり、バイトダンスの抗弁はその違いに依存している。
バイトダンスが示した主張
同社の立場は、YouTubeの保護措置はダウンロードを規制するものであり、アクセスを規制するものではない、というものだった。問題の動画は公開されている。誰でも視聴できる。コンテンツがすでに誰にでも利用可能なら、一括ダウンロードを遅くする措置は、法文が意味するアクセス制御には当たらず、第1201条は適用されない、とバイトダンスは主張した。
Corley判事はこれを退けた。同判事は、バイトダンスが回避したとされるYouTubeの保護策は、DMCAが回避を禁じている種類のアクセス制御に当たると判断した。彼女の解釈では、プラットフォームが制限していたのはアクセスの方法と量であり、それは該当する。
彼女が引いた区別は、今後重要になるものだ。ペイウォールはアクセス制御である。ログインもそうだ。そしてどうやら、それ以外は無料で閲覧できるコンテンツを守るレートリミッターやアンチボット措置も同様である。法律は、著作物が秘密でなければならないとは述べていない。
なぜこれが学習パイプラインにとって問題なのか
実際的な影響は、データ自体が公開投稿されていたとしても、データ収集方法が違法になり得るということだ。
もし裁判所がその解釈に同意すれば、モデル学習者にとってのコンプライアンス上の問いは変わる。もはや「この著作物から学習する権利が自分にあったか」だけではない。「プラットフォームが許可した方法で著作物を取得したか」にもなる。これらは別々の問いであり、別々の答えを持つ。企業は前者では正しく、後者では間違っていることがあり得る。
2つ目の問いは、原告にとって訴訟で争いやすいものでもある。フェアユースには、目的、性質、量、市場への影響という4要素の分析が必要で、答えは争いの余地がある。スクレーパーが技術的措置を破ったかどうかは、より事実認定に近い。ツールが制御を回避したか、しなかったかだ。

第1201条はしばらくの間、AI訴訟の周辺にあり続けてきた
この条文が学習をめぐる紛争に登場したのは初めてではないが、以前の事件では逆の結論になった。
Doe v. GitHubでは、開発者たちはCopilotが自分たちのコードを無許諾で複製したと主張したが、著作権管理情報の削除を扱う第1202条の請求に対する裁判所の扱いは、原告たちが期待したより狭いものだった。Roblox事件では、Austin Beaulierというアーティストが、学習データセットに使われた3DモデルからNoAIタグが削除されたことをめぐって提訴した。Beth Labson Freeman判事も10月2日にこれを却下し、NoAIタグはコンテンツ管理情報に当たるが、原告はRobloxが意図的にそれを削除したことを示せていないと判断した。
これらはどちらも、著作物に付随する情報に関する第1202条についてのものだ。バイトダンスの事件は、その手前のゲートに関する第1201条についてである。Robloxの却下とバイトダンスの存続が同じ日に起きたことで、この分岐は可視化された。削除されたメタデータに関する請求は立証が難しく、回避されたゲートに関する請求はより容易である。
フェアユースの状況も確定していない
同じ週には、Thomson Reuters対ROSS Intelligenceの伏せ字のない意見書が出た。第3巡回区控訴裁判所は、Westlawのヘッドノートで法律調査ツールを学習させることはフェアユースに当たらないと判断した。この事件は第107条に関するもので、技術的措置は一切含まれていない。ROSSは編集要約を複製し、競合製品の構築に利用した。
3つの判断を合わせると、AI学習パイプラインの法的リスクが原則ではなく仕組みに依存する状況が描かれる。データがどのように取得されたか、メタデータがパイプラインを通過して残ったか、出力がソースと競合したか、それぞれに独自のルールがある。
大規模に学習データを収集する企業にとって、運用上の帰結は、収集レイヤーがそれ自体でコンプライアンスの対象面になったということだ。クローラーがどう振る舞ったかの記録、レート制限やrobots指示の遵守、プラットフォームの防御を回避する作り込みをしないことは、もはや礼儀ではない。今やそれらが、事件を訴答段階で却下できるかどうかを決める。
なぜプラットフォームの利益がクリエイターの利益と同じくらい重要なのか
第1201条の請求は、ゲートを築いた者と、その背後に著作物を置く者の両方に帰属する。
YouTubeの保護措置が存在するのは、プラットフォームが自らのカタログへのアクセス方法を制御することに独自の利益を持っているからだ。一括ダウンロードは、大規模に動画を配信するサービスにとって高コストであり、スクレイピングは帯域幅、広告測定、そしてプラットフォームが権利者と交渉するライセンス契約に影響を及ぼす。そうした措置をアクセス制御として扱う判断は、あらゆる種類の自動収集に対する法的道具をプラットフォームに与えることになり、これまで彼らにはそれがなかった。
それはAI学習を超えて及ぶ。価格監視、学術研究データセット、競合分析、その他大量にサイトを読み取るあらゆるものを対象にする。この回避防止規定は、そうしたすべてより何十年も前に作られたものであり、今では起草者が想像しなかった種類の活動を規律するよう求められている。
権利者にとっての帰結は、裁判所に持ち込む第二の道である。モデル学習者に対してフェアユースの主張で勝てないクリエイターでも、著作物がどのように取得されたかについて請求を持つことができる場合があり、その請求は同じようには経済的損害の立証を必要としない。必要なのは、技術的措置が破られたことの立証である。
証拠開示はどこへ向かうか
事件が証拠開示まで存続すれば、興味深い資料は法的というより運用上のものになる。どのクローリングツールが使われたか、プラットフォームの指示を尊重するように設定されていたか、どれだけのリクエストがどの期間にわたって行われたか、そして当時、同社のエンジニア自身がリスクについて何を書いていたか、である。
内部文書は最近のAI事件のいくつかの結論を左右しており、バイトダンス規模の学習パイプラインは相当な痕跡を残す。スクレイピングが始まる前に誰かが法的リスクを指摘していたかという問いが、和解額を左右しがちである。
次に何が起こるか
この判断は、バイトダンスが権利侵害をしたかどうかを決めたものではない。訴答段階で事件を存続させるものであり、つまりYouTuberらは証拠開示を得る。そこで具体的内容が公になる。どの動画か、どのツールか、どの措置が破られたか、そして何回か。
最も可能性が高い道は、裁判前の和解である。この形の訴訟は通常そう終わり、バイトダンスには学習パイプラインがどう運用されていたかの公開記録を残す利益はない。しかし法的問題は今や制度の中にあり、その答えは、将来のあらゆるスクレーパーがプラットフォームの防御にどう立ち向かうかを形作るだろう。
さらに広い論点がある。AI業界のデータ問題はライセンス問題として扱われてきた。権利者に金を払えばすべて問題ない、というわけだ。この一連の事件は、支払いだけでは不十分であることを示唆している。なぜなら、著作物をホストするプラットフォームには独自の利益があり、それが技術的措置に成文化され、著作物を無料で読めたかどうかを問わない法律に支えられているからだ。コンテンツを合法的に取得することと、クリーンに取得することは、今や2つの別個の義務である。
関連記事
再生可能エネルギー企業の創業者らがNvidia Rubin GPUを2万基発注
チップの発注は簡単な部分にすぎない。その下にある資金調達スキームこそがリスクの所在だ。
ホワイトハウスはAI政策を情報機関トップに委ねた、そして執行圧力は別の場所からやってくる
連邦政府のAIアジェンダは少なくとも同時に二つの場所で設定されており、両者は明らかに整合していない。
メディケア侵害を受け、オーストラリアが全連邦機関にレガシーシステムの監査を命じる
監査はリスクを明るみに出す。修正への資金供与は、別の予算を伴う別の作業だ。
武漢の裁判所、著作権判決でAIコンピューティング費用を算定し、新たな種類の先例を確立
金額は小さい。その手法は、APIの請求書を、その作品の制作にいくらかかったかの証拠として扱う。