6社の新聞社、学習データ内のペイウォール記事をめぐりマイクロソフトとOpenAIを提訴

10月2日、6社の出版企業が、GPTモデルの開発における著作権侵害および著作権管理情報の削除を主張して、米国ミシシッピ州南部地区連邦地方裁判所でマイクロソフトおよびOpenAIの10法人に対して訴訟を提起した。
原告にはEmmerich Newspapers、Ojai Media、およびCoopwood系の複数社が含まれ、これらは南部全域で新聞や雑誌を発行している。被告はマイクロソフトと、相互に関連するOpenAIの一連の法人である。事件はヘンリー・トラヴィリオン・ウィンゲート判事に割り当てられ、ドケットは10月5日に最終更新された。
訴状が実際に主張していること
重要となる主張は3つある。
第一に、訴状は、被告が原告のウェブサイト(ペイウォールの背後にあるコンテンツを含む)を体系的にクロールし、モデルが更新されるたびに記事を繰り返しサーバーにコピーしたと主張している。法的に重要なのはこの繰り返しのコピーである。1回のクロールは1つの行為にすぎない。トレーニング実行のたびにコーパスを再コピーすることは、侵害とされるコピーの数を倍増させ、結果として責任の規模を倍増させる。
第二に、原告は、モデルが記憶(memorization)を示し、トレーニング対象作品の検索可能なコピーを符号化していると主張している。この主張は、問題がトレーニングが行われたかどうかではなく、結果として得られたモデルが保護された表現を要求に応じて再現できるかどうかにある、一連の訴訟につながる。
第三に、訴状は、ChatGPT SearchやDeep Researchのような製品が原告のウェブサイトからリアルタイムでコンテンツを取得し、応答に組み込んでいると主張している。これはトレーニングとは別の、検索層に関する問題である。たとえライセンスされたデータのみでトレーニングされたモデルでも、回答時に、読み取るライセンスを持たないサイトからテキストを引き出す可能性がある。
原告はまた、被告が記事から著者クレジット、発行元名、著作権表示、利用規約情報を削除したとも主張している。これは著作権管理情報の法理に対応し、根底にあるコピーが違法であったことを証明する必要はない。参照された作品から著作権表示を削除すること自体が、米国法上の独立した違反である。
3つの請求原因は、直接著作権侵害、著作権管理情報の削除、および記事の故意の窃盗である。
ペイウォールの詳細が重要な理由
ペイウォールに関する主張は訴状の中で最も鋭い部分であり、著作権で保護されたテキストでのトレーニングがフェアユースかという一般的な問題とは切り離して考える価値のある詳細である。
ペイウォールの背後にあるコンテンツは、オープンウェブの外側に位置する。それは、しばしば支払いを条件としてアクセスを条件付けて公開され、その条件は通常、自動収集を禁止している。ペイウォールを越えて到達するクロールは、どのページが公開されていたかについての誤りではなく、アクセス条件そのものを迂回するものである。
この枠組みは、データ所有者が訴訟を提起する方法におけるより広い変化と一致する。争点は、コピーが保護されるかどうかから、収集方法が発行者が設定したアクセス条件を尊重したかどうかへと移っている。契約とアクセス条件は、著作権だけではできなかった役割を果たしている。

より広いパターンの中での位置づけ
この事件は、著作権およびアクセスをめぐる訴訟が密集する領域に加わる。RedditがAnthropicに対して提起した契約上の請求は進行中であり、プラットフォームに著作権法の外でデータ収集に異議を唱える道を与えている。Anthropicはオーストラリア議会への提出文書で、権利者がrobots.txtを通じてオプトアウトできる「限定的な条件付き承認」をトレーニングに提案したが、これはオーストラリアの公共放送局によって常に回避されているとして拒否された。
これらの事件に共通して、同じ技術的事実が繰り返し現れる。主要なクローラーがrobots.txtシグナルを無視したことが文書化されたテストで示されている。ペイウォールされたコンテンツが収集されたと考えられる。検索機能は、発行者がライセンスしていないにもかかわらず、回答の中で発行者のテキストを表出させる。
ここでの発行者は、アーカイブに実際の価値があり、法的予算は控えめな地方・地域の媒体である。だからこそこの事件は注視に値する。大規模な法務チームを持つ大手出版社の勝訴は法を試す。地域新聞社が提起した事件は、何年もの証拠開示に耐えられない権利者にとって救済が利用可能かどうかを試す。
判決が変えうるもの
結果は、裁判所が2年間決着をつけずに巡ってきた問題にかかっている。著作権で保護されたテキストでのトレーニングはフェアユースか、そしてテキストがペイウォールの背後にあった場合に答えは変わるのか。記憶はトレーニングでの利用を侵害的な複製に変えるのか。リアルタイム検索はトレーニングとは別の責任を生むのか。そして、データセットに現れる作品から著作権表示を削除することは、コピー自体が許されていても違反に当たるのか。
これらのいずれも解決されていない。訴状が行っているのは、4つの問いすべてを単一の事実関係に結びつけ、連邦地方裁判所に提示することである。公開ウェブコンテンツの上に製品を構築する者にとって、この組み合わせこそ追うべきものである。答えはすぐには出ないだろうし、まずクロールし後で交渉するという業界の現在の慣行こそ、この訴訟が試しているものである。
地域出版社が異なる事件を提起する理由
原告の身元は、過去数年間の大手出版社の事件がそうではなかった形で訴訟を形作る。
ニューヨーク・タイムズの事件、およびその前の音楽業界の訴訟は、数十年にわたる商業ライセンス収入を持つ企業アーカイブを根拠にしていた。彼らは市場が存在し、それが置き換えられたと主張できた。地域新聞社の集団は、異なる立証上の立場をもたらす。彼らのアーカイブはより小さく、ライセンスの履歴はより薄く、主張はより直接的にコピー自体と著作権情報の削除に依拠している。
それは救済にとって重要である。原告が著作権管理情報の請求原因で勝訴すれば、根底にあるコピーが争われている場合でも救済は利用可能である。なぜなら、表示を削除することは独立した違反だからである。長いライセンス履歴を持たない原告にとって、この請求原因はより扱いやすい道である。
別個のリスクとしての検索層
ChatGPT SearchとDeep Researchに関する主張は、トレーニングの問題とは切り離して考える価値がある。なぜなら、それは異なる種類の責任を指し示しているからである。
トレーニングは、コーパスが何度再構築されても、1回限りの行為である。検索は、ユーザーが尋ねるまさにその瞬間、すべてのクエリで発生する。製品が発行者のサイトからリアルタイムでテキストを取得し、それを応答に組み込むなら、侵害とされる行為は継続的かつユーザーによって引き起こされる。
この区別により、原告はトレーニングに関するフェアユースの議論に勝つことに依存しない請求を得る。完全にライセンスされたデータでトレーニングされたモデルさえ、検索機能を通じて、ライセンスを受けたことのない情報源からテキストを表出させることができる。訴状の枠組みは、検索とトレーニングを2つの別個の不法行為として扱っており、これはすべてをトレーニングコーパスに結びつけるよりも強い構造である。
出版社が注視していること
この種の事件を大規模に提起する価値があるかどうかを業界に示す2つのシグナルがある。
第一は、裁判所が著作権管理情報の請求を却下申立てを乗り越えさせるかどうかである。この請求原因はフェアユースの解決を必要としないため、原告に有利な判断が出れば、出版社は完全な侵害裁判よりも迅速な救済への道を得ることになる。
第二は、証拠開示がトレーニングパイプラインに及ぶかどうかである。原告が何がいつクロールされたかの記録を強制的に提出させることができれば、事件はフェアユースに関する法的議論から、クローラーが実際に何をしたか(ペイウォールを越えたかどうかを含む)に関する事実上の議論へと変わる。出版側の実務家はまさにその種の命令をドケットで注視している。なぜなら、それは自らの訴訟を提起する前にどのような証拠が入手可能かを教えてくれるからである。
関連記事
インドは独自のAI安全ルールを策定し、ワシントンの模倣を拒否する
英語だけでテストすると、対象と称する展開の大半について何も保証しないフレームワークが出来上がる。
Tavus Griffinは48%の確率で人間と見なされたが、同社は提供しない
事前録画された偽物は用意された質問にしか答えない。リアルタイム・システムはどんな質問にも答える。
Anthropic、12万9000件の脆弱性を発見—その後、門戸を狭める
セキュリティ実証のピークにあった企業が、まさにその時点でアクセスをさらに制限することを選んだ。その理由は矛盾しない。
レディースウェアの商品ページに実在の人物はいない:AIモデルがECの信頼を崖っぷちに追いやる
画像が信頼できないから返品率が上がり、返品率が上がるから店舗は撮影コストをさらに削り、コストを削ると画像がさらに信頼できなくなる。この循環は技術の問題ではなく、インセンティブ構造が壊れているのだ。