← ブログに戻る
News読了目安 14 分

Metaが書籍訴訟を和解。許諾には今や値段がつく。

公開日 2026年10月7日
Metaが書籍訴訟を和解。許諾には今や値段がつく。

Metaは、Llamaモデルの訓練に海賊版書籍を使ったとして提起された集団訴訟で和解に応じた。提案された合意は9月下旬に連邦裁判所に提出され、数日後に権利者へ通知が送られた。金銭条件は裁判官が承認するまで封印されており、Metaは依然として公には、自社の訓練慣行はフェアユースに当たると主張している。和解が語らないことは、語っていることと同じくらい雄弁だ。

この訴訟の焦点は、訓練側ではなく取得側にあった。著者らは、Llamaモデルが2018年から2024年の間にLibGenなどのシャドーライブラリから取得された作品で訓練されたと主張した。この点が重要なのは、別の判決がすでにこの問題の真ん中に線を引いていたからだ。Anthropic事件で、ウィリアム・アルサップ判事は、著作権で保護された書籍でモデルを訓練すること自体は適法だが、海賊版のコピーのライブラリを保持することは適法ではないと判断した。その事件の制裁金、15億ドルの和解は、学習そのものではなく、書籍の入手方法に結びついていた。

二つの結論を合わせて読むと、言うのは簡単だが、それに従って生きるのは難しいルールが見えてくる。適法に入手した書籍から学ぶのは問題ない。海賊版のコピーからコーパスを構築するのは問題ないとは言えない。15億ドルという数字は、作品あたりおよそ3,000ドルに相当し、各ラボが自らのリスクを値付けする方法を与える。海賊版サイトからコーパスをスクレイピングしたなら、その判断がいくらかかるかの概算が手に入ったことになる。

オプトアウトは価格に置き換わりつつある

より影響が大きい変化は、次に起きることだ。今月報じられた別の和解では、任意のオプトアウト登録モデルが、使用データ量に連動した強制ライセンス料の仕組みに置き換えられた。その背後にある主張は率直だ。オプトアウトの入口は書面上は公平に見えたが、実際には機能しなかった。なぜなら開発者は除外リストをほとんど確認せず、尊重もしなかったからだ。冊数ごとの支払いは無視しにくい。

これは交渉全体の構図を変える。オプトアウトの下では、権利者にできるのはノーと言って望みをかけることだけだった。価格付きライセンスの下では、許諾は数字のついた費目になり、議論はAI企業が作品を使えるかどうかから、いくら支払うべきかに移る。出版社と著者にとって、それは誰も執行しなかった技術的障壁よりはるかに良い立場だ。

ラボにとっての実際の影響は、新たなコンプライアンス予算である。データの出所はもはやエンジニアリング上の好みではなく、法的要件になる。数ペタバイトのデータセットのうち一つのコーパスでも、文書化できない出所から来ていれば、訓練パイプライン全体に特定の責任を持ち込む。そして失敗は通常、第三者データセットが明確な帰属表示なしに結合される集約層で起きる。

出力の問題は依然として未解決だ

訓練データは二つの戦線のうちの一つにすぎない。もう一つはモデルが何を生み出すかであり、そこでは状況はより流動的だ。ニューヨーク・タイムズは、ChatGPTの出力が自社のジャーナリズムと競合するともっともらしく主張して、OpenAIの却下申立てを乗り切った。これは市場代替論であり、取得論とは異なる形で切り込む。モデルがある作品から学び、それを再現しないなら、変容的利用の主張は成り立つ。その出力が市場で原作の代わりになるなら、主張は弱まる。

却下申立ての棄却は責任認定ではないし、タイムズ事件はまだ進行中だ。しかし二つの理論が合わさることで、AI企業は今や出所と出力の監視を一つの問題として扱っている。ライセンスされたデータで訓練されたモデルでも、ソースと競合するものを生成することはあり得るし、ライセンス条項は何をしてはならないかをますます明記している。

音声は同じ道をたどっていない

書籍出版社がライセンス市場へ向かっているなら、音楽はもっと厄介な方向へ向かっている。Sunoは、ドイツで演奏権管理団体GEMAに提起された、著作権で保護された録音と楽曲の使用をめぐる判決で敗れた。米国のテキスト事件は主に支払いと遡及ライセンスに落ち着きつつある。音声事件は差止命令と管轄争いを生んでおり、製品企業にとってはより悪い結果だ。差止命令はサービスに課税するのではなく、サービスを止めるからだ。

違いは、出力が入力にどれだけ近いかにあるようだ。書籍を要約する言語モデルはテキストから一歩離れている。アーティストのスタイルで楽曲を生成する音楽モデルは、比較が即座にできるほど近く、裁判所は変容論をそこまで広げることにあまり前向きではない。

価格がまだ存在しない領域

作品あたりのベンチマークは今のところテキスト現象であり、その理由はインフラにある。書籍出版社には集団ライセンス団体があり、複製権に関する何十年もの判例があり、交換単位がある程度明確だ。それが作品である。そのためタイトルごとの価格は定義しやすく、法廷で議論しやすい。

温かいリネン素材の上に、クリーム色の無地ハードカバー本をきれいに積み上げ、その横に真鍮製の小さな天秤があり、無地の分銅が載っている。

画像、動画、コードには同じ前提がない。ストックフォトライブラリは画像ごとにライセンス価格を設定できるが、ウェブページのスクリーンショットには多数の著作権要素が同時に含まれ、コードリポジトリはライセンス済み、寛容型ライセンス、出所不明のファイルを同じツリーに混在させる。問題がテキストからこれらのいずれかに移ると、作品あたりの計算式は当てはまらなくなり、議論はフェアユースに戻る。それはAI企業が戦いたい土俵だ。

もう一つの未解決問題は、誰が徴収するかだ。誰も管理しないライセンス料は、結局また集団訴訟になる。今月報じられた和解の仕組みも、公表された料率を持つ常設市場ではなく、事件ごとに交渉された支払いを描いているにすぎない。料率が公開されるまで、すべての交渉は非公開で行われ、最大の買い手が最良の条件を得る。それが、形成されたがまだ成熟していない市場の形だ。

これらのモデルの上に構築する場合、何を意味するか

これを読んでいる開発者の大半は基盤モデルを訓練していないので、直接的なリスクは低い。間接的なリスクは低くない。8桁・9桁の和解金を吸収したラボはコストを転嫁し、その仕組みはAPI価格である。今後1、2年でモデルアクセスの予算は増えると見ておくべきだ。特にライセンス素材で訓練されたモデルでは、ライセンス自体が売上原価の一部になっている。

AIワークロードをホストまたは実行する人にとって、もう一つ静かな含意がある。クライアントの訓練データセットを保存するなら、法的リスクは今やクライアントがそれをどう使うかではなく、それらのファイルがどこから来たかに依存する。明確な出所文書はもはや間接費ではなく、8桁の判決を自分が運用するシステムに着地させないためのものになる。

未解決なのは、価格モデルがどこまで広がるかだ。テキスト出版社には集団ライセンスのインフラと、参照できる一連の確定判例がある。音楽には管理団体があるが、出力の関係が異なる。画像、動画、コードにはそれぞれの力学があり、どれもまだ作品あたりのベンチマークを持っていない。Metaの和解は地図から一つの目印を消しただけだ。残りを描いたわけではなく、次のいくつかの和解が、許諾が市場になるのか、例外の連続にとどまるのかを決める。

関連記事