PewDiePie、蒸留で2度BAN——そしてルールはついに個人を狙い始めた

フェリックス・シェルベリ(PewDiePieとして知られる)は、OpenAIに2度BANされたと視聴者に語った。彼の違反行為は、ウェイトを密輸したり、APIアクセスを大規模に転売したことではない。彼はOpenAIのモデルのひとつの出力を使って、Ajaxという9Bモデルを訓練した。Ajaxは自身のハードウェア上で、検索やメールといった日常的な用途に動かしているモデルだ。
Ajaxは小規模なオープンモデルであるQwen3.5-9Bをベースにしており、より大規模なクローズドモデルが生成したデータでファインチューニングされている。このプロセスは蒸留(distillation)と呼ばれる。これは過去2年間に安価で高性能なモデルの波を生み出してきたのと同じ技術であり、大手ラボが今、必死に取り締まろうとしている技術でもある。
蒸留とは実際何なのか
モデルを蒸留するとは、小さいモデルを訓練して大きいモデルを模倣させることだ。教師モデルにプロンプトを与え、その回答を集め、生徒モデルがそれらを再現できるように訓練する。生徒モデルは教師モデルのウェイトやアーキテクチャを必要としない。ただ、パターンを学ぶのに十分なだけの教師の振る舞いがあればよい。
これがラボが気にする理由だ。フロンティアモデルの訓練には数千万ドルから数億ドルかかる。競合他社や個人がAPIを通じてその出力を収集し、その能力を自分たちが所有するモデルに移せば、作業の高コストな部分は一部迂回される。出力はテキストに見えるが、コピーされているのはその背後にあるシグナルなのだ。

シェルベリの件が重要なのは、それが小さいからだ。彼は資金豊富なスタートアップで競合製品を出しているわけではない。消費者向けGPUとローカルモデルを持った一個人にすぎない。それでも取り締まりはそこまで届いた。
ラボは規模について推測しているわけではない
OpenAIによるシェルベリのBANは、目に見える氷山の一角にすぎない。より大規模なキャンペーンは産業的だ。AnthropicのCEOダリオ・アモデイは、約25,000の偽アカウントを使い、Claudeと約2,880万回のやり取りを行った単一の蒸留オペレーションについて述べている。その規模になると、出力の収集は副業的なプロジェクトではない。人員とインフラを備えたデータパイプラインだ。
OpenAIは企業に対しても動いている。xAIがOpenAIの出力をGrokの訓練に使った後、OpenAIは蒸留への懸念を理由に、Cursorのモデルへのアクセスを遮断した。これらの行動に共通するパターンは、取り締まりがもはや明らかな転売業者だけを対象にしていないことだ。クローズドモデルから抽出された能力に製品が依存している者すべてを対象にしている。
これをめぐっては、検出産業全体が形成されつつある。ラボはアカウントのパターン、リクエスト量、収集されたデータの統計的指紋を探している。捕まることは必ずしも訴訟を意味しない。APIアクセスを失うことを意味する場合があり、スタートアップにとってそれは多くの場合、同じことだ。
25社がより明確なルールを求めた
ラボによる取り締まりは、ルールがどうあるべきかをめぐる公然たる意見対立を背景に起きている。2026年7月、Nvidia、Meta、Microsoftを含む25の組織が書簡に署名し、オープンウェイトモデルが米国のAIリーダーシップの中心だと主張した。彼らは、オープンモデルへの広範な制限ではなく、蒸留を直接扱う的を絞った法的枠組みを求めた。
OpenAI、Anthropic、Googleは署名しなかった。3社はいずれも、自社の出力がどれだけ簡単にコピーされるかを制限することに価値が依存するフロンティアモデルを持っている。対立の本質は、誰がそれを許され、どのような条件で行えるかにある。
その隙間に、米国の控訴裁判所は9月下旬に別のデータ点を加えた。Thomson Reuters対Ross Intelligenceでは、第三巡回区控訴裁判所が、競合他社の編集素材をコピーして検索製品を訓練することはフェアユースではないという判決を支持した。できあがった製品が情報源と直接競合するからだ。この事件は生成モデルではなく検索エンジンに関するもので、裁判所はすべてのAI訓練を判断しているわけではないと慎重に述べている。しかし、技術的な取り締まりが厳しくなるのと同時に、訓練データの法的基盤が揺れていることを示している。
「蒸留」という言葉が大きな役割を果たしている理由
モデルの出力の使い方がすべて同じわけではなく、現在のルールはその違いを曖昧にしている。モデルにコード作成を手伝ってもらうのは通常の利用だ。競合モデルを訓練するために何百万もの例を生成させるのはそうではない。その中間に、趣味のモデルを少し賢く動かすために出力を使う人がいる。シェルベリはおおよそそこに位置する。
ラボは出力データを、自らが使用・管理する権利を所有する資産として扱っている。利用規約はそう述べており、取り締まりは法的基準ではなく規約に従っている。だから同じ行為が、あるアカウントでは許可され、別のアカウントでは禁止され得る。それは量、提供者が読み取る意図、そして出来上がったモデルが競合製品に見えるかどうかによる。明確な線引きはなく、それが欠けていることが、正しい側にとどまろうとする者にとっての本当の問題なのだ。
検出は境界をさらに見えにくくする。ラボは収集を示唆するパターンを探す。異常なリクエスト量、一括作成されたアカウント、評価スイートに似たプロンプトなどだ。数千件のプロンプトを実行する個人は、これらのどれにも引っかからないかもしれない。25,000アカウントを使うオペレーションは必ず引っかかる。その中間では、答えは本当に不確かであり、不確実性は製品の土台としては貧弱だ。
同時期に裁判所の判断が下った
技術的な取り締まりが厳しくなる一方で、法的状況は依然として動いている。9月下旬、第三巡回区控訴裁判所は、競合他社の編集素材をコピーして検索製品を訓練することはフェアユースではないという判決を支持した。できあがった製品が情報源と競合するからだ。裁判所は、その判断が生成モデルではなく検索エンジンに関するものであり、AI訓練の普遍的なルールを定めるものではないと慎重に注記した。
狭く読めば、この事件はシェルベリのローカルモデルについてほとんど何も語っていない。シグナルとして読めば、競合する製品の素材でモデルを訓練する場合、裁判所は市場への害を重く見る用意があることを示している。ラボはすでに、その原則が自社の出力にも当てはまるとみなして行動している。裁判所はまだ当てはまるかどうかを示していない。
小規模モデルを動かしている場合、これが意味すること
個人開発者や小規模チームにとって、実務的な状況は法律よりも速く変わった。
自分で生成した出力でローカルモデルを訓練することは、著作権法ではなく提供者の利用規約に依存するグレーゾーンに位置する。主要な提供者のほとんどは、競合モデルを訓練するために出力を使うことを禁止している。何が「競合」に当たるかは提供者が定義し、取り締まりは予告なく、APIキーの停止という形でやってくることがある。
やる価値のあることがいくつかある。蒸留元の特定モデルの利用規約を読み、一般ポリシーだけで済ませないこと。訓練データがどう作られたかの記録を残すこと。提供者から問い合わせがあった場合、監査可能な記録があるかどうかが、警告とBANの分かれ目になる。派生的な訓練を明示的に許可するライセンスを持つモデルの出力を優先すること。そうしたモデルには多くのオープンウェイトモデルが含まれる。そして、製品が単一提供者のAPIに依存しているなら、その依存を便利さではなくリスクとして扱うこと。
シェルベリは、公人であり彼にとってのリスクが低いという点で、異例のテストケースだ。教訓は、彼が不当に扱われたとか、当然の報いを受けたということではない。蒸留に対する許容度が狭まり、消費者向けハードウェア上の個人プロジェクトが2度のBANを招くまでになったということだ。同じ技術を大規模に運用するチームは、余裕はより少ないと想定すべきであり、より多いと考えるべきではない。
関連記事
13,000枚の社内スクリーンショットが公開GitHubに流出、攻撃者の関与はなし
デフォルトの挙動がフリート全体で繰り返されるとき、それはポリシーの帰結となる。
アマゾン、自社が使い続ける80億ドル分のNvidiaチップを投資家に保有させようと画策
航空会社は何十年も航空機をリースバックしてきた。今、同じ発想がGPUに適用されようとしている。
OpenAI、推論抽出キャンペーンをMoonshot AI関係者に追跡
モデルは、自らの隠された推論のための復号オラクルと化した。
初のAI映画祭は45万ドルを支払い、ストーリーについての教訓を残した
受賞作は、すでに存在していたアイデアに奉仕するためにツールを使っていた。