OpenAIの研究ループは自ら閉じ始めている

The Informationは9月21日、OpenAIの社内AIモデルが新しい実験モデルのトレーニングパイプラインをほぼ自動化していると報じた。GPUカーネルコードの記述やトレーニングコードの最適化も含まれる。際立っていたのは、その作業がどう始まるかという点だ。研究者が追求すべき最適化の例をひとつ示すと、AIはその後数週間かけて同種の改善を自力で実装・検証する。
第二の点はさらに奇妙だった。複数の社内AIエージェントが、人間を介さずに問題に共同で取り組み始めている。かつて数年がかりのエンジニアリングを要した事例が、今では約1週間で回るという。
この記述が正確だとすれば、興味深いのはAIがカーネルコードを書けることではない。モデルはしばらく前からそれをやってきた。興味深いのはループの向きだ。AIが次のモデルを高速化するのを助け、その高速なモデルがさらに次のモデルを助けるなら、改善はユーザー向けの層にとどまらず、研究プロセスの内側で複利的に積み上がる。
コードを書くこととは何が違うのか
トレーニングループの自動化は、コーディング作業の自動化と同じではない。その違いは正確に述べておく価値がある。アプリケーションの機能を書くことには既知の目標がある。機能が動くか、動かないかだ。トレーニング実行の最適化には開かれた目標がある。システムは、モデルを劣化させずにトレーニングを高速化または低コスト化する変更を見つけねばならず、しかもほとんどの変更が状況を悪化させる探索空間の中でそれを行わねばならない。
報じられたワークフローは、難しい部分が絞り込まれたことを示唆する。人間が良い最適化の例をひとつ与え、それが問題の形を定義する。AIはその形をコードベースの他の部分へと複製する。これは本物の能力であり、同時に境界のある能力でもある。何が有望な方向かを見極めるのは、依然として人間だからだ。
その境界こそが、この主張を面白くする。既知の最適化をコードベース全体に複製するのは、今日の強いモデルができる仕事だ。誰も見つけていない最適化を発見するのは別の仕事であり、報道はそれが起きたとは主張していない。記述されているのは、トレーニングパイプラインから高度な労働の大きな一群が排除されたということであり、パイプラインが自らを改善しているのとは同じではない。両者は端で混ざり合うとしても。
マルチエージェント協調の主張は評価が難しい。人間なしで協働するエージェントは段差のある変化のように聞こえるが、人間が設計したワークフローの中でエージェント同士が構造化された出力を渡し合っているだけを意味する場合もある。どちらも報道内容と整合する。両者の差は、新しい種類の研究組織と、長い自動化スクリプトとの違いだ。
再帰的議論を正直に述べる
再帰的自己改善とは、自らを改善できる知能は自己改善が速くなるという考えで、平坦に見えた曲線がそうでなくなる。この概念は1965年にI. J. Goodが知能爆発について書いて以来存在するが、ループが壊れ続けたため、ほとんど理論にとどまってきた。コードを書くモデルは有用だ。次のモデルを生み出すプロセスを改善するモデルは、また別物だ。
報じられた状況が注目に値するのは、ループに自然な測定基準があるからだ。トレーニング効率は定量化しやすい。AI支援によるトレーニング作業が本当に数年がかりのエンジニアリングを1週間に圧縮するなら、それはOpenAIが新モデルをどれだけ頻繁に出荷するか、各モデルの計算コストがいくらかという形で現れる。本当に閉じた研究ループは観測可能なケイデンスを生み、閉じていない研究ループはプレスサイクルを生む。
それが私が適用したいテストだ。報道が真実かどうかではなく、今後12か月で同程度のコストでより速いモデルリリースが見られるかどうか。ループが閉じているなら、リリースのリズムが変わる。そうでなければ、この発表は半減期の短い、また一つの能力主張にすぎない。
なぜ主張よりもケイデンスが重要なのか
この報道の内容だけでなくタイミングに関心を持つ理由がある。フロンティアモデルのトレーニングは壁にぶつかっており、その壁はコストでできている。単一の大規模トレーニング実行は、今や電力、チップ、エンジニアリング時間を、10%の効率改善が新しいベンチマーク記録よりも価値を持つ規模で消費する。なぜならそれは、ラボが次の四半期にいくつの実験を回せるかを決めるからだ。
それは、トレーニングコードを最適化するAIの価値を変える。SF的な意味で自己改善する機械への一歩ではない。ラボが行う最も高価なことへの乗数であり、最も高価な費目への乗数こそが研究上の優位の源だ。同じ計算予算でもトレーニングループが10%速い2つのラボは、長くは同等でいられない。
そう見れば、この報道は意識についてというより資本効率についてだ。重要なループは、モデルが自らを改善することではない。モデルが次の実験のコストを下げ、それによってラボがより多くの実験を回せるようになること、つまりあらゆる技術が速くなるごく普通のやり方だ。
誰も検証できない部分
この種の報道の正直な問題は検証だ。論文もベンチマークも独立した再現もない。主張は、信じられることにあらゆるインセンティブを持ち、成果を示す義務を持たない企業の内部から来ている。だからといって虚偽ではない。外部の者が持てる確信は情報源によって上限が定まる、ということだ。
これはOpenAIに固有ではない。今やすべてのフロンティアラボが、公開評価の外側にある内部自動化について主張を行い、それを表に出す報道は、数字が検証できなくても有益な仕事をしている。パターンはよく知られている。能力が記述され、その記述はもっともらしく、証明はいつか後になって現れるか、現れないかだ。
自動化が何のためのものかという問いもある。Altmanは9月上旬のポッドキャストで、OpenAIは間違いなくヒューマノイドロボットを作ると述べ、難しいのは体ではなく脳だと語った。自らを加速する研究プロセスと、その知能を物理マシンに載せたいという野心は、同じテーゼの二つの半分だ。トレーニングループは製品ではない。次の製品を可能にするものだ。
もし本当なら何を意味するか
仮に報じられたケイデンスが本物だとしよう。直接の効果は、最適化を試すコストが下がるため、フロンティアラボが単位時間あたりより多くのアイデアを探索できることだ。それはすでに大規模な計算資源とデータを持つラボに有利であり、今日リードしているのと同じラボの集合だ。既存プレイヤーにとって複利で効く優位であり、小さなチームが追いつけるようにするものではない。
間接的な効果は研究職に及ぶ。報道が描写する仕事、カーネルを書きトレーニングコードを調整することは、まさに自動化が最初に到達する種類の、熟練しているが仕様が明確な労働だ。その仕事をしていた人々は、何を最適化する価値があるかを定義する方へ上に移る。それは報道が依然として人間に割り当てている部分だ。
その読み方は知能爆発よりも劇的ではなく、計画にはより役立つ。報じられたニュースは、OpenAIが自己改善する機械を作ったことではない。トレーニングパイプラインが、研究のうち最も仕様化しやすかった部分を静かに吸収し、判断を要する部分はそのままの場所に残したということだ。
関連記事
Instinct、10億ドルを調達し、誰も求めていないものを押し付け始める
不満は推薦があることではない。求められていないのに届いたことだ。
Cognition、4か月で売上を倍増し年間換算10億ドルペースに。それが現実かどうかが問題だ。
ランレート指標をどう解釈するにせよ、この曲線は同業他社がなし得ていないことを示している。
OpenAIは安全性を理由にGPT-6.1 Astraを中止。興味深いのは、それ以外のすべてを通過した理由だ。
あるフロンティアラボが、あらゆる商業的指標で準備が整っていたモデルを差し止めた。
NvidiaはHugging Faceに129億3,000万ドルを支払う。その買収対象は、開発者がツールを選ぶ瞬間だ
約1億5,000万ドルの収益しかない企業が、たった今129億3,000万ドルで売却された。