OpenAI 的研究迴圈開始自我閉合

《The Information》在 9 月 21 日報導,OpenAI 的內部 AI 模型已在很大程度上自動化了新實驗模型的訓練流程,包括撰寫 GPU kernel 程式碼與最佳化訓練程式碼。最引人注目的細節是這項工作如何開始。研究人員給系統一個它應該追求的最佳化範例,接著 AI 便自行花費數週實作並測試類似的改進。
第二個細節更奇怪。多個內部 AI 代理已開始在沒有人類參與迴圈的情況下,針對問題協作。報導中的例子顯示,過去需要數年工程時間的工作,現在約一週就能完成。
如果這個描述準確,有趣的部分並不是 AI 能撰寫 kernel 程式碼。模型已經能做到這件事一段時間了。有趣的部分是迴圈的方向。當 AI 協助讓下一個模型更快,而那個更快的模型又協助做出再下一個模型,改善就會在研究流程內部複利累積,而不是停留在面向使用者的層次。
為什麼這與寫程式不同
自動化訓練迴圈不同於自動化一項寫程式的任務,而這個差異值得精確說明。為應用程式撰寫一項功能有已知的目標:功能要嘛能用,要嘛不能用。最佳化一次訓練執行則有開放的目標。系統必須找到能讓訓練更快或更便宜、又不會降低模型表現的變更,而且必須在一個大多數變更都會讓事情變得更糟的搜尋空間中完成。
報導中的工作流程顯示,困難的部分已經被縮小了。人類提供一個良好的最佳化範例,藉此界定問題的輪廓。AI 再把這個輪廓複製到程式碼基底的其他部分。這是一項真實的能力,但也是一項有界的能力,因為決定什麼才算是有希望的方向的人,仍然是人類。
這個界線正是這項說法變得有趣的地方。把已知的最佳化複製到整個程式碼基底,是強大的模型今天就能做到的工作。發現一個沒有人找到過的最佳化,則是另一回事,而報導並未聲稱發生過這種事。它描述的是從訓練流程中消除一大類技術人力,這不等同於流程自我改善,即使兩者在邊緣地帶會模糊交疊。
多代理協作的說法更難評估。代理在沒有人類的情況下一起工作,聽起來像是躍進式轉變,但這也可能只是代理在人類設計的工作流程中,把結構化輸出傳遞給彼此。兩者都與報導內容一致。它們之間的差距,就是一種新型研究組織與一支冗長自動化腳本之間的差別。
誠實陳述遞迴論證
遞迴自我改善是這樣一個概念:一個能改善自己的智慧,會愈來愈快地改善自己,因而產生一條起初看似平坦、後來卻不是如此的曲線。這個概念自 I. J. Good 在 1965 年寫下智慧爆炸以來便已存在,而且大多停留在理論階段,因為迴圈一直會斷掉。一個會寫程式的模型很有用。一個能改善產出下一代模型之流程的模型,則是另一回事。
讓報導中的情況值得關注的原因,是這個迴圈有一把自然的量尺。訓練效率很容易量化。如果 AI 輔助的訓練工作真的能把長達數年的工程工作壓縮成一週,那麼這會反映在 OpenAI 多常推出新模型,以及每個模型耗費多少算力上。真正閉合的研究迴圈會產生可觀察的節奏,而未閉合的研究迴圈則只會產生一輪新聞週期。
這就是我會採用的檢驗。不是報導是否為真,而是接下來十二個月是否會以相近成本出現更快的模型發布。如果迴圈正在閉合,發布的節奏就會改變。如果沒有,這則宣布就只是另一個半衰期很短的能力宣稱。
為什麼節奏比宣稱更重要
有理由對這則報導的時機感興趣,而不只是它的內容。前沿模型訓練已經撞牆,而這道牆是由成本砌成的。如今單一次大型訓練所消耗的電力、晶片與工程時間,已達到這樣的規模:百分之十的效率提升比一項新的基準測試紀錄更有價值,因為它決定了一家實驗室下一季能負擔多少實驗。
這改變了最佳化訓練程式碼的 AI 有多大價值。它不是朝向科幻意義中能自我改善的機器邁進一步。它是對實驗室最昂貴工作的一項乘數,而對最昂貴支出項目的乘數,正是研究優勢的來源。兩家擁有相同算力預算、但訓練迴圈快百分之十的實驗室,不會長期保持平手。
從這個角度看,這則報導與其說關於意識,不如說關於資本效率。真正重要的迴圈不是模型改善自己。而是模型降低下一次實驗的成本,讓實驗室能進行更多實驗,而這正是任何技術變得更快的尋常方式。
沒有人能查證的部分
這類報導誠實的問題在於查證。沒有論文、沒有基準測試、沒有獨立複現。這項說法來自一家有充分動機被相信、卻沒有義務展示其工作的公司內部。這不會使它為假。這意味著任何局外人能抱有的信心,都受制於消息來源。
這並非 OpenAI 獨有。如今每一家前沿實驗室都會提出關於內部自動化的說法,而這些說法不受公開評估,揭露它們的報導即使數字無法查核,也正在做有用的工作。這個模式很熟悉:某項能力被描述出來,描述聽起來合理,而證據會在某個時間點出現,或不會出現。
還有一個問題是,這些自動化是為了什麼。Altman 在九月初的一集 Podcast 中表示,OpenAI 一定會打造人形機器人,而困難的部分是大腦,不是身體。一個能加速自身的研究流程,以及把那種智慧放進實體機器的雄心,是同一套論點的兩半。訓練迴圈不是產品。它是讓下一個產品成為可能的事物。
如果這一切成立,代表什麼
假設報導中的節奏是真的。直接效果是,前沿實驗室每單位時間能探索更多想法,因為測試一項最佳化的成本下降了。這有利於已經擁有規模化算力與資料的實驗室,而這正是今日領先的那一組實驗室。這是一項會為現有領導者複利累積的優勢,而不是讓較小團隊追上來的優勢。
間接效果則落在研究工作上。報導所描述的工作,也就是撰寫 kernel 與調校訓練程式碼,正是自動化最先觸及的那種技術熟練但規格明確的勞動。從事這些工作的人會向上移動,轉而界定什麼值得最佳化,而這正是報導仍指派給人類的部分。
這種解讀不像智慧爆炸那麼戲劇化,但對規劃更有用。報導中的新聞並不是 OpenAI 打造了一台能自我改善的機器。而是訓練流程已悄悄吸收了研究中最容易被明確規範的部分,並把判斷決策留在原來的地方。