前沿代理完成了 30% 的研究工作流程。這就是關鍵數字。

史丹佛(Stanford)有一個名為 Terminal-Bench-Science 0.1 的新基準測試,而最受矚目的結果,遠不如代理相關行銷通常營造得那麼令人興奮。該基準測試把 70 個由專家撰寫的研究工作流程,交到前沿代理面前。表現最好的一個完成了其中 30%。
30% 是值得記住的數字。它既不像失敗,也不像勝利。這是一項誠實的測量,說明這項技術目前所處的位置,而且是由親手撰寫這些任務的人所發布。
這個基準測試實際上測什麼
這些任務是科學工作流程,由領域專家撰寫,而代理在終端機中執行。這個選擇很重要。終端機是一個工作環境,任務在其中是真實的:你必須實際安裝相依套件、寫入檔案、執行分析,並檢查輸出。光是描述正確做法,不會得到部分分數。指令要嘛成功,要嘛失敗。
這些工作流程取自研究實務,而研究實務比附帶整齊測試套件的程式設計任務更混亂。程式設計基準測試通常有明確定義的正確答案,因此可以自動評分。研究工作往往沒有,這就是為什麼建立這類基準測試需要由專家撰寫任務,而不是從儲存庫中直接取用。
為什麼 30% 是正確的框架
基準測試往往被解讀成通過或失敗。一個在程式設計基準測試拿下 90 分的模型,會被視為幾乎已解決。一個完成 30% 研究工作流程的模型,同樣也可以被解讀成多數時候都在失敗。
這種解讀忽略了這個數字的用途。在專家親手撰寫的任務上達成 30% 完成率,意味著代理能處理研究工作中例行的那三分之一:設定環境、執行既有流程、清理資料、產出標準輸出。另外 70% 則是任務需要判斷、但工作流程沒有明確寫出來的地方,或是某個步驟以一種需要人類決定下一步怎麼做的方式出錯。
這是一個有用的區分。它告訴實驗室今天可以把代理指向哪裡,也告訴工具開發者缺口在哪裡。
終端機才是有意思的部分
在終端機中運行代理,是一項刻意選擇,要在工作實際發生的地方測試它們。研究軟體很大程度上是命令列軟體。一個只能操作聊天視窗的模型,對實驗室沒有幫助。一個能坐在 shell 前、閱讀文件、安裝工具鏈,並在建置失敗時復原的模型,屬於另一種層級的有用。
這也是失敗模式最明顯的地方。終端機不會隱藏錯誤。當指令傳回含糊的訊息,或指令碼只完成一半,代理必須決定要重試、改變做法,還是停下來。這個決策點正是 70% 大部分流失的地方,而這正是附帶乾淨測試套件的程式設計基準測試永遠不會浮現的問題。

這與程式設計基準測試有何不同
最明顯的比較對象是程式設計基準測試,它們已成為宣傳代理進展的標準方式。程式設計基準測試通常附帶一個儲存庫和一套測試套件,因此正確答案有明確定義,分數也自動產生。這讓它執行成本低廉、易於比較,也是那些數字主導討論的原因。
研究工作流程抗拒這種處理方式。通常沒有單一正確輸出,而結果品質取決於對要測量什麼、以及如何測量的判斷。這就是為什麼這裡的任務是由專家撰寫,而不是從儲存庫爬取,也是為什麼這個基準測試回報的是完成率,而不是測試通過率。
這是用涵蓋範圍換取真實性。程式設計基準測試一天可以跑上千次,並產生一個精確的數字。工作流程基準測試較慢、噪音較多,但它測試的是很大一部分技術工作實際發生的環境。兩者都有用,而其中只有一種在過去被廣泛提供。
為什麼這個數字要用這種方式衡量
完成率是一個鈍的指標,而作者刻意選擇它。一個工作流程要嘛完成,要嘛沒有完成,這是外部觀察者不需評判結果品質就能驗證的事實。優雅不計分。正確性不用爭論。代理要嘛產出工作流程要求的輸出,要嘛就在某處停了下來。
這種鈍正是重點。試圖在開放式研究任務上評分品質的基準測試,往往會崩解成基準測試作者的品味。透過評分完成率,這個基準測試用細微差異換取可重現性。兩個實驗室執行同一個工作流程會得到相同答案,這正是讓一個數字值得被引用的原因。
代價是它無法區分一個幾乎完成的代理,和一個立刻失敗的代理。兩者都算失敗。這是一項限制,未來版本可能會處理,但一個所有人都同意的粗略數字,勝過一個沒人信任的精細數字。
這個結果對科學工作說了什麼
這個基準測試是對一個大聲宣稱的安靜回答,那就是代理很快就會做研究。它顯示的是,代理能執行研究,意思是它們能在越來越多例行步驟上,執行一套人類已經想出來的程序。它們還不能做程序未知、必須有人發明的那個部分。
這個落差不是小小的工程細節。例行工作占據科學家很大一部分時間,將它自動化能節省實實在在的金錢與時數。它也不是產生發現的那個部分。對任何預測 AI 在未來幾年會對科學造成什麼影響的人來說,這個區別很重要。
如何解讀這類基準測試
任何新基準測試都適用兩項告誡。第一是版本號。這是 0.1,意味著任務集會隨著作者了解哪些任務定義良好、哪些任務模稜兩可而改變。不同版本的分數不能直接比較。
第二是,基準測試衡量的是其作者所選擇的工作流程。從科學領域抽取的 70 個任務是樣本,不是普查。30% 這個數字是代理在研究工作上能力大致樣貌的良好訊號。它不是一個能挺過下一次修訂的精確數字。
值得觀察的重點
值得觀察的進展不是頭條百分比上升。而是哪些任務開始通過。如果代理開始攻克需要多步驟復原的工作流程,那才是真正的進展。如果進展只來自較容易的環境設定和資料清理任務,那麼上限會比頭條數字所暗示的更低。
一個誠實回報低數字的基準測試,比一個回報高數字卻無人能重現的基準測試更有用。這個基準測試正在做第一件事,而這個領域需要更多這樣的做法。