機器人能完成 74% 的體力工作,但幾乎沒有一項划算

Anthropic 在 9 月 30 日發表了一份研究,把兩個數字並列在一起,而兩者之間的落差就是整篇論證的核心。
第一個數字是 74%。以目前既有的機器人來說,它們能執行美國 74% 的體力型工作任務——至少在某种環境設定下可以。這些任務占了全部工時的 34%。第二個數字是 0.3%,也就是在目前,由機器人執行比由人類執行更便宜的工作占比。

能力大致已經到位,經濟效益卻沒有。這個重新框架正是這篇論文的有用貢獻,作者是經濟學家 Russell Legate-Yang 與 Maxim Massenkoff。
這套指數是怎麼建立的
研究以 O*NET 為起點,這是美國的職業資料庫,涵蓋約 900 種職業、大約 19,000 條任務描述。Claude 先將任務分類為體力、認知與人際工作,其中標記出 7,594 項為體力型。接著它上網搜尋能執行各項任務的實際機器人,並加以評分。
評分尺度是巧妙之處,因為它依據任務所需的環境結構程度來分級。E0 代表目前沒有任何機器人能執行。E1 代表機器人可以在專門打造的空間中執行,例如組裝線。E2 代表結構化的人類工作場所,例如物流倉庫。E3 代表非結構化環境,例如城市道路。
只有已證實的能力才計入。每一項評分都必須引用實際部署、商業銷售或示範案例,而作者表示,即使剔除示範案例,結果依然成立。
這套尺度比單一的能力分數更能呈現誠實的圖像。只能在工廠車間運作的機器人,與能在公共街道上運作的機器人,對一份工作構成的威脅截然不同,而這套指數如實呈現,而不是把它們平均在一起。
那 74% 實際上落在哪裡
大多數機器人可做的工作,只有在工作場所圍繞機器人重新打造後才做得到。E1 與 E2 兩級合計占 33% 的工時,而開放世界機器人、也就是 E3 這一級,僅涵蓋 1%。
職業分布相當鮮明。駕駛完全占據主導地位。在至少有 20,000 個職缺、暴露程度最高的十種職業中,有九種是車輛操作員,這源自自駕車、卡車、拖拉機與鋪路機,其中 Waymo 被引用於計程車任務。計程車司機以 3 分中的 2.2 分高居指數首位。倉儲工作排名其後,亞馬遜具觸覺感測的 Vulcan 等機器人負責揀貨與上架,而回收分類員有超過四分之三的任務時間被評為 E2。
護理與一般維修則接近墊底。即便是受控環境,當今的機器人也幾乎做不了這類工作,這說明了照護與維修有多麼仰賴手部靈巧度,以及對情境的判讀,而非遵循一套程序。
勞動力特徵幾乎與語言模型暴露程度呈反向關係。把機器人暴露指數前五分之一的勞工與未暴露的勞工相比,他們是女性的機率低 20 個百分點,是西語裔的機率高 16 個百分點,擁有學士學位的機率低 55 個百分點,時薪約少 30 美元,而失業率是後者的兩倍以上。
四十年才到一成
成本情境正是能力數字中那股樂觀情緒用盡的地方。若機器人價格持續以每年約 3% 的速度下滑,也就是自 1990 年代以來維持的步伐,大約需要 40 年,機器人才能在 10% 的人類工作上具備成本競爭力。另一個基準情境則認為,機器人在半數體力工作上勝過人類成本的時間點會落在 2085 年。
另有一個快速情境,主張在 2050 年前就能對今日半數的體力工作達到成本競爭力,但它假設成本下滑速度最高快上四倍、能力提升速度也快上一倍。作者明確指出,這些都是模型推演的結果,並非關於工作何時消失的預測。
這份研究也把機器人指數接上既有的語言模型暴露研究。單是 LLM 就暴露了約半數的工作。若再加上任何能在 E1 或更高層級執行任務的機器人,這個比例會升到 81%。運輸與搬運從不到 15% 的暴露程度升到約 90%。辦公室與行政支援則趨近於全面暴露,因為聊天機器人處理不了的輕度體力任務,到頭來竟是機器人形狀的任務。
有一點方法論上的提醒值得記住。把任務層級的成本估計合併成整份職業,可能會重複計算同一台機器人,或忽略同時運作多台機器人的協調成本。作者自己也點出了這一點,這意味著總體數字是方向性的,而非精確的。
為什麼環境尺度才是正確的軸線
大多數自動化預測把能力當成單一旋鈕。這份研究的四級尺度取而代之,更貼近部署實際運作的方式,也就是機器人需要周遭有多少秩序。
這個區別解釋了為什麼數字會長成這樣。倉庫是結構化的人類工作場所,所以機器人可以直接投入其中一項任務,不必改建整棟建築。城市街道則不然,機器人必須處理一個人會做的所有事,包括那些沒有人寫下來的部分。E2 與 E3 之間的落差,就是 33% 與 1% 工時差異的所在。
這也解釋了為什麼機器人難以勝任某些從外表看來很簡單的工作。一般維修涉及一連串針對機器人從未見過的情境所做的小判斷,這會把它推向 E0,即使每一個單獨動作都完全在能力範圍內。稀缺的不只是手部靈巧度,而是在一個不是為你設計的世界裡運作的能力。
研究自身的但書何時重要
閱讀這些頭條數字時,有兩項限制值得放在心上。把任務層級的成本合併成整份職業,可能會重複計算同一台機器人,或忽略同時運作多台機器人的協調成本,而作者也直言不諱。這使得總體數字是方向性的,而非精確的。
第二點是,能力評分依賴有紀錄的部署、銷售與示範。這比研究論文更嚴格,卻比已出貨的產品更寬鬆。一台只被示範過一次的機器人,就算作能執行某項任務,任何看過示範在真實設施中失敗的人,都會覺得這過於樂觀。
這兩項但書都不改變研究發現的輪廓,但都限制了單一數字應該承載多少分量。
這些數字真正想說的是什麼
人們很容易把 74% 讀成威脅,把 0.3% 讀成緩刑。這兩種讀法都錯過了最有趣的部分,也就是兩者之間的關係。
一項 50 年的回測支持了這套方法:1977 年暴露於機器人程度較高的職業,在往後的數十年確實出現較大的薪資與就業下滑。暴露程度預示著壓力,終究會來。它無法預示的是速度,而定義速度的是成本曲線。
這份研究自己的框架才是值得保留的。自動化的論辯通常圍繞能力打轉,彷彿唯一的問題是機器能不能做這份工作。這篇論文把它翻轉過來:能力大致已經具備,價格還沒到位,而四十年才到一成,並不是一個足以正當化恐慌或自滿的預測。它描述的是一筆還沒到期的帳單。