← 返回部落格
Ai預計閱讀 10 分鐘

子代理經濟:為何便宜模型才是代理的真正故事

發布於 2026年10月10日
子代理經濟:為何便宜模型才是代理的真正故事

十月初最具影響力的 AI 發布,是最便宜的那一個。10 月 7 日,Anthropic 推出 Claude Haiku 5.5,並表示其平均執行成本比前一代 Haiku 低約 75%。對於低於 100,000 個 token 的請求,API 價格下降約 90%,來到每百萬輸入 token 十美分、每百萬輸出 token 五十美分。Anthropic 也將 Sonnet 5.5 的快取讀取價格砍半。

便宜模型很容易被輕視。它們看起來像是定價策略,而不是能力突破。但這次發布中有趣的細節不是價格,而是 Haiku 5.5 的用途。

小型模型長大了

過去對小型模型的批評是:它們只適合簡單任務,遇到真實工作就沒用。這個落差已經迅速縮小。在 Terminal-Bench 程式開發評測中,Haiku 4.5 得分為零,Haiku 5.5 則拿下 39.2%。在測試透過介面操作電腦的 OSWorld 上,它從 15.7% 進步到 72.4%,領先同級 GPT-6 Luna 的 48.9%。

Anthropic 也讓 Haiku 成為該系列中第一個具備可調推理強度(reasoning effort)的模型,提供從低到最高的五個等級。這讓開發者能把運算資源花在有用的地方,並在不需要時略過,這是一項小功能,卻對持續執行某項工作的成本有很大的影響。

一個明亮的規劃節點分支成許多小型執行節點

子代理的定位框架

這次發布值得畫重點的部分是定位。Anthropic 表示,Haiku 5.5 可以作為更大模型 Opus 5.5 與 Sonnet 5.5 的子代理。用白話說,旗艦模型負責規劃與決策,Haiku 負責實際動手:整理文件、操作電腦、處理資料。

這是真正的架構轉變,也重新定義了成本討論。重點不只是每次呼叫更便宜,而是一次昂貴的規劃呼叫現在可以擴散成許多便宜的執行呼叫。以往每一步都得動用同一個旗艦模型的代理,現在可以只在困難部分使用旗艦模型,其餘全交給 Haiku。帳單下降的幅度可能超過每 token 折扣所暗示的程度,因為你改變的是昂貴呼叫到底會發生多少次。

Anthropic 的競爭對手也從不同角度朝同樣的形態靠攏。Google 於 10 月 1 日推出的 Gemini 4 Argon 鎖定程式開發、研究、金融與法律工作,並支援最高一百萬 token 的輸出,以應付大型審閱。OpenAI 的中階模型則持續降價以守住地盤。發布訊息各有不同,但底層押注一致:工作不是由一個模型回答一個問題,而是由許多呼叫編排而成,而編排者需要便宜的幫手。

為何瓶頸轉移了

有一個數字說明了急迫性。追蹤這個領域的分析師估計,2026 年全球每日活躍代理約為 7,900 萬個,高於前一年的約 2,900 萬個,並預測到 2030 年將達到數十億個。無論確切數字為何,方向很清楚。代理正從展示階段走向正式生產,而阻止生產級代理上線的原因,很少是模型太笨,而是把它跑夠多次的成本太高。

這就是為什麼業界開始談論編排層(orchestration layer):這個元件會把請求拆解成步驟,將每個步驟路由到合適的模型,再組裝結果。當基礎模型變得更便宜,這一層會變得更有價值,而不是更沒價值,因為正是它決定便宜模型該用在哪裡。

代理鏈實際上如何拆分工作

關於子代理的抽象討論,用一個具體任務來說明會更清楚。假設你請一個代理研究某個市場並產出一份簡報。旗艦模型會讀取請求、決定要尋找什麼,並規劃步驟。接著由小型模型做苦工:造訪頁面、擷取數字、重新格式化表格、去除重複來源,並檢查每項主張是否都有引用。最後旗艦模型再回來撰寫綜合分析,並判斷草稿是否夠好。頭尾各一次昂貴呼叫,中間則是許多便宜呼叫。

這種模式會在不同任務中反覆出現。任何量大且低模糊性的工作,都是便宜模型的候選:填寫表單、讀取日誌、分類客服工單、檢查文件是否符合範本。任何需要判斷下一步該做什麼的工作,則留給旗艦模型。這條界線並非固定不變,而目前有趣的工程工作,就是針對每個工作流程決定界線該畫在哪裡。

Anthropic 的可調推理強度正好派上用場。需要輕量處理的任務可以用低強度執行,需要更謹慎的任務則可以調高,而不必切換模型。實務上,這意味著同一個便宜模型既能處理快速分類,也能進行仔細審閱,進而減少團隊必須管理的變動元件數量。

降價對產品帶來什麼改變

更便宜的執行成本會改變哪些產品值得打造。當每次執行都要花真金白銀時,對每則傳入訊息都執行一次代理的功能根本不合理;但當每次執行只花不到一美分,就說得通了。結果是一波功能浪潮:這些功能在技術上早已可行一年,卻直到現在才在經濟上成立,例如全天候監控、逐項資料擴充,以及會逐一檢查每份產出物而非只抽樣的背景審查器。

這裡面有個陷阱,而且很容易掉進去。當執行變便宜,團隊就不再衡量它。一個每天跑一千次便宜呼叫的工作流程,從每次呼叫來看似乎無害,但一旦把重試、失敗,以及升級到昂貴模型的情況算進去,仍可能累積成驚人的月帳單。真正重要的數字是完成一項任務的成本,而不是單次呼叫的成本。

小型模型的基準測試問題

小型模型在基準測試上越來越好,而基準測試正是最容易過度解讀進步的地方。操作電腦測試上的亮眼分數,只代表模型能遵循已知的介面操作步驟,卻幾乎不能說明它是否知道何時該停下來、何時該求助,或何時任務已經悄悄出錯。這些行為正是便宜代理在生產環境中失敗的地方,而且很難評分。

實際的防禦做法並不光鮮。給便宜子代理一個範圍狹窄的工作、清楚的完成定義,以及一條升級求助而非自行猜測的路徑。接著先觀察它在邊緣案例上的表現一週,再把它用在任何重要的事情上。一個知道自己任務界限的便宜模型,比一個會即興發揮的聰明模型更有用。

誠實的注意事項

一個自信但錯誤的便宜模型,比昂貴模型更糟,而代理鏈會放大這種風險。每一個額外步驟,都是錯誤進入並傳播的地方。每 token 價格完全無法說明便宜模型是否會像真人一樣處理含糊的指令。

此外,還有一個尚未補上的治理缺口。NIST 與 CISA 在九月底發布的指引,將代理視為低信任度的非人類身分,並呼籲採用短效憑證、維護清冊,以及對較高風險的行動進行人工核准。多數組織既沒有這些清冊,也沒有核准流程。便宜的執行成本讓人更容易運行大量代理,也更難知道到底有多少代理正在運行。

如果你要打造產品,這代表什麼

現在該養成的實用習慣,是不要再預設選用最大的模型。把任務拆成規劃與執行,將旗艦模型用在需要判斷的地方,其餘則路由到小型模型。衡量整條代理鏈,而不是單次呼叫。

Haiku 5.5 之所以是重點,不是因為它便宜,而是因為便宜層級終於好到足以承擔代理中過去需要昂貴模型負責的部分。

相關文章