Salesforce 為其代理打造了可持續運行數週的執行環境

Salesforce 於 10 月 5 日在杜拜與利雅德發表全新的 Agentforce 代理組合,而多數報導都聚焦在這份名單上。Casey 負責跨語音、簡訊、WhatsApp 與網頁聊天的客戶服務。Paige 處理 IT 與人資需求。Carter 協助購物者在對話中比較商品並完成結帳。Piper 篩選潛在客戶名單。Marshall 統籌後勤流程並保留稽核紀錄。Fin 執行複雜的客戶體驗工作流程。Hunter 則負責從研究到接觸的對外銷售。
這份名單其實是整件事裡最無趣的部分。真正在其底下運作的,是一套全新的長時程執行環境,讓代理能跨越數天甚至數週持續追求一個目標,而不是在一次互動結束時就停下。
這與企業 AI 過去所販售的產品,屬於完全不同的產品類別。
回答與完成之間的差別
對話式助理解決一個問題後就結束它這一輪。在長時程執行環境上運作的代理,會接收一項指示,把它轉化為可衡量的目標,建立計畫,然後朝目標推進,同時判斷該完成哪些任務、需要哪些工具,以及何處必須停下來等待人工介入。
Salesforce 舉的例子是:業務人員要求 Hunter 在本季結束前搶救有流失風險的交易。Hunter 會將其轉換成一份計畫並開始執行,並在預先定義的節點停下來等待業務人員核准。

有三項機制讓這件事成為可能。記憶(Memory)可跨工作階段保留脈絡與進度,因此代理在週一接手工作時,知道自己在週五做了什麼。持久執行(Durable execution)讓計畫持續運行,並讓代理在情況改變時得以接續或調整。動態導引(Dynamic steering)則依據個別使用者的回饋調整行為。
第三項正是設計開始變得有趣的地方。一個運行數週的代理會累積大量決策,而其中多數都會在小地方出錯。如果唯一的回饋管道是一種會重設計畫的修正,那這個代理就稱不上持久。導引意味著代理是在運行途中調整行為,而不是重新開始。
治理問題浮上檯面
代理在無人看管下運行的時間越長,問責的問題就越重要。
Salesforce 的答案分成兩層。凡是需要核准或判斷的地方,人類都會持續參與,這是傳統的護欄。而在其底下,一套用於描述代理行為的開源語言 Agent Script,讓企業能把 AI 推理與確定性規則結合起來。重點在於對代理如何做出決策擁有細緻的控制權,如此一來,必須遵循政策的部分就能以政策的形式撰寫,而非靠學習得來。
一切都在客戶既有的權限與業務規則內運作,而每個代理都帶著公司賦予它的名字。其論述框架是「代理成為品牌的延伸」,這是一種行銷說法,實際上卻在承擔合規的工作。
稽核紀錄在這裡也很重要。Marshall 被描述為能為每一個動作提供紀錄。對於一個橫跨數週、觸及多個系統的流程而言,稽核軌跡是人工監督者在不重播整個執行過程的情況下,唯一能檢視發生了什麼事的方式。
Salesforce 所指向的證據
該公司報告指出,Agentforce 與 Slack 合計已累積超過 70 億個代理工作單元,其中 32 億出現在最近一季。它點名了幾個具體客戶:Perk,其 60% 的銷售機會來源現在由其對外代理建立;Autism Queensland,其 70% 的行政需求由 Paige 解決;以及 Hibbett AI,六週內即上線,如今處理 90% 的核心購物歷程。
Hibbett 是值得細細琢磨的那個數字。一個零售部署能在六週內達到 90% 的購物歷程覆蓋率,談的是配置速度,而配置速度正是企業代理專案歷來折損之處。它們大多卡在整合,而非能力。
這些被點名的客戶也是刻意挑選的,用來對買方傳達某種訊息。銷售機會生成指標是說給業務主管聽的。行政需求指標則是說給公部門或醫療保健買方聽的。這些案例研究本身就是市場區隔。
與記錄系統相連,這才是真正的護城河
這些代理是對接 Customer 360 運作的,這意味著它們運作時所使用的是企業原本就已存在於 Salesforce 內的客戶脈絡、資料與業務流程。
這是一種偽裝成技術細節的通路優勢。競爭對手可以打造一個能進行對外研究的代理。但要打造一個已經知道客戶往來紀錄、未結商機與支援工單的代理,則是另一回事,而這對沒有底層紀錄的供應商來說是做不到的。
取捨之處是大家熟悉的那一套。貼近記錄系統所帶來的任何好處,都伴隨著對它的依賴,而一家把銷售代理跑在 Agentforce 上的公司,等於讓自己的 CRM 選擇變得更難回頭。
這與其他常時運作的代理有何不同
Salesforce 並不是唯一一家推出無需提示即可運作之代理的公司。
OpenAI 的 Dots 會在使用者定義的目標下持續於背景運作,連接數千個應用程式,每個代理都跑在自己專屬的私有雲電腦上。Meta 的 Muse 代理也採取類似立場。共同的理念是:代理是持有一個目標,而不是回答一個問題。
Salesforce 版本的差異在於起點介面。Dots 從一個目標與一組已連接的應用程式開始。Agentforce 則從一筆客戶紀錄、一個案件、一筆商機或一張訂單開始,因為它綁定在 Customer 360 上。這縮小了代理能處理的範圍,卻加深了它對該範圍的了解。
對企業而言,窄版的往往更實用。一個什麼都能碰的通用代理,比一個在公司原本就已治理的系統內運作的特定代理更難被授權。權限模型是繼承來的,而不是重新發明的。
持久性底下的定價問題
一個把計畫保持開啟長達一個月的代理,其花錢的方式是請求—回應模型所沒有的。
計畫狀態的儲存空間、跨工作階段的記憶、針對一個應該在需要核准時發出警示的代理所做的監控,以及模型呼叫本身,全都會累積在一個可能產生結果、也可能不產生結果的工作流程上。對話式助理的成本是以每次往來計價。常時運作代理的成本則是以時間單位與工作單位計價。這兩個數字對不起來,這也正是為什麼被點名的客戶比功能清單更重要。Perk、Autism Queensland 與 Hibbett 所描述的成果,都是財務團隊已經可以定價的:生成的銷售機會、解決的行政需求、處理的購物歷程。一個取代已知成本的代理很容易被合理化。一個創造出全新成本類別的代理則不然。
值得觀察的重點
有三件事將決定這套長時程執行環境究竟是一項產品,還是一場展示。
第一是長時間運行下的失敗行為。一個在兩個月間逐漸偏離的計畫,比一個在工作階段內就失敗的計畫更難診斷,而 Salesforce 並未說明當代理持續追求一個它早在數週前就該放棄的目標時會發生什麼事。
第二是 Agent Script 是否會在 Salesforce 之外被採用。一套用於代理行為的開源語言,只對留在該平台上的客戶有用。如果它能移植,就會成為標準。如果不能,它就只是一種設定格式。
第三是持久性的價格。一個把計畫保持開啟一個月的代理會消耗儲存、記憶與監控資源,而這些都不會出現在以 token 計價的比較中。常時運作代理的單位經濟效益,並不等同於請求—回應模型的單位經濟效益,而 Salesforce 並未公布它究竟是按哪一種收費。
該公司採用的論述框架——這些代理是被它們完成的工作所評價,而不是被它們回答的問題所評價——設下了比業界過去所被要求更高的標準。這也讓衡量變得簡單:那些有流失風險的交易,要嘛成交了,要嘛沒有。