← 返回部落格
Ai預計閱讀 9 分鐘

ServiceNow 將代理失敗轉化為訓練資料

發布於 2026年10月4日
ServiceNow 將代理失敗轉化為訓練資料

每個曾把 AI 代理部署到真實企業系統的團隊,都懂同樣的痛。模型本身能力廣泛,但一遇上你們特定的工具、特定的政策,以及你們那套一團亂的狀態機,它就開始跌跌撞撞。

ServiceNow 的研究部門 CoreAI 發布了一套系統,試圖把這些失足轉化為資產。這套系統叫做 AutoSynthData,其前提是:模型的失敗,是你用來訓練它最有價值的原料。

核心做法

這條流程一開始,會讓目標模型與更強的教師模型,在同一個真實環境中執行相同的診斷任務。當目標模型失敗、教師模型成功時,就代表存在能力落差。AutoSynthData 會把這個落差濃縮成團隊所稱的「能力規格卡」:經過清洗的工具、工作流程、最終狀態與允許變異的描述,並移除原始評估提示與實體細節。

這些卡片會用來孕育新任務的生成。關鍵在於,生成器從未看過原始的評估軌跡,因此產出的資料測試的是底層能力,而不是背下來的序列。這個框架以兩個階段擴展。目標階段會平行建立核心任務。倍增階段則拿已驗證的任務,衍生出帶有新措辭、新實體配置與新初始狀態的變體。有一條規則防止資料漂移:倍增出來的樣本,永遠不能再成為下一次倍增的種子。

值得生成的任務必須滿足三項條件

ServiceNow 明確表示,一個看起來合理的請求並不足夠。生成的任務必須同時滿足三件事。

它必須可行,意思是環境中至少存在一條可執行路徑,能在遵守規則的前提下完成請求。它必須逼真,意思是它反映真實使用者確實會提出的工作,而不是技術上有效卻沒人會採取的動作。它還必須困難,意思是它針對的是真正的弱點。微不足道的任務教不了東西,不可能的任務則會教錯教訓。

每項任務都附帶一個驗證器,而驗證器也必須達到自己的標準。它必須與提示和系統狀態一致,健全到能拒絕違反限制條件的結果,並且完整到能接受任何可行的解法,而不是堅持只認某一條參考路徑。

品質關卡才是真正的產品

這其中真正值得注意的部分,不是任務生成,而是檢查。

每個候選項目都會通過兩道關卡。正向關卡會在環境中執行參考解法,確認預期答案確實能滿足驗證器,藉此捕捉提示、初始狀態與成功條件之間的不一致。負向關卡則會刻意變更最終狀態,確認錯誤結果確實會遭到拒絕。第二道關卡正是用來抓出規格不足的驗證器,也就是那種會欣然獎勵畸形代理軌跡的驗證器。

當候選項目失敗時,會由一個評論器診斷問題所在,找出損壞的參照或互相矛盾的狀態,並引導進行有界修復,而不是直接丟棄整個成果。在樣本層級之上,批次審查會觀察整體狀況:哪些任務叢集佔比過高、哪些面向缺失、哪些生成模式不斷卡住。接著控制器會把下一批引導向仍然存在的缺口。

為什麼我們終究需要合成資料

值得退一步問:這為什麼重要?企業代理的理想訓練資料,是真人在真實系統中做真實工作的紀錄,而且標註正確。這種資料稀少、敏感,蒐集成本高昂,而且其中許多因為隱私或合規原因,根本無法離開公司。

合成生成是一道逃生門,但它伴隨一個已知的失效模式。如果你用模型來生成任務,就會承襲那個模型的盲點,產出的資料可能看似充足,實際上卻教不了多少東西。AutoSynthData 的整體貢獻,在於圍繞生成機制的那套機器,讓資料保持誠實:拒絕壞任務的關卡、防止重複的多樣性檢查,以及持續瞄準代理尚未掌握的內容的課程設計。沒有驗證的生成是雜訊。這是一次嘗試,要讓它變成訊號。

數字說了什麼,以及沒說什麼

在 EnterpriseOps Gym(一個針對企業代理任務的開源環境)的測試中,一個以 Gemma 為基礎、用 2,000 個 AutoSynthData 樣本微調的模型,在混合領域中相對於基準把 Pass@1 指標提升了 35%。在 ITSM 領域,合成監督式微調把平均 Pass@1 從 18.77% 提升到 27.18%。

這些是在特定基準上的真實增益,但並不等同於一般性結果。這條流程的核心依賴很誠實,也值得直說:它需要一個明顯更強的教師模型來示範正確行為,以及一個準確的模擬環境來測試。在一家沒有高保真沙盒與可靠確定性驗證器的公司裡,建置執行層本身就是一項嚴肅的工程專案。AutoSynthData 並沒有移除這些工作。它改變的是這些工作的目的。

教師模型的陷阱

這個設計裡有一個依賴關係,值得用一句話特別點出。整條流程都建立在弱模型與強模型之間的落差上。在實驗中,教師模型比目標模型大得多。當你有前沿系統可以借用時,這行得通。但當你自己就是前沿,或任務高度專門到根本沒有更強的模型能示範時,就行不太通。在這種情況下,流程沒有東西可學,而它所依賴的能力落差就只是一道牆。生成訓練資料的研究,最終總會碰上這一點:只要某地某人已經解決了問題,這個方法就能擴展。

為什麼這正是企業 AI 的樣貌

這次發布有趣的地方,在於它承認了企業 AI 實際上所處的位置。瓶頸不再是取得一個有能力的模型。瓶頸在於讓一個有能力的模型,在特定組織內、使用其特定工具與規則正確運作,而那裡失敗很細微,狀態空間又很大。

多年來,答案一直是人工標註,這種做法緩慢、昂貴且難以規模化。AutoSynthData 主張,失敗本身就含有訊號,只要你能擷取、驗證並多樣化這些失敗,同時不洩漏評估集。這條流程已在 Hugging Face 上開放供研究使用,團隊表示下一步是採用相同方法論的強化學習。

如果這套方法能廣泛奏效,意味著企業 AI 的稀缺技能會轉移。它不再關於取得資料,而是關於建構出夠好的環境,以便在其中生成值得信賴的資料。這是更難的問題,也是更持久的問題,因為公司的環境正是競爭對手無法複製的東西。

相關文章