瓶頸不再是模型,而是工作流程中缺失的狀態

--- title: 瓶頸不再是模型,而是工作流程中缺失的狀態 slug: the-bottleneck-is-no-longer-the-model-but-the-missing-workflow-state meta_title: 為何長時程代理需要工作流程狀態 meta_description: Zeroset 為 Nebula 籌得 520 萬美元;Nebula 是一個狀態層,讓代理能查詢企業實際上如何安排核准與交接。 category: ai tags: Zeroset,Nebula,代理記憶,工作流程狀態,Gradient Ventures,長時程代理,企業 AI,流程探勘,LongMemEval,context ---
520 萬美元的種子前輪融資並不是大數目。但附帶在 Zeroset 這筆融資上的主張,比支票本身更值得注意:阻礙企業代理的不是模型能力,而是缺乏一套狀態系統。
Akshat Kannan 在 18 歲離開史丹佛。William Zhang 在 21 歲離開德州大學。他們在 2026 年 1 月創立 Zeroset,源於一個狹窄的觀察。前沿模型已能處理電子郵件草稿和航班搜尋。但當任務需要知道特定公司如何安排核准、例外與交接時,它們就會卡住。
10 月 6 日,Gradient Ventures 與 2048 Ventures 共同領投 520 萬美元種子前輪融資,Leblon Capital 參與其中。這家公司有五個人,且目前仍僅開放封閉研究預覽。
Nebula 儲存什麼
Nebula 會連接到工作流程原本已在使用的系統:Microsoft 365、SharePoint、Outlook、Teams、GitHub 以及職場通訊軟體。它不會把每份文件視為孤立的向量。它建立一個具三層結構的階層式向量圖:語意事實、情節事件叢集與程序習慣。

它與記憶儲存庫的差異,在於代理取回的是什麼。它不會重建歷史,而是查詢工作流程的當前狀態。該公司將回傳結果描述為具型別、可查詢且帶有來源脈絡的狀態:什麼是真的、何時變成真的,以及系統為何相信它。
這些基準測試還處於早期,但很具體。在 LongMemEval 上,Nebula 的準確率比 Mem0、Supermemory 和樸素 RAG 高出 20%,中位數低於 50 毫秒,且每次查詢使用的 token 更少。在 BPI Challenge 流程探勘資料集上,它在下一活動預測方面以超過 10% 的幅度擊敗所有已記錄的基準,這比檢索更難,因為它問的是系統能否預測下一個合法步驟。
token 數量與準確率同樣重要。每次查詢使用更少 token,代表更小的上下文視窗就能承載相同資訊,進而降低代理每一輪的成本。對於為期一週的工作流程,這種差異會像錯誤一樣層層疊加。
創辦人最初的觀察,是對這個問題最精煉的陳述。前沿模型能處理電子郵件草稿和航班搜尋。但當任務需要知道特定公司如何安排核准、例外與交接時,它們就會卡住。在那種情境下,模型本身沒有任何問題。資訊只是不在提示中,也無法從公開語料庫檢索到。
整合介面才是真正的護城河
連接到 Microsoft 365、SharePoint、Outlook、Teams、GitHub 與職場通訊軟體是枯燥無趣的工作,也是最難複製的部分。競爭對手可以在一季內複製三層圖設計。但要重現那些權限感知連接器——讓狀態層與每位使用者被允許看到的內容保持一致——則需要長得多的時間,而企業買家會最先評估這一點。
權限是大多數記憶產品處理得很糟的部分。工作流程狀態層必須尊重與底層系統相同的存取邊界,因此代理為某位使用者行動時,不能揭露只有在組織另一層級才可見的事實。弄錯這一點,與其說會產生錯誤答案,不如說會引發合規事件。
這也解釋了為何該公司推出的是封閉研究預覽,而非自助式產品。狀態層的表現取決於它見過的工作流程,而每一次新的客戶整合,都會浮現沒有任何基準測試涵蓋的流程邏輯邊緣案例。
買家在採用前該問什麼
有三個問題可以區分有用的狀態層與展示品。系統是否記錄每項事實何時變成真,並且能否讓已被取代的事實失效?它能否解釋自己為何相信某件事,並一路追溯到來源事件?它是否強制執行與其讀取來源系統相同的權限?
來源脈絡要求通常是最容易被含糊帶過的一項。一個回傳事實卻不帶出處的狀態層,功能上就是快取;而自主代理中的過時快取,比完全沒有記憶更糟,因為代理會自信地據此行動。
持續性是第二層次的問題。跨越數天或數週的連續狀態正是整個價值主張,而儲存那麼多衍生自組織的知識,會引發關於保留、刪除與區域駐留的資料治理討論。
為何過時狀態會不斷疊加
該公司指出的失效模式,正是這個類別存在的原因。過時的事實或矛盾的指令不會只造成單一錯誤。它會成為下一輪的起始狀態,產生不斷疊加的重工、額外的工具呼叫與人工介入。
真正讓它昂貴的是疊加效果。單一錯誤行動還可回復。但一個錯誤假設若持續存在於二十個步驟的流程中,會汙染其後的每一步;等到有人注意到時,工作必須從較早的檢查點重做。無人看管運行數小時的代理會讓情況更糟,因為沒有人正在觀察偏離。
對話式記憶系統會擷取相似的區塊。如果被擷取的事實已是三週前,而工作流程早已向前推進,代理就會從一個已不存在的世界進行推理,而回應中沒有任何地方標示這個落差。檢索相似度與事實時效性是兩種不同的屬性,而向量儲存庫最佳化的是前者。
Nebula 的三層圖試圖讓代理有辦法區分兩者。語意事實描述什麼是真的。情節事件叢集描述發生了什麼。程序習慣描述組織通常如何做事。來源脈絡則是讓它可稽核的部分:該事實、它何時變成真,以及系統為何相信它。
這適合放在哪裡
Mem0 與 Zep 屬於相鄰的記憶基礎設施類別。Zeroset 的賭注是:長時程企業代理需要的是流程狀態,而不是對話記憶;這個區別對任何跨越數天或數週、橫跨系統邊界的事務都很重要:理賠處理、發布核准、多步驟採購。
這些流程共享一種結構。它們涉及人員與系統之間的交接、遵循不成文規則的例外,以及取決於誰有空處理的核准。這些都不存在於文件裡。它們存在於實務中,這也是為什麼一直難以呈現。
流程探勘是最接近的先前技術,而 Zeroset 以流程探勘資料集作為基準,這一點很能說明問題。該領域花了二十年從事件日誌重建工作實際上如何流動。即時做同樣的事,讓代理能在任務進行中查詢,是合理的演進。
Gradient 發表的論點也提出相同主張。消費級代理之所以成功,是因為它們在公開網頁上訓練。企業代理仍缺乏對工作如何在私人組織內部實際流動的呈現。
如果成功,會有什麼改變
兩件事。代理執行框架不再推出越來越大的上下文視窗來彌補缺失的結構,因為問題從來不是視窗大小。企業也能把自己工作流程的營運模式保留在自己的邊界內,而不是指望通用模型總有一天會推斷出來。
第二個後果更具策略意義。存在於公司邊界內的工作流程呈現,是公司擁有的資產。由通用模型推斷出來的,則是公司租用的能力。對受監管產業而言,這個差異決定代理究竟能不能部署。
有一個值得點名的競爭風險。如果大型平台供應商決定把流程狀態納入其套件,一家五人的新創公司無論狀態層多好,都會面臨通路問題。Gradient 的參與有幫助,但通路不是一輪 520 萬美元融資能解決的事。
今天的數字很小:五個人、兩項公開基準測試、一個封閉預覽。但這個主張更大,而且可以檢驗。如果企業自動化已走過能力階段,下一輪競爭將是誰真正知道工作實際上是什麼。