瓶颈已不再是模型,而是工作流中缺失的状态

--- title: 瓶颈已不再是模型,而是工作流中缺失的状态 slug: the-bottleneck-is-no-longer-the-model-but-the-missing-workflow-state meta_title: 为什么长时程智能体需要工作流状态 meta_description: Zeroset 为 Nebula 融资 520 万美元,这是一个状态层,让智能体能够查询公司实际如何安排审批和交接。 category: ai tags: Zeroset,Nebula,智能体记忆,工作流状态,Gradient Ventures,长时程智能体,企业 AI,流程挖掘,LongMemEval,上下文 ---
520 万美元的种子前轮融资并不是一个大数目。Zeroset 所附带的论断比这张支票更值得关注:阻碍企业级智能体的并不是模型能力,而是状态系统的缺失。
Akshat Kannan 18 岁离开斯坦福。William Zhang 21 岁离开得克萨斯大学。他们于 2026 年 1 月创立了 Zeroset,基于一个狭窄的观察。前沿模型已经能处理邮件草稿和航班搜索。当任务需要知道某家具体公司如何安排审批、例外和交接时,它们就会卡住。
10 月 6 日,Gradient Ventures 和 2048 Ventures 共同领投了 520 万美元的种子前轮融资,Leblon Capital 参投。公司有五个人,访问权限仍处于封闭研究预览阶段。
Nebula 存储什么
Nebula 连接到工作流已经在使用的系统:Microsoft 365、SharePoint、Outlook、Teams、GitHub 和工作场所消息工具。它不会把每份文档当作孤立的向量。它构建一个具有三层的分层向量图:语义事实、情景事件簇和程序性习惯。

与记忆存储的区别在于智能体取回的是什么。它不是重建历史,而是查询工作流的当前状态。公司将其返回描述为带有溯源信息的类型化、可查询状态:什么是真的、它何时变为真,以及系统为什么相信它。
基准测试尚属早期,但很具体。在 LongMemEval 上,Nebula 的准确率比 Mem0、Supermemory 和朴素 RAG 高出 20%,中位数延迟低于 50 毫秒,且每次查询使用的 token 更少。在 BPI Challenge 流程挖掘数据集上,它在下一活动预测上以超过 10% 的优势击败所有已记录的基线,这比检索更难,因为它要求系统能否预判下一个合法步骤。
token 数量与准确率同样重要。每次查询更少的 token 意味着更小的上下文窗口可以携带相同信息,从而降低每个智能体轮次的成本。对于一个运行一周的工作流,这种差异会像错误一样复利累积。
创始人的最初观察是对这个问题最精炼的陈述。前沿模型能处理邮件草稿和航班搜索。当任务需要知道某家具体公司如何安排审批、例外和交接时,它们就会卡住。在这种场景下,模型本身没有任何问题。信息只是不在提示词中,也无法从公共语料库中检索到。
集成面才是真正的护城河
连接 Microsoft 365、SharePoint、Outlook、Teams、GitHub 和工作场所消息工具是乏味的工作,也是最难复制的部分。竞争对手可以在一季度内复制三层图设计。而要复现那些权限感知连接器——让状态层与每个用户被允许看到的内容保持一致——则需要长得多的时间,而企业买家首先评估的正是这一点。
权限是大多数记忆产品处理得很糟糕的部分。工作流状态层必须尊重与底层系统相同的访问边界,因此代表一个用户行动的智能体不能暴露出只有在组织另一层级才可见的事实。做错这一点,与其说会产生错误答案,不如说会引发合规事件。
这也解释了为什么公司运行的是封闭研究预览,而不是自助服务产品。状态层的好坏取决于它见过的工作流,而每一个新客户集成都会暴露出路由逻辑中没有任何基准覆盖的边缘情况。
买家在采用前应该问什么
三个问题可以区分有用的状态层和演示。系统是否记录每个事实何时变为真,并且能否使已被取代的事实失效?它能否解释自己为什么相信某件事,并追溯到源事件?它是否强制执行与其读取系统相同的权限?
溯源要求往往是回答得最含糊的一个。一个不返回来源信息的状态层在功能上就是一个缓存,而自主智能体中的陈旧缓存比完全没有记忆更糟糕,因为智能体会自信地据此行动。
持久性是二阶问题。跨天或跨周的连续状态是全部价值主张,而存储如此多衍生组织知识会引发关于保留、删除和区域驻留的数据治理讨论。
为什么陈旧状态会累积恶化
公司指出的失败模式正是这个类别存在的原因。一个陈旧事实或矛盾指令不会只造成一次错误。它会成为下一轮的起始状态,产生不断累积的返工、额外工具调用和人工干预。
这种累积正是它代价高昂的原因。单个错误操作是可以恢复的。一个错误假设如果贯穿二十步流程,就会污染其后的每一步,而等到有人注意到时,工作必须从更早的检查点重新开始。无人值守运行数小时的智能体会让情况更糟,因为没人在盯着这种漂移。
对话式记忆系统检索相似的片段。如果检索到的事实已是三周前的,而工作流已经向前推进,智能体就会基于一个不再存在的世界进行推理,而响应中没有任何东西标记出这种差异。检索相似性和事实时效性是不同的属性,而向量存储优化的是前者。
Nebula 的三层图试图给智能体一种区分它们的方法。语义事实描述什么是真的。情景事件簇描述发生了什么。程序性习惯描述组织通常如何做事。溯源则是让它可审计的部分:事实、它何时变为真,以及系统为什么相信它。
这处于什么位置
Mem0 和 Zep 占据相邻的记忆基础设施类别。Zeroset 的赌注是,长时程企业智能体需要的是流程状态,而不是对话式记忆,这一区别对于任何跨越系统边界、持续数天或数周的事情都很重要:索赔处理、发布审批、多步骤采购。
这些流程共享一种结构。它们涉及人与系统之间的交接、遵循不成文规则的例外,以及取决于谁有空的审批。这些都不存在于文档中。它存在于实践中,这就是为什么一直难以表示。
流程挖掘是最接近的现有技术,而 Zeroset 用流程挖掘数据集作为基准,这一点很说明问题。该领域花了二十年从事件日志中重建工作实际上如何流动。实时做同样的事情,让智能体可以在任务中途查询,是一种合理的演进。
Gradient 公开发表的论点也提出了同样的主张。消费级智能体成功,是因为它们在公共网络上训练。企业智能体仍然缺乏对工作如何在私有组织内部实际流动的表示。
如果它奏效,会改变什么
两件事。智能体框架不再发布越来越大的上下文窗口来弥补缺失的结构,因为问题从来不是窗口大小。企业可以将自己工作流的运营模型保留在自己的边界内,而不是指望通用模型最终推断出它。
第二个后果更具战略性。存在于公司边界内的工作流表示是公司拥有的资产。由通用模型推断出的表示则是公司租用的能力。对于受监管行业,这一差异决定了智能体能否被部署。
有一个值得指出的竞争风险。如果大型平台厂商决定流程状态属于其套件的一部分,那么无论状态层有多好,一家五人的初创公司都会面临分发问题。Gradient 的参与有帮助,而分发不是一轮 520 万美元融资能解决的问题。
今天的数字很小:五个人、两个公开基准、一个封闭预览。但论断更大,而且可以检验。如果企业自动化已经走过能力阶段,那么下一轮竞争就是关于谁真正知道工作是什么。