← 返回博客
Ai预计阅读 10 分钟

ServiceNow 将智能体失败转化为训练数据

发布于 2026年10月4日
ServiceNow 将智能体失败转化为训练数据

每个把 AI 智能体部署到真实企业系统中的团队都懂这种痛。模型本身能力很广,可一旦遇到你特有的工具、你特有的策略、你那一团乱麻的状态机,它就会栽跟头。

ServiceNow 的研究部门 CoreAI 发布了一套系统,试图把这些栽跟头变成资产。它叫 AutoSynthData,其前提是:模型的失败是你训练它时最有价值的原材料。

核心动作

这条流水线首先在真实环境中,让目标模型和更强的教师模型运行相同的诊断任务。目标模型失败而教师模型成功的地方,就是能力差距。AutoSynthData 把这种差距提炼成团队所称的“能力规格卡”:对其中涉及的工具、工作流、结束状态和允许的变体进行脱敏描述,并剥离原始评估提示和实体细节。

这些卡片用来播种新任务的生成。关键在于,生成器从不会看到原始评估轨迹,因此生成的数据测试的是底层能力,而不是记忆下来的序列。该框架分两个阶段扩展。目标阶段并行创建核心任务。倍增阶段则拿已验证的任务,衍生出带有新措辞、新实体配置和新初始状态的变体。有一条规则防止数据漂移:被倍增出来的样本绝不能再次作为倍增的种子。

一个值得生成的任务需要满足三个条件

ServiceNow 明确表示,仅仅看起来合理的请求还不够。生成的任务必须同时满足三件事。

它必须是可行的,也就是说,在环境中至少存在一条可执行路径,能在遵守规则的前提下完成请求。它必须是真实的,也就是说,它反映的是真实用户确实会提出的工作,而不是没人会采取的技术上有效的操作。它还必须是困难的,也就是说,它针对的是真正的弱点。琐碎的任务教不会任何东西,而不可能完成的任务则会教出错误的教训。

每个任务都附带一个验证器,而验证器也必须达到自己的标准。它必须与提示和系统状态一致,足够可靠以拒绝违反约束的情况,并且足够完整以接受任何可用的解决方案,而不是坚持只认一条参考路径。

质量门控才是真正的产品

这件事里值得关注的不是任务生成,而是检查。

每个候选任务都要通过两道门控。正向门控会在环境中运行参考解决方案,以确认预期答案确实满足验证器,这能抓出提示、初始状态和成功标准之间的不匹配。负向门控则会故意变异最终状态,以确认错误结果确实会被拒绝。第二道门控正是用来抓出规格不足的验证器——那种会欣然奖励畸形智能体轨迹的验证器。

当候选任务失败时,一个评审器会诊断问题所在,找出断裂的引用或矛盾的状态,并指导进行有界修复,而不是直接把工作丢掉。在样本层面之上,批次审查会观察整体情况:哪些任务簇占比过高、哪些维度缺失、哪些生成模式总是卡住。随后控制器会把下一批任务导向仍然存在的缺口。

为什么终究需要合成数据

值得退一步问一问:这为什么重要。企业智能体的理想训练数据,是真实的人在真实系统中做真实工作、并且标注正确的记录。这种数据稀缺、敏感、收集成本高昂,而且其中很多出于隐私或合规原因无法离开企业。

合成生成是一条出路,但它带着一个已知的失败模式。如果你从模型生成任务,你就会继承那个模型的盲点,生成的数据可能看起来很多,却教不了多少东西。AutoSynthData 的全部贡献,是围绕生成构建的一套让数据保持诚实的机制:拒绝坏任务的门控、防止重复的多样性检查,以及持续瞄准智能体尚未掌握内容的课程。没有验证的生成只是噪声。这是一次把它变成信号的尝试。

数字说明了什么,又没有说明什么

在 EnterpriseOps Gym(一个面向企业智能体任务的开源环境)上的测试中,一个基于 Gemma 的模型用 2,000 个 AutoSynthData 样本进行微调后,在混合领域中将 Pass@1 指标相对基线提升了 35%。在 ITSM 领域,合成有监督微调把平均 Pass@1 从 18.77% 提升到 27.18%。

这些是在特定基准上取得的真实提升,但这不等同于通用结果。这条流水线的核心依赖很诚实,也值得直说:它需要一个明显更强的教师模型来展示正确行为,还需要一个准确的仿真环境来进行测试。在一家没有高保真沙盒和可靠确定性验证器的公司里,构建执行层本身就是一个严肃的工程项目。AutoSynthData 并没有消除这项工作。它改变的是这项工作的目的。

教师模型的隐患

这个设计中有一个依赖值得单独用一句话说明。整条流水线都建立在弱模型和强模型之间的差距上。在实验中,教师模型比目标模型大得多。当你有一个前沿系统可以借用时,这行得通。当你自己就是前沿,或者任务过于专门化以至于不存在更强的模型来演示它时,这就不太行了。在这种情况下,流水线没有可学习的东西,它所依赖的能力差距就只是一堵墙。关于生成训练数据的研究,最终总会撞上这一点:只要某个地方的某个人已经解决了这个问题,方法就能扩展。

为什么这就是企业 AI 的形态

这次发布有趣的地方,在于它承认了企业 AI 实际所处的位置。瓶颈不再是获得一个能力强的模型。瓶颈是让一个能力强的模型在某个特定组织内部、按照其特定工具和规则正确运行,而在这里失败往往很隐蔽,状态空间又很大。

多年来,答案一直是人工标注,而人工标注缓慢、昂贵且难以扩展。AutoSynthData 提出了一个论点:失败本身就包含信号,前提是你能够提取、验证并多样化这些失败,同时不泄露评估集。这条流水线已在 Hugging Face 上开放用于研究,团队表示下一步是使用相同方法论的强化学习。

如果它能在广泛场景中奏效,那意味着企业 AI 中的稀缺技能会发生转移。它不再关乎获取数据,而是关乎构建足够好的环境,以便在其中生成可信数据。这是一个更难的问题,也是一个更持久的问题,因为公司的环境是竞争对手无法复制的东西。

相关文章