ServiceNow, 에이전트 실패를 학습 데이터로 전환하다

실제 엔터프라이즈 시스템에 AI 에이전트를 배포해 본 모든 팀은 같은 고통을 안다. 모델은 전반적으로 유능하지만, 그러다가 여러분의 특정 도구, 특정 정책, 특정하게 엉망인 상태 머신을 만나면 비틀거린다.
ServiceNow의 연구 조직인 CoreAI는 그런 비틀거림을 자산으로 바꾸려는 시스템을 공개했다. 이름은 AutoSynthData이며, 전제는 모델의 실패가 모델을 학습시키는 데 가장 가치 있는 원재료라는 것이다.
핵심적인 움직임
이 파이프라인은 실제 환경에서 동일한 진단 작업에 대해 대상 모델과 더 강력한 교사 모델을 실행하는 것으로 시작한다. 대상 모델이 실패하고 교사 모델이 성공하는 지점에 역량 격차가 있다. AutoSynthData는 그 격차를 팀이 말하는 역량 명세 카드로 증류한다. 이는 관련된 도구, 워크플로, 최종 상태 및 허용 가능한 변형에 대한 정제된 설명으로, 원래의 평가 프롬프트와 엔터티 세부 정보는 제거된다.
이 카드들은 새로운 작업의 생성을 위한 씨앗이 된다. 결정적으로, 생성기는 원래의 평가 궤적을 전혀 보지 못하므로, 결과 데이터는 암기된 시퀀스가 아니라 근본적인 능력을 테스트한다. 프레임워크는 이를 두 단계로 확장한다. 대상 단계에서는 핵심 작업을 병렬로 생성한다. 증식 단계에서는 검증된 작업을 가져와 새로운 표현, 새로운 엔터티 구성 및 새로운 초기 상태를 가진 변형을 만들어 낸다. 데이터가 표류하지 않게 하는 규칙이 하나 있다. 증식된 샘플은 또 다른 증식의 씨앗이 될 수 없다.
생성할 가치가 있는 작업의 세 가지 조건
ServiceNow는 그럴듯해 보이는 요청만으로는 충분하지 않다고 분명히 말한다. 생성된 작업은 세 가지를 동시에 충족해야 한다.
실행 가능해야 한다. 즉, 규칙을 지키면서 요청을 완료하는 실행 경로가 환경 안에 적어도 하나 있어야 한다. 현실적이어야 한다. 즉, 아무도 하지 않을 기술적으로 유효한 행동이 아니라, 실제 사용자가 실제로 요청할 법한 작업을 반영해야 한다. 그리고 어려워야 한다. 즉, 진짜 약점을 겨냥해야 한다. 사소한 작업은 아무것도 가르치지 못하고, 불가능한 작업은 잘못된 교훈을 가르친다.
각 작업에는 검증기가 함께 제공되며, 검증기는 자체 기준을 충족해야 한다. 프롬프트 및 시스템 상태와 일관되어야 하고, 제약 위반을 거부할 만큼 건전해야 하며, 하나의 참조 경로를 고집하지 않고 어떤 작동하는 해법도 수용할 만큼 완전해야 한다.
품질 게이트가 진짜 제품이다
이 중에서 주목할 부분은 작업 생성이 아니다. 바로 검사다.
모든 후보는 두 개의 게이트를 통과한다. 긍정 게이트는 환경 안에서 참조 해법을 실행하여 의도된 답이 실제로 검증기를 만족하는지 확인하며, 이는 프롬프트, 초기 상태 및 성공 기준 사이의 불일치를 잡아낸다. 그런 다음 부정 게이트가 최종 상태를 의도적으로 변형하여 잘못된 결과가 실제로 거부되는지 확인한다. 두 번째 게이트는 과소 명세된 검증기, 즉 잘못된 에이전트 궤적에도 기꺼이 보상을 줄 만한 검증기를 잡아내는 게이트다.
후보가 실패하면 비평자가 문제를 진단하여 깨진 참조나 모순된 상태를 찾아내고, 작업을 아예 버리는 대신 범위가 제한된 수리를 지시한다. 샘플 수준 위에서는 배치 검토가 집계를 지켜본다. 어떤 작업 클러스터가 과대표현되었는지, 어떤 차원이 빠졌는지, 어떤 생성 패턴이 계속 정체되는지 살핀다. 그런 다음 컨트롤러가 다음 배치를 남아 있는 격차 쪽으로 조종한다.
합성 데이터가 왜 필요한가
왜 이것이 중요한지 잠시 물러나 생각해 볼 가치가 있다. 엔터프라이즈 에이전트를 위한 이상적인 학습 데이터는 실제 사람이 실제 시스템에서 실제 작업을 수행한 기록에 올바르게 라벨을 붙인 것이다. 그런 데이터는 희소하고 민감하며 수집 비용이 비싸고, 상당 부분은 프라이버시나 규정 준수 이유로 건물 밖으로 나갈 수 없다.
합성 생성은 탈출구지만, 잘 알려진 실패 모드를 동반한다. 모델로부터 작업을 생성하면 그 모델의 사각지대를 물려받게 되고, 결과 데이터는 풍부해 보여도 실제로 가르치는 것은 거의 없을 수 있다. AutoSynthData의 전체 기여는 데이터를 정직하게 유지하는 생성 주변의 기계 장치다. 나쁜 작업을 거부하는 게이트, 반복을 막는 다양성 검사, 그리고 에이전트가 아직 숙달하지 못한 것을 계속 겨냥하는 커리큘럼이다. 검증 없는 생성은 잡음이다. 이것은 그것을 신호로 만들려는 시도다.
숫자가 말하는 것과 말하지 않는 것
엔터프라이즈 에이전트 작업을 위한 오픈소스 환경인 EnterpriseOps Gym에서의 테스트에서, 2,000개의 AutoSynthData 샘플로 파인튜닝된 Gemma 기반 모델은 하이브리드 도메인에서 기준선 대비 Pass@1 지표를 35퍼센트 향상시켰다. ITSM 도메인에서는 합성 지도 파인튜닝이 평균 Pass@1을 18.77퍼센트에서 27.18퍼센트로 끌어올렸다.
이는 특정 벤치마크에서의 실제 성과이며, 일반적인 결과와는 다르다. 이 파이프라인의 핵심 의존성은 솔직하며 분명히 말할 가치가 있다. 올바른 행동을 보여줄 훨씬 더 강력한 교사 모델과, 테스트할 정확한 시뮬레이션 환경이 필요하다. 고충실도 샌드박스와 신뢰할 수 있는 결정론적 검증기가 없는 회사에서는 실행 계층을 구축하는 것 자체가 심각한 엔지니어링 프로젝트다. AutoSynthData가 그 일을 없애 주지는 않는다. 그 일의 목적을 바꿔 놓을 뿐이다.
교사 모델의 함정
이 설계에는 따로 한 문장을 할애할 가치가 있는 의존성이 있다. 전체 파이프라인은 약한 모델과 강한 모델 사이의 격차 위에서 작동한다. 실험에서 교사 모델은 대상 모델보다 훨씬 큰 모델이었다. 이는 빌려올 최전선 시스템이 있을 때는 통한다. 하지만 여러분 자신이 최전선일 때, 또는 작업이 너무 특화되어 이를 보여줄 더 강한 모델이 존재하지 않을 때는 덜 통한다. 그런 경우 파이프라인은 배울 대상이 없고, 의존하는 역량 격차는 그저 벽일 뿐이다. 학습 데이터 생성 연구는 결국 항상 여기에 부딪힌다. 누군가가 어디선가 이미 그 문제를 해결해 두었을 때만 이 방법이 확장된다.
이것이 엔터프라이즈 AI의 형태인 이유
이번 공개에서 흥미로운 점은 엔터프라이즈 AI가 실제로 어디에 서 있는지를 인정한다는 것이다. 병목은 더 이상 유능한 모델을 확보하는 것이 아니다. 병목은 유능한 모델이 특정 조직 안에서, 그 조직 특유의 도구와 규칙 속에서 올바르게 작동하게 만드는 것이다. 그곳에서는 실패가 미묘하고 상태 공간이 크다.
수년간 답은 수동 주석이었지만, 이는 느리고 비싸며 확장하기 어렵다. AutoSynthData는 실패 자체가 신호를 담고 있다는 주장이다. 평가 세트를 유출하지 않고 그것을 추출하고 검증하고 다양화할 수 있다면 말이다. 이 파이프라인은 Hugging Face에서 연구용으로 이용할 수 있으며, 팀은 같은 방법론을 사용한 강화 학습이 다음이라고 말한다.
이것이 폭넓게 작동한다면, 시사점은 엔터프라이즈 AI에서 희소한 기술이 바뀐다는 것이다. 데이터를 확보하는 일이 아니라, 내부에서 신뢰할 수 있는 데이터를 생성할 만큼 좋은 환경을 구축하는 일이 된다. 그것은 더 어려운 문제이자 더 지속 가능한 문제다. 기업의 환경은 어떤 경쟁자도 따라 할 수 없는 것이기 때문이다.
관련 글
바퀴 달린 세미휴머노이드, 도움 없이 한 시간 동안 세탁 마쳐
개별 작업은 성공해도 워크플로는 여전히 실패할 수 있다. Dyna는 측정 지표를 바꿨다.
LTX 2.5, 투박한 블렌더 초안을 완성된 샷으로 렌더링하려 한다
텍스트-투-비디오에서는 무슨 일이 일어날지 통제할 수 없다. 이것이 그 문제를 해결하려 한다.
언어와 비전을 위한 단일 프레임워크: Horizon의 16억 파라미터 오픈 모델
언어와 비전 사이의 다리는 애초에 필요하지 않았다는 내기.
포토닉 메모리 벽: 볼란티스가 방금 건 8,800만 달러의 승부수
모두가 당연하게 여기며 살아온 트레이드오프, 볼란티스가 없애려는 바로 그것이다.