병목은 더 이상 모델이 아니라 워크플로의 빠져 있는 상태다

--- title: 병목은 더 이상 모델이 아니라 워크플로의 빠져 있는 상태다 slug: the-bottleneck-is-no-longer-the-model-but-the-missing-workflow-state meta_title: 장기 호라이즌 에이전트에 워크플로 상태가 필요한 이유 meta_description: Zeroset은 에이전트가 기업이 실제로 승인과 핸드오프를 어떻게 라우팅하는지 질의할 수 있게 하는 상태 계층 Nebula를 위해 520만 달러를 조달했다. category: ai tags: Zeroset,Nebula,에이전트 메모리,워크플로 상태,Gradient Ventures,장기 호라이즌 에이전트,엔터프라이즈 AI,프로세스 마이닝,LongMemEval,컨텍스트 ---
520만 달러의 프리시드는 큰 숫자가 아니다. Zeroset의 주장은 투자금보다 더 주목할 가치가 있다. 엔터프라이즈 에이전트를 가로막는 것은 모델 역량이 아니라 상태 시스템의 부재다.
Akshat Kannan은 18세에 스탠퍼드를 떠났다. William Zhang은 21세에 텍사스 대학교를 떠났다. 두 사람은 2026년 1월, 하나의 좁은 관찰을 바탕으로 Zeroset을 창업했다. 프런티어 모델은 이미 이메일 초안과 항공편 검색을 처리한다. 하지만 특정 기업이 승인, 예외, 핸드오프를 어떻게 라우팅하는지 알아야 하는 작업에서는 멈춘다.
10월 6일, Gradient Ventures와 2048 Ventures가 Leblon Capital의 참여로 520만 달러 프리시드를 공동 주도했다. 이 회사는 5명이며, 접근은 여전히 비공개 리서치 프리뷰다.
Nebula가 저장하는 것
Nebula는 워크플로가 이미 사용하는 시스템에 연결된다: Microsoft 365, SharePoint, Outlook, Teams, GitHub 및 직장 메시징. 각 문서를 고립된 벡터로 취급하지 않는다. 의미적 사실, 에피소드형 이벤트 클러스터, 절차적 습관이라는 세 계층으로 이루어진 계층적 벡터 그래프를 구축한다.

메모리 저장소와의 차이는 에이전트가 돌려받는 것에 있다. 이력을 재구성하는 대신, 워크플로의 현재 상태를 질의한다. 회사는 반환값을 계보가 있는 타입화된 질의 가능 상태라고 설명한다: 무엇이 참인지, 언제 참이 되었는지, 시스템이 왜 그렇게 믿는지.
벤치마크는 초기 단계지만 구체적이다. LongMemEval에서 Nebula는 Mem0, Supermemory, 단순 RAG보다 20퍼센트 더 높은 정확도를 중앙값 50밀리초 미만, 쿼리당 더 적은 토큰으로 반환했다. BPI Challenge 프로세스 마이닝 데이터셋에서는 다음 활동 예측에서 기록된 모든 기준선을 10퍼센트 이상 앞섰는데, 이는 검색보다 더 어려운 테스트다. 시스템이 다음의 정당한 단계를 예측할 수 있는지 묻기 때문이다.
토큰 수는 정확도만큼 중요하다. 쿼리당 더 적은 토큰은 더 작은 컨텍스트 윈도우가 같은 정보를 담을 수 있게 하며, 이는 모든 에이전트 턴의 비용을 낮춘다. 일주일 동안 실행되는 워크플로에서는 그 차이가 오류와 같은 방식으로 복리처럼 커진다.
창업자들의 출발점 관찰은 문제를 가장 간결하게 표현한다. 프런티어 모델은 이메일 초안과 항공편 검색을 처리한다. 특정 기업이 승인, 예외, 핸드오프를 어떻게 라우팅하는지 알아야 하는 작업에서는 멈춘다. 그 시나리오에서 모델 자체가 잘못된 것은 아니다. 정보가 단순히 프롬프트에 없고 공개 코퍼스에서 검색될 수도 없다.
통합 표면이 진짜 해자다
Microsoft 365, SharePoint, Outlook, Teams, GitHub 및 직장 메시징에 연결하는 일은 화려하지 않은 작업이며, 가장 복제하기 어려운 부분이기도 하다. 경쟁자는 3계층 그래프 설계를 한 분기에 복제할 수 있다. 상태 계층이 각 사용자가 볼 수 있는 것과 일관되도록 유지하는 권한 인식 커넥터를 재현하는 데는 훨씬 오래 걸리며, 엔터프라이즈 구매자는 이를 가장 먼저 평가한다.
권한은 대부분의 메모리 제품이 잘못 처리하는 부분이다. 워크플로 상태 계층은 기반 시스템과 동일한 접근 경계를 존중해야 하므로, 한 사용자를 대신하는 에이전트가 조직의 다른 수준에서만 보이는 사실을 드러낼 수 없다. 이를 잘못 처리하면 틀린 답이라기보다 컴플라이언스 사고가 된다.
이는 또한 회사가 셀프서브 제품이 아니라 비공개 리서치 프리뷰를 운영하는 이유를 설명한다. 상태 계층은 그것이 본 워크플로만큼만 좋으며, 모든 신규 고객 통합은 어떤 벤치마크도 다루지 않는 라우팅 로직의 엣지 케이스를 드러낸다.
도입 전 구매자가 물어야 할 것
세 가지 질문이 유용한 상태 계층과 데모를 구분한다. 시스템은 각 사실이 언제 참이 되었는지 기록하며, 대체된 사실을 무효화할 수 있는가? 왜 무언가를 믿는지 설명하고, 원천 이벤트까지 추적할 수 있는가? 읽어들이는 시스템과 동일한 권한을 강제하는가?
계보 요건은 흐릿하게 답변되기 쉬운 항목이다. 출처 없이 사실을 반환하는 상태 계층은 기능적으로 캐시이며, 자율 에이전트 내부의 오래된 캐시는 메모리가 전혀 없는 것보다 더 나쁘다. 에이전트가 자신 있게 그것에 따라 행동하기 때문이다.
지속성은 이차적인 질문이다. 며칠 또는 몇 주에 걸친 연속 상태가 전체 가치 제안이며, 그렇게 많은 파생 조직 지식을 저장하는 것은 보존, 삭제, 지역별 상주에 관한 데이터 거버넌스 논의를 불러온다.
오래된 상태가 복리처럼 커지는 이유
회사가 지목하는 실패 모드는 이 범주가 존재하는 이유다. 오래된 사실이나 모순된 지시는 단일 오류를 일으키지 않는다. 그것은 다음 턴의 시작 상태가 되어 복리처럼 늘어나는 재작업, 추가 도구 호출, 인간 개입을 낳는다.
비용을 크게 만드는 것은 이 복리 효과다. 단일 잘못된 행동은 복구할 수 있다. 20단계 프로세스를 관통해 지속되는 잘못된 가정은 그 이후의 모든 단계를 오염시키고, 누군가 알아차릴 때쯤이면 작업은 이전 체크포인트부터 다시 해야 한다. 몇 시간 동안 무인으로 실행되는 에이전트는 이를 더 악화시킨다. 아무도 드리프트를 지켜보지 않기 때문이다.
대화형 메모리 시스템은 유사한 청크를 검색한다. 검색된 사실이 3주 전 것이고 워크플로가 앞서 나갔다면, 에이전트는 더 이상 존재하지 않는 세계를 바탕으로 추론하며, 응답 어디에도 불일치를 표시하지 않는다. 검색 유사성과 사실의 최신성은 다른 속성이며, 벡터 저장소는 전자를 최적화한다.
Nebula의 3계층 그래프는 에이전트가 이 둘을 구분할 방법을 주려는 시도다. 의미적 사실은 무엇이 참인지 설명한다. 에피소드형 이벤트 클러스터는 무슨 일이 있었는지 설명한다. 절차적 습관은 조직이 보통 일을 처리하는 방식을 설명한다. 계보는 이를 감사 가능하게 만드는 조각이다: 사실, 그것이 참이 된 시점, 시스템이 그것을 믿는 이유.
이것이 들어맞는 위치
Mem0와 Zep은 인접한 메모리 인프라 범주를 차지한다. Zeroset의 베팅은 장기 호라이즌 엔터프라이즈 에이전트가 대화형 메모리보다 프로세스 상태를 필요로 한다는 것이며, 이 구분은 시스템 경계를 넘나들며 며칠 또는 몇 주에 걸치는 모든 것, 즉 클레임 처리, 릴리스 승인, 다단계 조달에 중요하다.
그러한 프로세스는 구조를 공유한다. 사람과 시스템 간의 핸드오프, 불문율을 따르는 예외, 누가 이용 가능한지에 따라 달라지는 승인이 포함된다. 그중 어느 것도 문서에 존재하지 않는다. 그것은 관행 속에 존재하며, 그래서 표현하기 어려웠다.
프로세스 마이닝이 가장 가까운 선행 기술이며, Zeroset이 프로세스 마이닝 데이터셋을 기준으로 벤치마킹한다는 점은 시사적이다. 그 분야는 20년 동안 이벤트 로그로부터 작업이 실제로 어떻게 흐르는지 재구성하는 데 썼다. 에이전트가 작업 중간에 질의할 수 있도록 실시간으로 같은 일을 하는 것은 합리적인 진화다.
Gradient가 공개한 테제도 같은 주장을 한다. 소비자 에이전트는 공개 웹에서 학습했기 때문에 성공했다. 엔터프라이즈 에이전트는 여전히 비공개 조직 내부에서 작업이 실제로 어떻게 움직이는지에 대한 표현이 부족하다.
이것이 작동하면 무엇이 바뀌는가
두 가지다. 에이전트 하네스는 빠진 구조를 보완하기 위해 점점 더 큰 컨텍스트 윈도우를 내놓는 것을 멈춘다. 문제는 결코 윈도우 크기가 아니었기 때문이다. 그리고 엔터프라이즈는 일반 모델이 언젠가 추론해 주기를 바라는 대신, 자사 워크플로의 운영 모델을 자체 경계 안에 유지할 수 있다.
두 번째 결과가 더 전략적이다. 기업 경계 안에 존재하는 워크플로 표현은 기업이 소유한 자산이다. 일반 모델이 추론한 것은 기업이 임대하는 역량이다. 규제 산업에서는 이 차이가 에이전트를 배포할 수 있는지 자체를 결정한다.
이름 붙일 만한 경쟁 리스크가 있다. 대형 플랫폼 벤더가 프로세스 상태를 자사 제품군에 속한다고 결정하면, 5명 스타트업은 상태 계층이 아무리 좋아도 유통 문제에 직면한다. Gradient의 참여는 도움이 되지만, 유통은 520만 달러 라운드로 해결되는 것이 아니다.
오늘의 숫자는 작다: 5명, 두 개의 공개 벤치마크, 비공개 프리뷰. 주장은 더 크고, 검증 가능하다. 엔터프라이즈 자동화가 역량 단계를 넘어섰다면, 다음 라운드 경쟁은 누가 실제로 작업이 무엇인지 아는가에 관한 것이다.
관련 글
위성 사진이 이제 로봇 훈련 데이터가 되다
피지컬 AI 학습의 병목은 더 이상 컴퓨팅이나 모델 성능이 아니었다. 그것은 합성 세계의 품질이 되었다.
구글 Gemini 3.5 라이브 번역, 멈춤을 없애다
화자 자신의 목소리로, 이미 주머니에 있는 휴대폰에서 연속 실행되는 번역은 기능을 열어야 하는 것에서 그냥 켜져 있는 것으로 옮긴다.
중국, AI 에이전트 최초의 강제 안전 표준을 제정하다
안전은 홍보하는 기능에서 통과해야 하는 관문으로 바뀐다. 위험 목록은 13개 범주, 97개 항목에 이른다.
AI 생성 콘텐츠, 이제 신분을 밝혀야 한다
이 한 걸음이 모든 문제를 해결하지는 않지만, 'AI 생성'을 숨길 수 있는 선택지에서 반드시 답해야 하는 질문으로 바꿔놓았다.