← 블로그로
Ai약 14 분 읽기

Salesforce, 에이전트에게 몇 주간 실행되는 런타임을 부여하다

게시일 2026년 10월 6일
Salesforce, 에이전트에게 몇 주간 실행되는 런타임을 부여하다

Salesforce는 10월 5일 두바이와 리야드에서 새로운 Agentforce 에이전트 포트폴리오를 발표했으며, 대부분의 보도는 그 라인업에 초점을 맞췄다. Casey는 음성, SMS, WhatsApp, 웹 채팅 전반에서 고객 서비스를 담당한다. Paige는 IT 및 HR 요청을 해결한다. Carter는 쇼퍼가 제품을 비교하고 채팅에서 결제할 수 있도록 돕는다. Piper는 인바운드 리드를 검증한다. Marshall은 백오피스 프로세스를 조율하고 감사 기록을 유지한다. Fin은 복잡한 고객 경험 워크플로를 실행한다. Hunter는 리서치부터 아웃리치까지 아웃바운드 영업을 수행한다.

라인업은 가장 흥미롭지 않은 부분이다. 그 아래에 있는 것은 에이전트가 단일 상호작용이 끝나는 시점에 멈추지 않고 며칠, 몇 주에 걸쳐 목표를 추구할 수 있게 하는 새로운 장기 지평(long-horizon) 런타임이다.

이는 기업용 AI가 지금까지 판매해 온 것과는 다른 제품 범주다.

답변과 완수 사이의 차이

대화형 어시스턴트는 질문을 해결하고 턴을 종료한다. 장기 지평 런타임 위의 에이전트는 지시를 받아 측정 가능한 목표로 전환하고, 계획을 세운 뒤, 어떤 작업을 완료할지, 어떤 도구가 필요한지, 어디서 사람의 개입을 위해 멈춰야 하는지를 결정하면서 그 목표를 향해 나아간다.

Salesforce의 예시는 영업 담당자가 Hunter에게 분기 말 전에 위험에 처한 거래를 구해내라고 지시하는 것이다. Hunter는 이를 계획으로 전환하고 실행을 시작하며, 정해진 지점에서 영업 담당자의 승인을 위해 멈춘다.

어두운 표면 위에 따뜻한 림 라이트가 비치는, 비어 있는 반투명 유리 모래시계 하나

세 가지 메커니즘이 이를 가능하게 한다. 메모리는 세션 전반에 걸쳐 맥락과 진행 상황을 보존하므로, 월요일에 작업을 이어받는 에이전트는 금요일에 무엇을 했는지 안다. 내구성 있는 실행(durable execution)은 계획이 계속 실행되도록 유지하고 상황이 바뀌면 에이전트가 재개하거나 조정할 수 있게 한다. 동적 스티어링(dynamic steering)은 개별 사용자의 피드백에 따라 행동을 조정한다.

세 번째가 바로 설계가 흥미로워지는 지점이다. 몇 주 동안 실행되는 에이전트는 많은 결정을 축적하며, 그중 대부분은 사소한 방식으로 잘못될 것이다. 유일한 피드백 채널이 계획을 초기화하는 수정이라면, 그 에이전트는 내구성이 없다. 스티어링은 에이전트가 재시작하는 대신 실행 중에 행동을 조정한다는 것을 의미한다.

거버넌스 문제가 전면으로 부상하다

에이전트가 사람 없이 더 오래 실행될수록 책임 문제는 더 중요해진다.

Salesforce의 답은 두 계층으로 되어 있다. 승인이나 판단이 필요한 곳마다 사람이 관여하며, 이는 전통적인 가드레일이다. 그 아래에는 에이전트 행동을 위한 오픈소스 언어인 Agent Script가 있어 기업이 AI 추론과 결정론적 규칙을 결합할 수 있다. 핵심은 에이전트가 결정에 도달하는 방식을 세밀하게 제어하는 것이며, 정책을 따라야 하는 부분은 학습되는 것이 아니라 정책으로 작성될 수 있다.

모든 것은 고객의 기존 권한 및 비즈니스 규칙 안에서 실행되며, 각 에이전트는 회사가 부여한 이름을 갖는다. 에이전트가 브랜드의 확장이 된다는 것이 프레이밍이며, 이는 마케팅 논변이 컴플라이언스 역할을 하는 것이다.

감사 기록도 여기서 중요하다. Marshall은 모든 행동에 대해 감사 기록을 제공하는 것으로 설명된다. 몇 주에 걸쳐 여러 시스템을 건드리는 프로세스에서 감사 추적은 사람 감독자가 전체 실행을 재생하지 않고도 무슨 일이 있었는지 검토할 수 있는 유일한 방법이다.

Salesforce가 가리키는 증거

회사는 Agentforce와 Slack 전반에서 70억 개 이상의 에이전트 작업 단위를 보고했으며, 여기에는 가장 최근 분기의 32억 개가 포함된다. 특정 고객들이 거명된다. Perk에서는 현재 영업 파이프라인의 60퍼센트가 아웃바운드 에이전트에 의해 구축된다. Autism Queensland에서는 행정 요청의 70퍼센트가 Paige에 의해 해결된다. Hibbett AI는 6주 만에 가동되어 현재 핵심 쇼퍼 여정의 90퍼센트를 처리한다.

Hibbett은 곱씹어 볼 만한 숫자다. 6주 만에 쇼퍼 여정의 90퍼센트 커버리지에 도달한 리테일 배포는 구성 속도에 관한 주장이며, 구성 속도는 기업 에이전트 프로젝트가 역사적으로 죽어온 지점이다. 대부분은 역량이 아니라 통합에서 멈춘다.

거명된 고객들은 구매자에 대한 요점을 전달하기 위해 선택되기도 한다. 파이프라인 생성 지표는 영업 리더에게 말을 건다. 행정 요청 지표는 공공 부문이나 헬스케어 구매자에게 말을 건다. 사례 연구가 곧 세분화다.

레코드 시스템에 연결됨, 그것이 진짜 해자다

에이전트들은 Customer 360을 기반으로 실행되며, 이는 기업이 이미 Salesforce 내부에 보유한 고객 맥락, 데이터, 비즈니스 프로세스로 작동한다는 뜻이다.

이는 기술적 세부 사항으로 위장한 유통 이점이다. 경쟁사도 아웃바운드 리서치를 수행하는 에이전트를 만들 수 있다. 계정 이력, 열린 기회, 지원 티켓을 이미 아는 에이전트를 만드는 것은 다른 문제이며, 기반 레코드가 없는 벤더에게는 불가능하다.

트레이드오프는 익숙한 것이다. 레코드 시스템에 가까이 있다는 데서 오는 이점은 그에 대한 의존성을 수반하며, 영업 에이전트를 Agentforce에서 운영하는 기업은 CRM 선택을 되돌리기 더 비싸게 만들었다.

다른 상시 가동 에이전트와 어떻게 다른가

Salesforce만 프롬프트 없이 실행되는 에이전트를 출시하는 회사가 아니다.

OpenAI의 Dots는 사용자 정의 목표를 향해 백그라운드에서 지속적으로 작동하며, 수천 개의 애플리케이션에 연결되고, 각 에이전트는 자체 프라이빗 클라우드 컴퓨터에서 실행된다. Meta의 Muse 에이전트도 비슷한 입장을 취한다. 공통된 아이디어는 에이전트가 질문에 답하는 것이 아니라 목표를 유지한다는 것이다.

Salesforce 버전의 차이는 출발 표면이다. Dots는 목표와 연결된 애플리케이션 집합에서 시작한다. Agentforce는 Customer 360에 묶여 있기 때문에 고객 레코드, 케이스, 기회 또는 주문에서 시작한다. 이는 에이전트가 작업할 수 있는 범위를 좁히고 그에 대해 아는 것을 깊게 한다.

기업에게는 좁은 버전이 종종 더 유용하다. 무엇이든 건드릴 수 있는 범용 에이전트는 회사가 이미 관리하는 시스템 안에서 작동하는 특정 에이전트보다 승인하기 어렵다. 권한 모델은 발명되는 것이 아니라 상속된다.

지속성 아래에 깔린 가격 문제

한 달 동안 계획을 열어 두는 에이전트는 요청-응답 모델과는 다른 방식으로 비용을 발생시킨다.

계획 상태를 위한 스토리지, 세션 전반의 메모리, 승인이 필요할 때 알림을 보내야 하는 에이전트에 대한 모니터링, 그리고 모델 호출 자체가 모두 결과를 낼 수도 있고 내지 않을 수도 있는 워크플로에 비용으로 쌓인다. 대화형 어시스턴트의 비용은 교환 단위로 측정된다. 상시 가동 에이전트의 비용은 시간 단위와 작업 단위로 측정된다. 이 두 수치는 맞아떨어지지 않으며, 그래서 거명된 고객들이 기능 목록보다 더 중요하다. Perk, Autism Queensland, Hibbett은 모두 재무팀이 이미 가격을 매길 수 있는 결과를 설명한다. 생성된 파이프라인, 해결된 행정 요청, 처리된 쇼퍼 여정. 알려진 비용을 대체하는 에이전트는 정당화하기 쉽다. 새로운 비용 범주를 만드는 에이전트는 그렇지 않다.

지켜볼 것

세 가지가 장기 지평 런타임이 제품인지 데모인지를 결정할 것이다.

첫째는 장기간에 걸친 실패 행동이다. 두 달에 걸쳐 표류하는 계획은 한 세션에서 실패하는 계획보다 진단하기 어렵고, Salesforce는 에이전트가 몇 주 전에 포기했어야 할 목표를 추구할 때 어떤 일이 일어나는지 설명하지 않았다.

둘째는 Agent Script가 Salesforce 외부에서 채택되는지 여부다. 에이전트 행동을 위한 오픈소스 언어는 플랫폼에 머무는 고객에게만 유용하다. 이식 가능하다면 표준이 된다. 그렇지 않다면 구성 형식일 뿐이다.

셋째는 지속성의 가격이다. 한 달 동안 계획을 열어 두는 에이전트는 스토리지, 메모리, 모니터링을 소비하며, 그 어느 것도 토큰당 비교에는 나타나지 않는다. 상시 가동 에이전트의 단위 경제학은 요청-응답 모델의 단위 경제학이 아니며, Salesforce는 어느 쪽에 비용을 청구하는지 공개하지 않았다.

회사가 사용하는 프레이밍, 즉 이 에이전트들이 답하는 질문이 아니라 완수하는 작업으로 평가된다는 것은 업계가 지금까지 요구받아 온 것보다 더 높은 기준을 세운다. 또한 측정을 쉽게 만든다. 위험에 처한 거래가 성사되었거나, 되지 않았거나 둘 중 하나다.

관련 글