이제 AI 에이전트가 고객 지원에 전화를 걸고, 기업은 응답해야 한다

10월 1일 열린 Decagon Dialogues 행사에서 Decagon은 대부분의 기업이 아직 대비조차 시작하지 않은 문제, 즉 수화기 건너편의 발신자가 사람이 아니라 다른 회사의 AI 에이전트일 때 벌어지는 일을 겨냥한 네 가지 제품을 출시했다.
네 가지 제품은 Chord라는 새로운 음성 모델을 탑재한 Voice 3, 동반 인증 프로토콜을 갖춘 Personal Agent Gateway, Agent Modules, 그리고 Duet Apprentice라는 베타 버전이다. 앞의 두 가지가 가장 중요하다. 이 둘이 함께 이제 일상이 되어가는 대화의 양측을 설명해 주기 때문이다.
음성 모델, '사람'이라는 기준을 넘어서다
Chord는 Decagon이 자체 개발한 첫 음성 모델로, 일반적인 음성이 아니라 고객 대화에 특화해 후속 학습을 진행했다. 회사는 세 쌍의 녹음으로 블라인드 테스트를 진행했는데, 각 쌍은 실제 사람의 목소리와 동일한 목소리를 Chord에 통과시킨 결과를 짝지은 것이었다. 평균적으로 청취자의 약 90퍼센트가 어느 쪽이 사람인지 구분하지 못했다.

Chord의 작동 방식에서 헤드라인 숫자보다 더 값진 세부 사항이 두 가지 있다. 이 모델은 문장을 구절 단위로 다듬으며, 전화번호나 확인 코드에서는 속도를 늦췄다가 다시 대화 속도로 돌아온다. 또한 두 개의 계층이 병렬로 작동하는 양방향 아키텍처 위에서 구동된다. 저지연 모델이 듣기와 말하기를 담당하고, 더 무거운 모델이 대화 이면에서 추론, 도구 호출, 가드레일을 관리한다.
이 설계는 실제 행동에서 드러난다. 에이전트는 말하는 도중에도 들어오는 오디오를 처리하기 때문에, 가벼운 "음" 정도에는 그냥 넘어가다가 진짜 끼어들기에는 양보할 수 있다. 통화자를 덮고 말하거나 그냥 침묵해 버리는 대신이다. 긴 작업 중에는 진행 상황을 설명할 수 있고, 통화자를 대기 상태에 두는 대신 진행 중에 이어지는 질문을 받아 처리할 수 있다.
Decagon에 따르면 Chord는 라이선스가 확보된 데이터와 동의를 얻은 성우의 목소리로 학습되었으며, 고객 소유 데이터로는 절대 학습하지 않는다. Voice 3는 70개 이상의 언어를 지원하고, 통화자의 언어를 감지해 자동으로 전환하며, 통화자가 문장 중간에 언어를 바꾸는 경우에도 대응한다. 각 언어는 출시 전에 원어민의 검증을 거친다.
더 어려운 문제는 '상대편 에이전트'다
좋은 합성 음성은 이제 기본 조건에 불과하다. 더 흥미로운 제품은 Personal Agent Gateway이며, Decagon이 이를 만든 이유는 발표문에 그대로 적혀 있다. 행사 직전 한 달 동안 Meta는 Muse를 출시했고, OpenAI는 dots를 선보였으며, Instinct는 사용자를 대신해 전화를 걸기 시작했다. 이들은 소유자를 대신해 예약하고, 구매하고, 취소하고, 협상하는 개인 에이전트이며, 이미 고객 지원에 연락하고 있다.
이는 모든 지원 시스템이 전제로 삼아온 가정을 깨뜨린다. 무언가를 요청하는 주체가 반드시 계정 소유자가 아닐 수 있고, 변경을 승인할 권한이 있는 주체도 아닐 수 있다.
게이트웨이는 두 가지 요소로 이 문제를 다룬다. 개인 에이전트 감지 기능은 기업 측 신호와 플랫폼 측 신호를 활용해 채팅과 음성 전반에서 개인 에이전트로 보이는 대상을 표시하고, 각 기업이 그다음에 무슨 일이 일어날지, 그리고 그 에이전트가 무엇에 접근할 수 있을지를 결정한다. 이어서 채팅, 이메일, 음성과 나란히 전용 개인 에이전트 채널이 마련되며, 별도의 에이전트 운영 절차가 적용되어 사람이 요청하는지 에이전트가 요청하는지에 따라 같은 요청도 다른 워크플로를 따른다.
권한은 그 절차 안에 존재한다. 기업은 에이전트가 요청할 수 있는 범위와 각 범위가 필요한 워크플로의 구간을 정의하며, 해당 권한이 없는 에이전트에게는 그 구간이 절대 노출되지 않는다. Decagon이 든 예시는 항공사다. 여행자의 개인 에이전트가 항공편 조회와 재예약 권한을 요청하고, 여행자는 조회만 승인한다. 그러면 에이전트는 일정은 받지만 변경 권한은 얻지 못한다.
이 프로토콜을 Decagon은 PACT라고 부르며, 그 목적은 좁지만 핵심을 떠받친다. 기업이 에이전트가 누구를 대표하는지, 그리고 그 사람이 실제로 무엇을 승인했는지 검증할 수 있게 해주는데, 이는 지원 시스템이 누군가를 대신해 어떤 일을 하기 전에 반드시 답해야 하는 질문이다.
왜 이 문제가 가장 먼저 고객 지원에 닥치는가
Decagon의 고객들은 지원 티켓을 해결하는 데 그 에이전트를 쓰는 것으로 시작했고, 회사에 따르면 이제 같은 에이전트가 리드를 검증하고, 고객을 온보딩하고, 결제를 수금하고, 관계를 키운다. 이런 확장이 개인 에이전트 문제를 이론이 아니라 시급한 현실로 만든다. 질문에 답하는 에이전트가 주문을 변경할 수도 있는데, 이 두 행위의 위험 프로필은 같지 않다.
도이치 텔레콤에서 디지털 서비스 커뮤니케이션을 이끄는 Christian Niedworok은 회사 발표문에서 Voice 3 경험을 담백하게 표현했다. 목소리가 듣고 있는 것처럼 들리고, 작업하는 동안 조용해지는 대신 대화를 계속 이어간다는 것이다. 이는 지연 시간과 발화 순서 교대에 대한 설명이며, 바로 이것이 기존 음성 에이전트를 로봇처럼 느껴지게 만들었다.
나머지 두 제품도 같은 방향을 가리킨다
Agent Modules와 Duet Apprentice 베타는 운영 측면을 채워 준다. 모듈은 기업이 특정 업무를 위해 켤 수 있는 정의된 기능들을 묶어 놓은 것으로, 범용 비서와 특정 대기열에 투입할 수 있는 무언가의 차이다. Duet Apprentice는 기업 자체 위키와 과거 에스컬레이션 기록에서 학습하고 그 지식을 고객의 워크스페이스 안에 유지한다. 따라서 에이전트는 공유된 공용 데이터가 아니라 조직 자체 자료를 바탕으로 개선된다.
어느 제품도 음성 데모만큼 선명하지는 않다. 그러나 둘 다 게이트웨이와 같은 이유로 중요하다. 에이전트를 대규모로 도입하는 기업들은 모델이 무엇을 할 수 있는가라는 질문을 지나, 특정 에이전트가 실제 워크플로 안에서 무엇을 알고, 말하고, 바꿀 수 있는가라는 질문으로 이동하고 있다.
왜 음성이라는 기준은 쉬운 쪽이었는가
90퍼센트라는 숫자가 얼마나 빨리 이야기의 핵심이 아니게 되는지 눈여겨볼 만하다. 사람과 구분되지 않는 합성 음성은 지원 통화처럼 좁고 잘 정의된 과업에서는 이제 해결된 문제이며, 아직 내놓지 않은 벤더들도 곧 내놓을 것이다.
여전히 움직이고 있는 기준은 인증이다. Decagon의 설명 자체가 이 점을 짚는다. 예약하고, 구매하고, 취소하고, 협상하는 개인 에이전트들이 이미 지원에 연락하고 있으며, 그런 전화를 받는 기업들은 그 에이전트가 누구를 대표하는지 확인할 확립된 방법이 없다. 승인되지 않은 요청에 완벽한 목소리는 검증된 요청에 어설픈 목소리보다 나쁘다.
그래서 향후 1년의 지원 도구를 결정할 제품은 음성 모델이 아니라 게이트웨이다. 또한 PACT 프로토콜이 그 소박한 범위보다 더 중요한 이유이기도 하다. 요청하는 주체가 소프트웨어일 때 인증의 증명이 어떤 모습이어야 하는지는 누군가 정의해야 하며, 첫 번째로 신뢰할 만한 정의가 보통 기본값이 된다.
기업이 지금 결정해야 할 것
이 변화의 불편한 점은 대부분의 기업이 미뤄 온 결정을 강제한다는 것이다. 자동화된 발신자가 무엇을 할 수 있는지, 그리고 그것이 승인되었음을 어떻게 증명할 것인지.
요청이 들어오기 전에 답해 둘 만한 세 가지 질문이 있다. 시스템이 에이전트와 사람을 구분할 수 있는가, 그리고 그것이 워크플로마다 중요한가? 가장 흔한 요청에 대해 개인 에이전트가 필요로 하는 최소 권한 집합은 무엇인가? 그리고 에이전트가 누군가를 대신해 행동할 때 승인에 대한 기록을 무엇으로 남기고, 누가 그것을 검사할 수 있는가?
이 중 어느 것도 모델에 관한 질문이 아니다. 정책에 관한 질문이며, 지원 시스템이 들어오는 에이전트를 고객으로, 위협으로, 아니면 시스템에 범주가 없는 무언가로 취급할지를 결정할 질문이다. Decagon은 배관을 깔아 놓았다. 정의는 여전히 수신 측 기업들의 몫이다.
관련 글
워터마크는 가짜를 따라가지 못하고 있다
시스템은 작동한다. 커버리지는 그렇지 않다. 격차는 시청자가 가정하는 무엇으로 채워지고 있다.
레딧, 마지막 열린 문을 닫으며 스크래퍼 탓으로 돌리다
레딧이 라이선스를 부여하지 않은 스크래퍼는 악용이다. 레딧이 라이선스를 부여한 스크래퍼는 매출이다.
영란은행, AI 부채를 금융 안정성 위험으로 공식 인식
유보 이익으로 자금을 조달한 붐은 비공개로 해소될 수 있다. 이번 붐은 4,500억 달러의 신규 부채로 굴러간다.
캘리포니아, 알고리즘의 말만으로 근로자 해고 금지
좁은 원칙이며, 공개적으로 반대하기 어려운 원칙: 사람이 그 결정을 책임져야 한다.