Synthesia는 10년 동안 아바타를 녹화해 왔다. 이제는 그 아바타가 말을 받아치길 원한다

Synthesia는 단순한 순환 구조 위에 사업을 세웠다. 스크립트를 쓰고, 아바타를 고르면, 진행자 영상이 돌아온다. 회사 측에 따르면 이 순환 구조는 약 10년 가까이 세계 최대 기업용 영상 플랫폼을 통해 돌아갔고, 이를 통해 Synthesia는 2025년까지 연간 반복 매출(ARR) 1억 달러 이상, 기업가치 40억 달러(보도 기준)에 도달했다.
2026년 10월 1일, 그 순환의 방향이 바뀌었다. Synthesia는 사람처럼 생생한 아바타와 양방향 대화를 나눌 수 있는 플랫폼 'Sessions'를 출시했다. 같은 날 두 가지 세션 유형이 공개됐고, 세 번째 유형은 곧 출시 예정이라고 발표됐다.
Roleplay Sessions는 사용자를 의도적으로 난이도 높은 대화 속으로 밀어 넣는다. 아바타는 고객, 지원자, 또는 부하 직원 역할을 맡아 반박을 던진다. 영업팀은 니즈 파악과 이의 처리 능력을 연습한다. 관리자는 직원과 차마 꺼내지 못했던 대화를 리허설한다. 지원팀은 에스컬레이션 상황을 시뮬레이션한다. 각 시도가 끝나면 시스템은 참가자를 코칭하고 점수를 매긴다. 새로 추가된 기능을 통해 사용자는 연습 전에 시나리오를 자신의 상황에 맞게 조정할 수 있고, 기업은 반복적으로 발생하는 자사 고유의 대화에 맞춘 맞춤형 롤플레이를 직접 만들 수 있다.

Survey Sessions는 설문지를 인터뷰로 바꾼다. 아바타가 회사의 질문을 일대일로 묻고, 들은 내용에 따라 추가 질문을 던진 뒤, 구조화된 인사이트를 돌려준다. Synthesia는 직원 피드백, 고객 인사이트, 퇴사 및 이탈 인터뷰, NPS 후속 조사, 제품 리서치를 주요 용도로 제시한다. 응답은 응답자 전반에 걸친 테마와 감정으로 정리돼 돌아오며, 개별 답변은 녹취록, 오디오 파일, CSV 형태로 열어볼 수 있다.
Expert Sessions는 아직 로드맵에 남아 있는 유일한 제품이다. 회사의 제품 문서와 내부 프로세스로 학습한 아바타가 사용자가 과제를 수행하는 과정을 단계별로 안내하고, 작업 도중 생기는 질문에 답해주는 방식이다.
이런 형태의 제품이 나온 이유
Synthesia의 CTO 피터 힐(Peter Hill)이 출시 글을 썼다. 그의 논조는 기술 성공담이 아니라 인력 병목에 관한 것이다. 어려운 통화를 앞둔 모든 영업 담당자를 코칭해줄 매니저든, 모든 고객을 인터뷰할 리서처든, 막힌 모든 사용자를 안내할 제품 전문가든, 적합한 사람은 언제나 부족하다. 그 자리를 대신 채우는 것은 리허설 대신 녹음, 인터뷰 대신 설문지, 직접 안내 대신 도움말 문서다.
힐의 이력은 이 주장을 여느 출시 글보다 훨씬 진지하게 받아들이게 만든다. 그는 Amazon과 AWS에서 거의 25년을 보내며 Kindle, Fire, Alexa와 Amazon Connect, WorkSpaces 등의 서비스를 이끈 팀을 총괄했고, 이후 Wildlife Studios에서 CEO 겸 CPO를 지냈다. 대화형 시스템을 대규모로 출시해 본 사람이다.
Synthesia가 공개하기로 한 초기 데이터는 빈약하지만 핵심을 찌른다. 초기 도입 사례 전반에서 학습자의 78%가 롤플레이를 두 번 이상 시도했고, 다시 돌아온 사람들 중 83%는 이후 시도에서 점수가 향상됐다. 이 숫자는 곰곰이 읽어볼 필요가 있다. 중요한 수치는 개선율이 아니다. 개선율은 스스로 돌아오기로 선택한 하위 집단에서 측정된 값이다. 중요한 것은 78%라는 재시도율이다. 사람들이 자발적으로 반복하는 교육 도구는 누군가 배정해서 마치는 도구와는 다른 제품이다.
Synthesia는 또한 주제별 인사이트가 누가 가장 높은 점수를 받았는지만 보여주는 게 아니라 어떤 역량이 성과를 이끄는지를 보여주기 위한 것이라고 말한다. 또 각 직원은 자신의 부족한 부분을 메울 수 있는 롤플레이를 추천받는다. 이는 리포팅에서 진단으로의 전환이며, 학습·개발(L&D) 팀이 실제로 평가하게 될 부분이 바로 여기다.
두 가지 경로, 그리고 이 분리가 중요한 이유
Synthesia는 같은 기능을 두 가지 방식으로 판매한다. Interactive Avatar API는 자체 아바타 제품을 만들고 스택을 직접 통제하려는 기업을 위한 것이다. Sessions는 일상적인 업무를 구성하는 대화를 위한 완성형 플랫폼이다. 회사는 이 API를 호스팅형 파이프라인이라고 설명하는데, 이는 팀이 렌더링 스택을 직접 운영하지 않고도 자체 언어 모델, 음성-텍스트 변환, 텍스트-음성 변환을 가져와 쓸 수 있다는 뜻이다.
이 분리는 겉보기보다 흥미롭다. 이미 선호하는 모델 제공업체가 있는 기업은 어느 것을 쓰라고 지시받기를 원하지 않고, 통합 작업을 할 의욕도 인력도 없는 기업은 아무것도 직접 만들고 싶어 하지 않는다. 두 가지를 모두 제공함으로써 Synthesia는 단일 고객상(프로필)을 골라야 하는 문제에서 벗어난다. 세션 출시 당일 풀스택 API 연동이 함께 열렸다는 점은, 회사가 API를 시간이 갈수록 더 조용하지만 더 큰 사업으로 보고 있다는 신호로 읽힌다.
컴플라이언스 세부 사항도 짚어볼 만하다. 이 제품은 직원 대화와 고객 인터뷰에 관여하기 때문에 녹음, 녹취록, 개인정보가 오간다. Synthesia는 SOC 2 Type II, ISO 27001, 27701, 42001과 GDPR 준수를 명시하고 있다.
이번 출시가 해결하지 못한 것
이번 발표의 이면에는 세 가지 질문이 깔려 있다.
첫째, 상호작용 품질이 데모 밖에서도 유지되는가다. 롤플레이는 아바타의 반박이 현실적이고 다양할 때만 기술 전이를 만들어낸다. 너무 쉽게 동의하는 아바타는 아무것도 가르쳐주지 못하고, 정해진 대로만 따지는 아바타는 두어 번 시도하면 티가 난다. Synthesia는 자사 롤플레이 상대가 시나리오 전반에서 어떻게 작동하는지에 대한 독립적 평가를 공개하지 않았으며, 제시한 도입 수치는 학습 성과가 아니라 반복 사용을 보여줄 뿐이다.
둘째는 기록 보관 문제다. 직원의 연습 시도에 붙은 점수는 AI가 생성해 기업 시스템에 저장되고 관리자에게 보일 수도 있는, 한 개인에 대한 데이터다. 학습자의 78%가 돌아왔다는 건 보도자료에서는 건강해 보인다. 하지만 이는 대부분의 참가자가 자신이 서툴게 처리한 대화에 대한 점수 기록을 남겼다는 뜻이기도 하다. 그 기록이 어디에 저장되고, 누가 볼 수 있으며, 얼마나 보관되는지는 모든 구매자가 내려야 할 정책 결정이며, 예컨대 세일즈 인에이블먼트 팀과 HR 부서 사이에는 답이 크게 갈린다.
셋째는 희소성이 이 제품의 전제 그 자체인 인간 전문가들에게 무슨 일이 일어나는가다. 훈련된 아바타가 반복적인 대화를 사람 통화 비용의 일부만으로 흡수할 수 있다는 Synthesia의 주장이 맞다면, 진짜 사람이 필요한 코칭의 순간은 오히려 비싼 것이 된다. 이는 회사의 고객에게는 합리적인 거래다. 동시에 어떤 업무부터 자동화되는지에 대한 이야기이기도 하다는 점은 피할 수 없다.
이것이 기업용 AI에 남기는 것
Sessions는 아바타 제품을 콘텐츠 생성에서 워크플로로 옮겨놓았다는 점에서 유용한 이정표다. 일방향 아바타 영상은 카메라, 스튜디오, 마감 시한과 경쟁한다. 양방향 아바타는 관리자의 캘린더와 경쟁하며, 이제 비교 기준은 제작 비용이 아니다. 조직이 하루에 수천 건의 연습 대화를 돌리고 그 결과를 남길 수 있는지의 문제다.
Synthesia의 베팅은 대부분의 조직이 그럴 수 없다는 것, 그리고 말을 받아치는 아바타가 사람을 채용하는 것보다 저렴한 답이라는 것이다. 상호작용 품질이 그 대체를 정당화할 수준인지는 앞으로 1년의 도입 사례가 보여줄 것이다. 반복 사용률은 유망한 출발 신호다. 하지만 그것이 그 연습 덕분에 누군가가 일을 더 잘하게 됐다는 증거는 아직 아니다.
관련 글
Step 5, 버전 번호 네 개를 건너뛰고 오픈 모델 2위에 올랐지만 아무도 호출하지 않는다
벤치마크 위치는 생산자가 모델을 판단하는 데 쓰는 신호다. 호출량은 소비자가 사용함으로써 만들어내는 신호다.
Gemini Omni 1.1 Flash는 네 번의 요청을 연결해 40초짜리 샷을 만들었다. 제품은 바로 워크플로다.
Google은 가격표에 검수 관문을 내장한 제작 파이프라인을 내놓았다.
마이크로소프트가 부분 전사 지연 시간을 100밀리초로 줄였다. 이것은 전사의 용도를 바꾼다.
100밀리초 아래에서는 전사 제품이 누군가 아직 말하는 동안에도 반응할 수 있습니다.
문장 쓰기를 거부하는 모델, 이제 하루에 1조 토큰을 처리하다
훨씬 나은 인터페이스를 갖춘 분류기로, 소프트웨어가 이미 구조화되기를 원했던 작업을 겨냥한다.