← 블로그로
Ai약 13 분 읽기

ElevenLabs는 음성을 해결했고, 그다음 들리는 것의 가격을 올렸다

게시일 2026년 10월 3일
ElevenLabs는 음성을 해결했고, 그다음 들리는 것의 가격을 올렸다

9월 28일, ElevenLabs는 두 개의 음성 모델을 공개했다. Eleven v4는 내레이션과 준비된 대화를 위해 만들어졌다. Eleven v4 Turbo는 실시간 대화를 위해 설계되었으며, 추론 지연 시간 중앙값이 약 100밀리초, 첫 음성 출력까지는 약 150밀리초 수준이다. 이틀 뒤, 이 회사는 직원 대상 구주 매입(tender offer)을 마무리하며 기업가치를 220억 달러로 평가했는데, 이는 2월의 110억 달러에서 두 배로 오른 수치다.

이 두 발표는 사실 같은 발표다. 음성 모델이 사람들이 지연을 눈치채지 못할 만큼 빨라지면, 남는 질문은 누가 진짜처럼 들리는가이며, 그것은 가격표가 붙은 제품의 문제다.

지연 시간은 마지막 기술적 변명이었다

음성 에이전트는 수년간 고질적인 실패 유형을 안고 있었다. 단어는 맞는데 타이밍이 틀린다. 한 박자만 길어져도 도움이 되던 비서가 사용자가 전화를 끊어버리는 대상이 되곤 했고, 해법은 늘 더 많은 하드웨어거나 더 짧은 문장이었다. Turbo의 수치는 사람이 인지하는 임계값 아래에 있다. 약 100밀리초는 일반적인 대화 사이의 간격과 비슷한 길이로, 지연이 '기계가 생각하는 중'으로 읽히지 않고 '사람이 고민하는 중'으로 읽히기 시작한다는 뜻이다.

새 아키텍처는 90개 이상의 언어를 지원하며, 이는 v3의 70개 이상에서 늘어난 것이다. 여기에는 숫자보다 중요한 세부 사항이 있다. 영어 녹음으로 복제한 음성이 원본 억양을 끌고 가지 않고 자연스러운 일본어 억양으로 일본어를 말한다. 여러 시장에 한 명의 대변인을 현지화하는 브랜드는 더 깔끔한 결과를 얻고, 캐릭터의 억양에 의존하는 픽션은 기본값이 아니라 의도적인 선택이 필요해진다.

이제 요청은 최대 10,000자까지 허용되며, 이는 이전 한도의 두 배다. [laughs], [whispers], [said angrily] 같은 인라인 발화 태그는 여전히 작동하고 중첩도 가능하다. 즉석 음성 복제(Instant Voice Clone)는 여전히 약 10초의 오디오가 필요하다.

70여 개 언어에서 90개 이상으로의 도약은, 복제된 음성이 언어들을 넘나들며 어떻게 유지되는지의 변화보다 작다. 이제 하나의 녹음으로 열두 개 시장에서 제품을 대표할 수 있으며, 각 버전이 같은 사람이 현지 억양을 흉내 내느라 애쓰는 것처럼 들리지 않는다. 한 명의 대변인을 현지화하는 회사라면, 언어마다 추가 녹음 세션이 필요했던 단계가 사라진다.

돈이 되는 곳은 표현력이다

Artificial Analysis는 v4를 표현력 부문 1위로 평가했고, ElevenLabs는 블라인드 테스트에서 청취자의 약 75%가 v4를 선호했다고 밝혔다. 두 수치 모두 회사나 협력사에서 나온 것이므로 누군가 테스트를 다시 돌리기 전까지는 마케팅으로 취급하는 게 좋다. 그래도 방향성은 시사하는 바가 있다. 이제 모든 주요 연구소가 알아들을 수 있는 음성을 만들어낼 수 있다. 차별점은 그 음성이 긴 녹음 내내 챕터마다 흔들리지 않고 톤, 속도감, 알아볼 수 있는 개성을 담아낼 수 있는지로 옮겨갔다.

상업적 그림도 다른 각도에서 같은 점을 말해준다. 대화형 에이전트 플랫폼인 ElevenAgents는 이제 ElevenLabs 매출의 55%를 차지한다. 음성은 주로 오디오북 내레이션으로 팔리는 게 아니다. 말을 하는 소프트웨어의 인터페이스 계층으로 팔리고 있다.

이러한 전환이 가격 구조를 설명한다. API 기준으로 Eleven v4는 1,000자당 0.08달러, Turbo는 0.04달러다. 둘 다 10월 12일까지 각각 0.022달러, 0.011달러로 할인된다. 예산을 세울 때는 기준 요율을 기준으로 삼아야 한다. 출시 할인은 일시적이고, 수정 사항은 글자 수를 늘리기 때문이다. Turbo에는 놓치기 쉬운 특정 제약도 하나 있다. Text to Dialogue WebSocket은 v4에서는 연결당 최대 10개의 등록 음성을 허용하지만, Turbo에서는 하나만 허용한다.

나머지 시장도 가만히 있지 않다

음성을 에이전트 인터페이스로 취급하는 곳은 ElevenLabs만이 아니다. 9월 30일, Inception Labs는 저지연 음성 에이전트를 위해 특별히 만들어진 확산 언어 모델 Mercury Voice를 출시했는데, 첫 답변 토큰까지의 중앙값 시간이 320밀리초이고 출시 당시 가격은 대화 1분당 약 0.9센트다. Suno는 음성 모델을 베타로 출시했다. Vercel은 제로 데이터 보존 조건으로 마이크로소프트의 오디오 모델을 자사 AI Gateway에 추가했다.

접근 방식은 어려운 부분을 어디에 두느냐에서 갈린다. ElevenLabs는 합성을 제품으로 취급하고 단어는 별도로 모델링한다. Inception은 언어 모델을 지연 예산 안에 끌어들이며, 뒤에 있는 모델이 생각하는 데 2초가 걸린다면 빠른 합성 계층은 쓸모가 없다고 주장한다. 둘 다 일관된 논리이며, 계속 충돌할 것이다. 음성 에이전트를 경험하는 사용자는 어느 구성 요소가 느렸는지 알 수 없기 때문이다.

불편한 부분들

복제는 의무적인 소유자 신원 확인과 유명 공인에 대한 무단 복제를 차단하는 필터로 보호된다. 그것은 합리적인 최소선이지 해결책이 아니다. 이제 10초 샘플만으로 고품질 복제가 가능하며, 누군가의 음성 10초를 가진 사람은 사실상 모두라고 해도 무리가 아니다.

어떤 필터도 다루지 못하는 2차적인 문제가 있다. 표현력이 뛰어난 모델이 특정 인물처럼 들리는 데 능숙해질수록, 검증 신호로서 음성의 가치는 무너진다. 성문(voiceprint)은 예전에는 약한 증거였지만 이제는 거의 증거가 되지 못한다. '고객의 목소리를 인식한다'는 전제 위에 본인 확인을 구축한 은행과 콜센터는 2년째 조용히 그 가정을 폐기해 왔으며, 이번 출시로 그 폐기는 더 늦출 수 없게 됐다.

지연 시간 수치도 들리는 것보다 범위가 좁다. 이는 ElevenLabs 자체 벤치마크 프로토콜에서 네트워크 지연을 제외하고 측정한 값이다. 실제 비서는 여전히 요청을 인식하고, 답변을 결정하고, 네트워크를 거쳐 전달해야 한다. Turbo는 여러 지연 원인이 있는 사슬에서 하나를 제거한 것뿐이다.

어두운 광택 표면 위에서 곡선 유리관을 통과하는 부드러운 빛의 파형, 청록색에 따뜻한 호박색 하이라이트

이 밸류에이션이 실제로 말하는 것

8개월 만에 밸류에이션을 두 배로 올린 것, 그것도 신규 프라이머리 자본이 아닌 3억 달러 규모의 세컨더리 세일을 통해서라는 사실은 유지율과, 아직 상품화되지 않은 카테고리에 대한 선언이다. 음성 모델은 사용자가 품질을 즉시 알아차리고 그 때문에 갈아타는 드문 AI 제품이다. 하이퍼스케일러와 전문 경쟁사 모두 제품을 내놓고 있고, 품질 격차는 좁혀져 왔다.

220억 달러라는 숫자 뒤에 있는 베팅은 그 격차가 과금할 수 있을 만큼 충분히 넓게 유지되고, 에이전트 플랫폼이 원시 합성 가격이 떨어지는 속도보다 더 빠르게 성장한다는 것이다. 출시 기간에 Turbo가 1,000자당 0.011달러로 내려간 것은 그 베팅의 후반부가 더 어렵다는 것을 시사한다. 음성의 한계 비용이 0에 가까워지면, 여전히 팔 수 있는 것은 다른 누구도 갖지 못한 목소리다.

음성 회사가 이 정도 밸류에이션을 유지할 수 있는 반면 이미지·영상 회사는 그렇게 하기 어려운 구조적 이유도 있다. 음성 에이전트는 모든 통화, 모든 세션에서 연속적으로 작동하므로 사용량이 일회성 생성이 아니라 제품의 성공에 따라 확장된다. 내레이션과 에이전트는 경제성이 다르다. 하나는 프로젝트이고, 다른 하나는 멈추지 않는 계량기다. ElevenLabs는 후자를 향해 만들어졌고, 매출의 55%가 그 전략이 통했음을 말해준다. 내년이 답할 질문은 품질 우위가 계량기가 계속 돌아갈 만큼 오래 살아남느냐다.

회사 스스로의 표현도 같은 방향을 가리킨다. 출시 자료는 정확도나 속도가 아니라 표현력을 앞세우는데, 그 둘은 이미 몇 번의 릴리스 전에 차별점이기를 그만두었기 때문이다. 음성 에이전트가 진짜처럼 느껴지기 위해 해야 할 일은 40분 세션 내내 머뭇거림, 강조, 일관된 정체성을 담아내는 것이며, 그것은 깔끔한 문단을 만들어내는 것보다 어려운 목표다. 그것을 해내는 모델이 반드시 글자당 가장 저렴한 모델은 아닐 것이다. 사람들이 이전에 대화해 본 적 있는 사람과 구분할 수 없는 출력을 내는 모델일 것이다. 그리고 그것은 달성될 때마다 기준이 높아지는 바다.

관련 글