두 음성 모델이 방금 기준을 새로 세웠다: 첫 오디오까지 50ms, 노트북 CPU에서 구동되는 99M 모델

같은 주에 공개된 두 가지 음성 합성 릴리스는 서로 반대 방향에서 같은 결론을 가리킨다. 하나는 지연 시간을 사람이 인지할 수 있는 한계까지 좇았다. 다른 하나는 크기를 노트북 메모리에 담을 수 있는 수준까지 줄였다. 이 둘을 함께 보면 텍스트 음성 변환 경쟁이 얼마나 빠르게 '사람처럼 들리는가'에서 '어디에 맞춰 넣을 수 있는가'로 이동했는지 알 수 있다.
첫 번째는 음성 스타트업 Gradium의 것으로, 첫 오디오까지 약 50밀리초가 걸리는 TTS 모델을 발표했다. 회사 측은 이것이 프런티어 TTS 모델 중 가장 낮은 지연 시간이라고 말한다. 두 번째는 Supertonic으로, 9,900만 개 파라미터를 가진 오픈소스 모델이며 노트북 CPU에서 로컬로 실행되고 1초 이내에 스튜디오 품질의 오디오를 생성한다. 또한 회사 테스트에서 ElevenLabs, OpenAI, Gemini TTS가 같은 입력에서 모두 실패한 전화번호와 기타 어려운 텍스트를 올바르게 발음했다.
왜 첫 오디오 지연 시간이 핵심 지표인가
음성 비서에서 중요한 숫자는 전체 클립을 렌더링하는 데 걸리는 시간이 아니라 첫 소리가 사용자에게 도달하기까지 얼마나 걸리는가다. 말하기 전에 0.3초를 멈추는 대화형 에이전트는 이미 느리게 느껴진다. 50밀리초를 해내는 에이전트는 평범한 주고받기의 리듬을 유지한다. 이러한 임계값 때문에 프런티어 가격 등급, 실시간 음성 모델의 끼어들기 처리, 지연 시간 주장이 모두 같은 0.1초대에 몰려 있다.

더 작은 모델은 그 범위에 더 쉽게 도달하며, 이것이 정직한 트레이드오프다. CPU에서 실행되는 99M 파라미터 모델은 프런티어 클라우드 모델의 표현력을 포기하는 대신 그 모델이 제공할 수 없는 것들을 얻는다. 네트워크 왕복이 없고, 호출당 비용이 없고, 오디오가 기기를 떠나지 않으며, 이미 책상 위에 놓여 있는 기기에서 예측 가능한 동작을 보인다.
어려운 텍스트 문제는 사전 문제다
전화번호에 관한 Supertonic의 결과는 더 조용한 실패를 가리킨다. 합성 모델은 평범한 문장은 잘 처리하지만, 올바른 읽기가 문맥이나 관례에 달려 있는 문자열에서는 넘어진다. 전화번호, 제품명, 주소, 약어는 일상적으로 뒤죽박죽으로 나오며, 그래서 데모에서 고전적인 실패 사례가 된다.
세 번째 릴리스는 다른 각도에서 이 문제에 접근한다. Onepin은 모델이 아니라 합성 이후의 품질 보증 단계로 자리매김한다. 약 400만 단어의 발음 사전과 대조해 생성된 모든 줄을 검사하며, 이름과 제품을 포함하고, 자연스러움과 정확성을 점수화하며, 잘못 발음된 단어 하나를 전체 줄을 다시 생성하지 않고 고친다. 긴 오디오를 제작하는 팀에게 5분짜리 세그먼트를 다시 렌더링하는 대신 단어 하나를 수리할 수 있다는 것은 비용 곡선의 실질적인 변화다.
사전 접근법은 또한 그동안 융합되어 있던 두 가지 작업을 분리한다. 모델은 운율, 감정, 흐름을 담당한다. 검사기는 일반 모델이 결코 안정적으로 발음할 수 없었던 유한한 고유명사 집합을 담당한다. 이러한 분리는 미미하게 더 나은 인코더보다 더 유용하다.
네 번째 모델이 스트리밍 기준을 보여준다
120M 모델인 Sopro V2 Turbo는 복제된 음성에서 거칠음과 끊김을 해결하는 빌드를 준비 중이다. 노트북 CPU에서 첫 오디오까지 약 300밀리초, 진정한 스트리밍, Apache 2.0 라이선스, 영어·유럽 포르투갈어·프랑스어·독일어 지원을 내세운다. 저자는 얇거나 만화 같은 목소리, 잡음이 많은 참조 클립, 일부 분포 밖 화자는 여전히 실패한다고 솔직히 말하며 그러한 사례를 수집해 왔다.
네 가지를 모두 가로질러 읽으면 프런티어는 뚜렷한 갈래로 나뉘었다. 클라우드 모델은 표현력과 다국어 지원을 계속 밀어붙인다. 작은 모델은 온디바이스 영역을 차지하는데, 여기서는 지연 시간, 프라이버시, 한계 비용 제로가 자연스러움의 마지막 몇 퍼센트보다 더 중요하다. 그리고 어느 갈래도 혼자서 잘 처리하지 못하는 오류를 잡아내는 미들웨어 계층이 등장하고 있다.
도입 전에 무엇을 측정해야 하는가
이 범주의 지연 시간과 크기 주장은 거의 항상 공급업체가 보고한 것이므로, 실용적인 테스트는 여러분 자신의 입력이다. 데모를 망가뜨리는 이름과 숫자를 포함해 실제로 필요한 텍스트로 모델을 실행하라. 공급업체의 벤치마크 머신이 아니라 실제로 배포할 하드웨어에서 첫 오디오까지의 시간을 측정하라. 그리고 라이선스가 생각하는 배포를 허용하는지 확인하라. 로컬 모델의 경우 라이선스가 결정적 제약인 경우가 많다.
이 릴리스들에 걸친 패턴은 1년 전 이미지 모델에서 익숙한 것이다. 품질이 수렴한 뒤 경쟁은 모델이 어디에서 실행되는지, 얼마나 빨리 시작하는지, 호출당 비용이 얼마인지로 이동했다. 음성도 이제 그 단계에 있다. 가장 잘 들리는 모델은 사용자가 멈춤을 알아차리기 전에 말하기 시작하는 모델보다 덜 중요하다.
프런티어 음성 모델은 대신 어디를 바라보는가
지연 시간 경쟁은 다른 흐름과 동시에 일어나고 있으며, 둘은 혼동될 수 있다. 끼어들 수 있고 대화 중간에 도구를 호출할 수 있는 추론 가능한 음성 시스템 같은 프런티어 실시간 모델은 전화 통화에서 사람과 이야기하는 듯한 대화를 유지하는 능력을 좇는다. 그러려면 의도를 이해하고, 언제 말할지 결정하고, 끊기는 상황을 처리해야 하는데, 이는 원시 합성 속도와는 다른 축의 어려운 문제다.
하지만 대부분의 애플리케이션에서 고급 대화 계층은 과하다. 영상 내레이션, 제품 설명 내레이션, 잠자리 동화에는 좋은 발음, 여러 테이크에 걸친 일관된 스타일, 예측 가능한 비용이 필요하다. 이런 요구는 채팅 루프가 붙은 프런티어 시스템보다 작고 빠른 모델이 더 잘 충족한다. 그래서 사전 녹음 오디오에서는 온디바이스 합성이 기본이 되어 가고, 클라우드는 실시간 대화의 본거지로 남는다.
같은 영역을 잡아당기는 규제 흐름도 있다. 청취자와 플랫폼이 합성 오디오를 구별할 수 있도록 표시하는 것이 더 많은 관할권에서 요구 사항이 되고 있으며, 음성 복제는 자체적인 법원 판결 물결을 불러일으켰다. 샘플을 절대 업로드하지 않는 로컬 모델은 그러한 노출의 일부를 피하는 반면, 음성을 복제하는 클라우드 모델은 이를 떠안는다. 음성 기능을 출시하는 팀에게 합성이 어디에서 실행되는지 선택은 지연 시간만큼이나 규정 준수 결정이 되고 있다.
실용적인 체크리스트
공급업체의 데모 텍스트가 아니라 자신의 스크립트로 후보를 테스트하고, 일반 모델을 망가뜨리는 이름, 약어, 숫자를 포함하라. 실제로 사용할 하드웨어에서 첫 오디오까지의 시간을 측정하라. 노트북 CPU 결과와 데이터 센터 결과는 비교할 수 없기 때문이다. 라이선스가 상업적 사용과 원하는 배포 형태를 포괄하는지 확인하라. 오픈 모델의 경우 라이선스가 선택을 결정하는 제약인 경우가 많다. 그리고 합성 후 QA 단계가 필요한지 일찍 결정하라. 단어의 95%를 올바르게 발음하는 모델도 고객에게 중요한 바로 그 브랜드 이름 하나에서는 실패할 것이기 때문이다.
이 네 가지 릴리스 중 어느 것도 그 자체로 돌파구는 아니다. 함께 읽으면, 합성 음성이 실제처럼 들리는지를 두고 논쟁하기를 멈추고 제작 팀이 실제로 신경 쓰는 조건—얼마나 빠른지, 얼마나 작은지, 얼마나 저렴한지—으로 경쟁하기 시작한 분야를 보여준다. 그것이 성숙해 가는 도구의 모습이다.
관련 글
AI 비디오 가격 전쟁: Luma, Seedance 요금 최대 73% 인하하고 Runway는 경쟁사 모델 판매 시작
이제 엔진들은 서로 충분히 비슷해서 리더보드보다 청구서가 더 나은 길잡이다.
2억 6천만 파라미터 이미지 모델, 같은 블록 반복으로 6.5배 큰 경쟁 모델을 앞서다
파라미터를 더하는 것은 여전히 효과가 있다. 더 활발한 작업은 주어진 모델이 더 적은 것으로 더 많은 일을 하게 만드는 것이다.
문샷의 Kimi K2.6, 한 번에 천 개의 에이전트를 구동하며 10시간 만에 컴파일러 구축
각각 감독이 필요한 천 개의 에이전트는 역량이 아니라 감독 부담을 천 배로 늘린다.
오라클이 에이전트 오케스트레이션을 ERP 안에 넣었다, 그리고 그것은 거버넌스의 계산법을 바꾼다
에이전트 역량은 더 이상 헤드라인이 아니다. 이제 헤드라인은 기업이 사후에 자사 에이전트가 정확히 무엇을 했는지 입증할 수 있는지다.