Suno가 이제 말한다, 그리고 자신만의 사운드트랙을 함께 가져온다

10월 1일, Suno는 웹, iOS, Android의 모든 사용자를 대상으로 Speech를 공개 베타로 열었다. 아이디어, 시, 또는 이미 작성한 대본을 입력한 다음, 원하는 목소리와 그 아래에 깔릴 음악적 분위기를 설명하면 된다. Speech는 이 둘을 하나의 트랙으로 반환한다.
Suno의 최고제품책임자(CPO) Jack Brody는 발표에서 이것을 목소리와 음악을 하나의 응집력 있는 트랙으로 함께 생성하는 최초의 오디오 모델이라고 설명했다. 그 규정 자체가 이 제품의 전부다. 합성 음성을 만들어내는 도구도 많고, 음악을 만들어내는 도구도 많다. 여기서 내세우는 점은 리듬과 분위기가 생성되는 동안 의미에 맞춰진다는 것이지, 나중에 편집기에서 볼트로 조립되는 것이 아니라는 것이다. 아마추어 팟캐스트 인트로가 죽는 곳이 바로 그 편집기다.
작동 방식은 의도적으로 단순하다. 간단 모드는 "폭풍 전에 선원들을 독려하는 선장" 같은 자연어 프롬프트를 받아 음성과 음악을 모두 생성한다. 고급 모드는 정확한 대본을 받고, 음성 성별, 보컬 스타일, 속도, 그리고 각 생성물이 얼마나 다양해야 하는지를 제어할 수 있게 해준다. 깔끔한 내레이션만 원한다면 음악을 완전히 빼는 토글도 있다. 베타에서는 한 번 생성이 약 8분으로 제한된다.
여기서 베타가 의미하는 것
Suno는 이 물건의 현재 상태에 대해 이례적으로 솔직하다. Brody의 메모에 따르면 영국식 억양이 때때로 호주로 갔다가 돌아올 수 있고, 극적인 멈춤은 매우 극적일 수 있다고 한다. 이런 종류의 공개는 출시 게시물에서 있어야 할 것보다 더 드물며, 음성 모델링이 아직 어디에 있는지를 말해준다.
회사는 지원 언어도 명시하지 않았는데, 이는 영어 이외의 성능이 직접 시도해보기 전까지 검증되지 않았음을 의미한다. Suno의 기존 사용자층이 글로벌하다는 점을 고려하면, 음성 출시에서 언어 목록이 없는 것은 실수가 아니라 신호다. 음성 복제는 영어에서도 어렵고, 성조 체계가 더 풍부한 언어에서는 더 어렵다. 그리고 Suno는 많은 것을 약속할 수 있기 전에 먼저 출시하고 있다.
가격 등급, 생성 한도, 또는 오디오의 상업적 권리에 대해서도 아무 말이 없었다. 그것들은 요금제 세부사항에 들어 있으며, Speech를 클라이언트 작업에 사용하려는 사람은 Suno의 이력을 고려해 주의 깊게 읽어야 한다.
라이선스 전환
Suno의 지난 한 해는 스크래핑에서 계약으로의 느린 전환이었다. 9월 9일, Suno는 Warner Music Group, BMG, Believe와 함께 구축한 음악 모델 세대인 v6를 출시했다. 이 패밀리는 세 부분으로 구성된다: 플래그십 v6와 Pro 및 Premier 구독자를 위한 탐색 지향 v6-wild, 그리고 모든 사용자를 위한 v6-mini다. Suno에 따르면 v6는 평범한 언어를 사용해 기존 곡의 일부를 편집하고, 한 번의 요청으로 여러 소스에서 매시업을 만들고, 오디오를 분리해 새로운 비트를 만들고, 텍스트, 오디오, 이미지, 비디오에서 음악을 생성하고, 전체 곡을 다시 만들지 않고 가사 한 줄을 다시 쓸 수 있다. v6가 출시됨에 따라 회사는 이전 모델을 은퇴시키고 플랫폼을 완전히 새 세대로 옮길 계획이다.
이는 실제 기능 업그레이드이자 법적 전략이기도 하다. 라이선스 계약은 Suno를 피고에서 파트너로 바꾸며, 회사가 구축하고 있다고 말하는 옵트인 아티스트 경험, 즉 아티스트가 참여를 선택하고 대가를 받는 방식은 고소당하는 것을 멈추고 싶어 하는 비즈니스의 형태다.
소송은 멈추지 않았다. Sony Music과 Universal Music Group은 Suno를 저작권 침해로 고소했고, 2026년 9월 레이블들은 모델 세탁 혐의로 사건을 확대했다: 더 오래된, 침해 혐의가 있는 모델을 사용해 새로운 모델 훈련용 합성 오디오를 생성했다는 것이다. 이는 스크래핑한 곡으로 훈련했다는 주장보다 더 날카로운 주장인데, 회사가 정리했다고 말한 이후에도 계속되는 침해 사슬을 묘사하기 때문이다.
한편, CEO Mikey Shulman은 Speech 출시와 같은 날 Bloomberg에 Suno가 마지막으로 보고한 200만 구독자와 3억 달러 매출을 훨씬 넘어섰다고 말했다. 그렇게 큰 회사가 음성으로 확장하는 것은 기능을 하나 추가하는 것 이상을 하고 있는 것이다. 고객이 떠날 이유를 줄이기 위해 하나의 구독 아래 생성형 오디오 도구 포트폴리오를 구축하고 있다.
이것이 누구의 일을 압축하는가
새로운 도구에 대한 올바른 질문은 그것이 무엇을 하는가가 아니라 누구의 일을 대체하는가다. Suno가 한 달간의 비공개 테스트에서 보고한 사용 사례를 보면, 네 그룹이 즉시 체감한다.
숏폼 영상 제작자가 가장 확실히 맞는다. 음악적 시그니처 인트로, 세그먼트 간 전환, 마무리 스팅: 예전에는 작곡가와 세션을 필요로 했던 자산이 이제 한 번의 생성으로 나온다. 압축은 실제로 일어난다. 예전 파이프라인에는 사람이 트랙을 대본에 맞추는 어려운 단계가 있었고, 그 단계가 이제 모델 안에 들어갔기 때문이다.
팟캐스터도 해당 버전을 얻는다. 오리지널 음악이 깔린 내레이션 세그먼트는 두 부분으로 나뉜 문제였는데 이제 하나가 되었고, 음악 끄기 토글은 클라이언트가 필요로 할 때 깔끔한 낭독을 제공할 수 있음을 의미한다.
세 번째 그룹은 덜 분명하고 아마도 더 클 것이다. Suno가 보고한 테스트 사례들은 개인적이고 반쯤 개인적인 콘텐츠에 크게 기울어 있다: 친구의 문자 메시지를 극적으로 낭독하기, 웅장한 음악이 깔린 음성 메모, 명상 가이드, 격려 연설, 그리고 팀 자녀들을 위한 잠자리 이야기 등이다. 이는 Suno의 노래 생성기가 따랐던 것과 같은 패턴이다. 그것은 생산 도구가 되기 전에 생일과 내부 농담의 필수 요소가 되었고, 회사는 Speech를 같은 방향에 위치시키며 이 범주를 창의적 엔터테인먼트라고 부르고 있다.
경쟁자들은 이미 방 안에 있다. ElevenLabs는 2023년부터 음성 합성을 지배해 왔고, Adobe는 텍스트 음성 변환 도구를 가지고 있으며, Google DeepMind는 10년 동안 음성을 연구해 왔다. Suno의 강점은 음성 품질이 아니다. 베타의 주의 사항들은 그것이 선두주자들보다 뒤처져 있음을 시사한다. 강점은 조합이다: 하나의 프롬프트, 하나의 테이크, 이미 서로 어울리는 말과 오리지널 음악.
해결되지 않은 부분
Suno의 제품 이야기와 법적 이야기 사이의 간극이 흥미로워지는 지점이다. Speech는 플랫폼이 만들 수 있는 것을 넓히고, 플랫폼이 만들었다고 고발당할 수 있는 것도 넓힌다. 사용자가 선택한 스타일로 내레이션을 생성하는 음성 도구는 사칭에 가깝고, 음성과 함께 음악을 생성하는 모델은 음악 쪽이 이미 싸우고 있는 훈련 데이터에 관한 모든 질문을 물려받는다.
Suno의 지금까지의 답은 계약과 공개다. 레이블들과 계약하고, 업로드된 오디오와 가사에 대한 검열을 추가했으며, 대가를 지불하는 아티스트 옵트인을 약속했다. 이는 대부분의 생성형 오디오 회사가 한 것보다 더 많다. 그러나 이것 역시 확정된 답은 아니다. 모델 세탁 주장이 사실로 밝혀진다면, 그것은 Suno의 주변부가 아니라 Suno 자체 훈련 이력 내부의 문제를 묘사하기 때문이다.
Speech가 잘하는 것은 예전에 두 명의 전문가와 세션 예약이 필요했던 단계를 제거하는 것이다. Speech가 하지 않는 것은 그 뒤에 있는 모델들이 회사가 이제 말하는 방식으로 구축되었는지를 해결하는 것이다. 이 두 질문은 계속 나란히 진행될 것이며, 제품을 사용함으로써 답을 얻을 수 있는 것은 그중 하나뿐이다.
관련 글
Agility Digit 5, 단순한 스펙 시트가 아닌 안전성 입증 자료와 함께 출시되다
창고 현장은 실험실이 아니다. 관문은 인증이지 데모가 아니다.
프론티어 에이전트가 연구 워크플로의 30퍼센트를 완료했다. 그 숫자가 핵심이다.
에이전트는 연구를 운영할 수 있다. 절차를 새로 고안하는 일은 아직 요원하다.
Figure AI, 판매할 제품도 없이 35억 달러어치 컴퓨팅을 확보하다
베팅의 핵심은 일반화가 컴퓨팅 문제라는 것이다. 업계는 아직 결론을 내리지 못했다.
OpenAI, 마침내 이미지 API에 투명 배경 추가
파이프라인에서 한 단계를 통째로 없애는 작은 기능.