← 返回部落格
Ai預計閱讀 9 分鐘

Suno 現在會說話,還自帶專屬配樂

發布於 2026年10月2日
Suno 現在會說話,還自帶專屬配樂

10 月 1 日,Suno 向網頁、iOS 和 Android 上的所有使用者開放了 Speech 公開測試版。你輸入一個想法、一首詩,或你已經寫好的腳本,然後描述你想要的聲音,以及底下的音樂氛圍。Speech 會把兩者回傳成單一音軌。

Suno 首席產品長 Jack Brody 在公告中將其描述為第一個能將語音與音樂一起生成為單一連貫音軌的音訊模型。這個定位就是整個產品。許多工具能產生合成語音,也有許多工具能產生音樂。這裡的賣點在於,節奏與氛圍會在兩者生成時就與意義相互匹配,而不是事後在編輯器裡硬湊在一起——那正是每個業餘播客片頭葬身之處。

其運作機制刻意保持簡單。簡單模式接受自然語言提示,例如「一名船長在暴風雨前激勵船員」,並同時生成語音與配樂。進階模式接受精確腳本,並提供控制項,可調整聲音性別、人聲風格、節奏,以及每次生成應有多少變化。若你只想要乾淨的旁白,也有切換開關可完全去掉音樂。測試版將單次生成限制在約八分鐘。

這裡的 beta 意味著什麼

Suno 對這個東西的現狀異常坦率。Brody 的說明提到,英國口音偶爾會飄到澳洲再飄回來,而戲劇性停頓也可能非常戲劇化。這種揭露在發表文章中比應有的更罕見,也透露出語音建模目前仍處在什麼階段。

該公司也沒有列出支援的語言,這表示英語以外的表現未經驗證,除非你親自試用。考量到 Suno 現有受眾遍及全球,在語音產品發布中缺少語言清單,與其說是疏忽,不如說是一種訊號。聲音複製在英語中已經很難,在聲調系統更豐富的語言中更難,而 Suno 在還無法承諾太多之前就先推出了。

也沒有提到定價方案、生成限制,或音訊的商業權利。這些都藏在方案細節裡,而任何打算用 Speech 做客戶案的人,都應該仔細閱讀,尤其考量到 Suno 的過往紀錄。

授權的轉向

Suno 過去一年是從爬取到簽約的緩慢轉向。9 月 9 日,它發布了 v6,這一代音樂模型是與華納音樂集團、BMG 和 Believe 合作打造。這個系列有三部分:旗艦款 v6、面向 Pro 與 Premier 訂閱者的探索型 v6-wild,以及所有人都能使用的 v6-mini。Suno 表示,v6 能用白話文編輯現有歌曲的一部分、在單一請求中用多個來源建立混搭、隔離音訊來製作新節拍、從文字、音訊、圖像和影片創作音樂,以及改寫單一句歌詞而不必重建整首歌。隨著 v6 推出,該公司計畫淘汰較舊的模型,並將平台完全轉移到新一代。

這是真正的能力升級,同時也是一種法律策略。授權協議讓 Suno 從被告變成合作夥伴,而該公司說正在打造、由藝人選擇加入並獲得報酬的選擇加入式藝人體驗,正是一家想停止被起訴的企業所形塑出的樣貌。

訴訟並未停止。索尼音樂與環球音樂集團以著作權侵權為由起訴 Suno,而在 2026 年 9 月,這些唱片公司擴大了案件,指控其「模型洗白」:使用較舊、涉嫌侵權的模型來生成合成音訊,以訓練更新的模型。這比用爬取來的歌曲進行訓練更為尖銳,因為它描述的是一條侵權鏈,即使公司聲稱已經清理乾淨,這條鏈仍會持續下去。

與此同時,執行長 Mikey Shulman 在 Speech 發布同一天告訴彭博社,Suno 已遠遠超過上次報告的 200 萬訂閱者和 3 億美元營收。一家這麼大的公司擴展到語音領域,做的不只是增加一項功能。它正在建立一個由單一訂閱提供的生成式音訊工具組合,讓客戶更沒有理由離開。

這壓縮了哪些人的工作

對一項新工具來說,正確的問題不是它能做什麼,而是它取代了誰的工作。從 Suno 回報的一個月私人測試用途來看,有四類人會立刻感受到影響。

短影音創作者最明顯適用。一段音樂標誌性開場、片段之間的轉場、結尾音效:這些過去需要作曲家和錄音場次才能完成的素材,現在一次生成就能產出。這種壓縮是真實的,因為舊流程有一個硬步驟,必須由人類把音軌和腳本搭配起來,而那個步驟現在已經內建在模型裡。

播客創作者也能得到某種版本。一段有原創音樂鋪底的旁白,原本是兩個部分的問題,現在合而為一,而關閉音樂的切換開關意味著,當客戶需要乾淨朗讀時就能取得。

第三類比較不明顯,而且可能更大。Suno 回報的測試案例大量偏向個人與半個人內容:戲劇化朗讀朋友的簡訊、配上史詩配樂的語音備忘錄、引導式冥想、激勵喊話,以及給團隊自己孩子的床邊故事。這和 Suno 歌曲生成器走過的模式相同。它先成為生日和內部笑話的固定班底,之後才成為製作工具,而該公司正把 Speech 放在同一條路線上,稱這個類別為創意娛樂。

競爭者早已在場。ElevenLabs 自 2023 年以來一直主導語音合成,Adobe 有文字轉語音工具,而 Google DeepMind 研究語音已有十年。Suno 的優勢不是語音品質——測試版的注意事項顯示它在這方面落後於領導者——而是配對:一個提示、一次完成,口說文字與原創音樂就已經彼此契合。

尚未解決的部分

Suno 的產品故事與法律故事之間的落差,正是有趣之處。Speech 擴大了平台能製作的內容,也擴大了平台可能被指控製作的內容。一款能依照使用者選擇的風格產生旁白的語音工具,距離冒名模仿並不遠,而一個在生成語音的同時生成音樂的模型,也繼承了音樂部門早已爭論不休的所有訓練資料問題。

Suno 到目前為止的答案是交易與揭露。它已與唱片公司簽約、為上傳的音訊與歌詞加入審查,並承諾提供附報酬的藝人選擇加入機制。這比大多數生成式音訊公司做得更多。但這也不是一個已定案的答案,因為模型洗白的指控若成立,描述的將是 Suno 自家訓練歷史內部的問題,而不是邊緣問題。

Speech 做得好的地方,是移除了一個過去需要兩位專家和預約錄音場次的步驟。它沒有做到的,是解決其背後模型是否按照公司現在所說的方式打造。這兩個問題會並行持續下去,而其中只有一個能藉由使用產品得到答案。

相關文章