← 返回博客
Ai预计阅读 10 分钟

Suno 开口说话了,还自带配乐

发布于 2026年10月2日
Suno 开口说话了,还自带配乐

10 月 1 日,Suno 面向网页端、iOS 和 Android 的所有用户开放了 Speech 公开测试版。你输入一个想法、一首诗,或者一份已经写好的脚本,再描述你希望它用什么嗓音、配什么样的音乐氛围。Speech 会把两者合成一条音轨输出。

Suno 首席产品官 Jack Brody 在公告中称,这是首个将人声与音乐作为一条完整音轨同步生成的音频模型。这句话就是这款产品的全部卖点。市面上有大量工具能合成人声,也有大量工具能生成音乐。这里的差别在于,节奏与情绪在生成过程中就与语义相匹配,而不是事后在编辑器里硬拼到一起——那正是业余播客片头翻车的地方。

机制被刻意设计得很简单。Simple 模式接受自然语言提示,比如“一位船长在暴风雨前为船员鼓劲”,然后同时生成语音和配乐。Advanced 模式接受精确的脚本,并开放对声音性别、人声风格、语速节奏,以及每次生成多样性程度的控制。如果你只想要干净的人声旁白,还有一个开关可以把音乐完全去掉。测试版单次生成时长上限约为八分钟。

测试版在这里意味着什么

Suno 对这款产品的现状坦率得少见。Brody 的说明里提到,英式口音偶尔会飘到澳大利亚再飘回来,戏剧性停顿可能会非常戏剧化。这种披露在发布公告里本应常见,实际却很少见,它也透露出语音建模目前所处的位置。

公司也没有列出任何支持的语言,这意味着英语之外的表现未经验证,得自己去试。考虑到 Suno 现有用户遍布全球,在一款语音产品的发布中缺席语言列表,这更像是一个信号,而不是疏忽。声音克隆在英语里已经很难,在声调系统更丰富的语言里更难,而 Suno 选择在自己还无法承诺太多的时候就先发布。

关于定价档位、生成次数限制,或音频的商业使用权,公告也只字未提。这些内容藏在套餐详情里,任何打算用 Speech 接客户项目的人都该仔细读一读,尤其是考虑到 Suno 过往的记录。

授权的转向

过去一年,Suno 一直在缓慢地从“抓取”转向“签约”。9 月 9 日,它发布了 v6,这是与华纳音乐集团、BMG 和 Believe 合作打造的一代音乐模型。该系列包含三部分:旗舰版 v6,面向 Pro 和 Premier 订阅者、偏探索用途的 v6-wild,以及面向所有人的 v6-mini。Suno 表示,v6 可以用自然语言编辑歌曲的某一部分,在一次请求中用多个素材做 mashup,分离音频来构建新的节拍,从文本、音频、图像和视频生成音乐,还可以在不重做整首歌的情况下改写一句歌词。随着 v6 的铺开,公司计划让旧模型退役,把整个平台迁移到新一代模型上。

这确实是一次实打实的能力升级,同时也是一项法律策略。这些授权协议把 Suno 从被告变成了合作伙伴,而公司称正在构建的艺术家自愿加入机制——艺术家选择参与并获得报酬——正是一家想不再被起诉的公司的样子。

诉讼并没有停止。索尼音乐和环球音乐集团以侵犯版权起诉了 Suno,而在 2026 年 9 月,这些唱片公司扩大了案件,指控其“模型洗白”:用较旧的、涉嫌侵权的模型生成合成音频,用来训练更新的模型。这比“用抓来的歌曲训练”更严厉,因为它描述的是一条在公司宣称已清理干净之后仍在延续的侵权链条。

与此同时,CEO Mikey Shulman 在 Speech 发布当天对 Bloomberg 表示,Suno 早已远超其上次公布的 200 万订阅用户和 3 亿美元营收。一家这个体量的公司向语音领域扩张,做的就不只是加一个功能。它是在一个订阅下搭建一整套生成式音频工具组合,让客户更没理由离开。

这压缩了谁的工作

面对一款新工具,正确的问题不是它能做什么,而是它取代了谁的工作。从 Suno 公布的为期一个月内测用例来看,有四类人立刻就能感受到。

短视频创作者是最明显的一类。带音乐标识的开场、段落之间的过渡、结尾的收束音效:这些过去需要一位作曲人和一次录音棚预约才能拿到的素材,现在一次生成就能出来。这种压缩是真实的,因为旧流程里有一个硬性环节——由人来把音轨和脚本对上——而这个环节现在被放进了模型内部。

播客制作人也能分到一份。带原创配乐的旁白段落,本来是两件事,现在变成了一件;而“关闭音乐”的开关意味着,当客户需要一段干净朗读时,随时可以拿到。

第三类没那么显眼,但人数可能更多。Suno 公布的测试案例大量偏向个人和半个人内容:戏剧化朗读朋友发来的短信、配上史诗配乐的语音留言、引导式冥想、打气喊话,以及给团队自己孩子讲的睡前故事。这和 Suno 歌曲生成器走过的路径一样。它先成为生日和内部玩笑的常客,之后才成为生产工具,而公司也把 Speech 放在同一条赛道上,并把这一品类称为“创意娱乐”。

竞争对手早已在场。ElevenLabs 自 2023 年以来一直主导语音合成,Adobe 有文本转语音工具,Google DeepMind 在语音领域已经耕耘了十年。Suno 的优势不在音质——测试版的那些说明暗示它落后于领先者——而在于配对:一个提示,一次生成,说出的词与原创音乐从一开始就彼此契合。

尚未解决的部分

有意思的正是 Suno 产品叙事与法律叙事之间的落差。Speech 拓宽了平台能做什么,也拓宽了平台可能被指控做了什么。一款能按用户选定风格生成旁白的语音工具,离冒充他人很近;而一款在生成语音的同时生成音乐的模型,会继承音乐那一侧已经在争的、关于训练数据的每一个问题。

Suno 到目前为止的答案是签约和披露。它签下了唱片公司,为上传的音频和歌词增加了筛查,并承诺让艺术家可自愿加入并获得报酬。这比大多数生成式音频公司做得都多。但这也不是一个尘埃落定的答案,因为如果“模型洗白”的指控成立,它描述的是 Suno 自身训练历史内部的问题,而非边缘问题。

Speech 做得好的一点,是去掉了一个过去需要两位专业人士加一次预约录音的环节。它没做到的,是回答它背后的模型究竟是不是按照公司现在所说的方式构建的。这两个问题会并行存在下去,而其中只有一个能靠使用这款产品得到答案。

相关文章