← Voltar ao blog
Aicerca de 7 min de leitura

O Suno agora fala, e traz sua própria trilha sonora

Publicado 2 de out. de 2026
O Suno agora fala, e traz sua própria trilha sonora

Em 1º de outubro, o Suno abriu o Speech em beta público para todos os usuários na web, no iOS e no Android. Você digita uma ideia, um poema ou um roteiro que já escreveu, e então descreve a voz e o clima musical que quer por baixo. O Speech devolve as duas coisas em uma única faixa.

O diretor de produto do Suno, Jack Brody, descreveu-o no anúncio como o primeiro modelo de áudio que gera voz e música juntas como uma faixa única e coesa. Essa construção é o produto inteiro. Muitas ferramentas produzem voz sintética, e muitas produzem música. A proposta aqui é que ritmo e clima sejam combinados com o significado enquanto ambos são gerados, em vez de serem encaixados depois num editor — que é onde toda abertura de podcast amador vai morrer.

A mecânica é deliberadamente simples. O modo Simple aceita um prompt em linguagem natural, algo como “um capitão de mar reunindo sua tripulação antes de uma tempestade”, e gera tanto a fala quanto a trilha. O modo Advanced aceita um roteiro exato e expõe controles para gênero da voz, estilo vocal, cadência e quanta variedade cada geração deve ter. Há um botão para eliminar a música por completo, caso você queira apenas narração limpa. O beta limita uma geração a cerca de oito minutos.

O que “beta” significa aqui

O Suno é incomumente franco sobre o estado da coisa. A nota de Brody diz que um sotaque britânico pode ocasionalmente vagar até a Austrália e voltar, e que as pausas dramáticas podem ser muito dramáticas. Esse tipo de revelação é mais raro do que deveria em posts de lançamento, e diz algo sobre onde a modelagem de voz ainda está.

A empresa também não indicou nenhum idioma compatível, o que significa que o desempenho fora do inglês não é verificado até você testar. Dado que o público atual do Suno é global, a ausência de uma lista de idiomas num lançamento de fala é um sinal, e não um descuido. A clonagem de voz é difícil em inglês e mais difícil ainda em idiomas com sistemas tonais mais ricos, e o Suno está lançando antes de poder prometer muito.

Também não se disse nada sobre faixas de preço, limites de geração ou direitos comerciais do áudio. Isso tudo está nos detalhes dos planos, e quem pretende usar o Speech para trabalhos de clientes deveria lê-los com atenção, dado o histórico do Suno.

A virada do licenciamento

O último ano do Suno foi um lento pivô do scraping para as assinaturas. Em 9 de setembro, a empresa lançou o v6, uma geração de modelos musicais construída com a Warner Music Group, a BMG e a Believe. A família tem três partes: o carro-chefe v6 e um v6-wild voltado à exploração, para assinantes Pro e Premier, além do v6-mini para todos. O Suno diz que o v6 consegue editar parte de uma música existente usando linguagem simples, montar um mashup a partir de várias fontes num único pedido, isolar áudio para criar uma nova batida, criar música a partir de texto, áudio, imagens e vídeo, e reescrever um único verso sem reconstruir a música inteira. Conforme o v6 é distribuído, a empresa planeja aposentar seus modelos mais antigos e migrar a plataforma inteiramente para a nova geração.

Trata-se de um upgrade real de capacidade, e também de uma estratégia jurídica. Os acordos de licenciamento transformam o Suno de réu em parceiro, e as experiências de adesão voluntária dos artistas que a empresa diz estar construindo, nas quais os artistas escolhem participar e recebem por isso, têm o formato de um negócio que quer parar de ser processado.

Os processos não pararam. A Sony Music e a Universal Music Group processaram o Suno por violação de direitos autorais e, em setembro de 2026, as gravadoras ampliaram o caso com uma acusação de lavagem de modelos: usar modelos mais antigos, supostamente infratores, para gerar áudio sintético destinado ao treinamento de modelos mais novos. É uma alegação mais afiada do que a de treinar com músicas raspadas, porque descreve uma cadeia de violação que continua depois que uma empresa diz ter se regularizado.

Enquanto isso, o CEO Mikey Shulman disse à Bloomberg, no mesmo dia do lançamento do Speech, que o Suno já ultrapassou bem os 2 milhões de assinantes e os US$ 300 milhões em receita reportados anteriormente. Uma empresa desse tamanho expandindo para a fala está fazendo algo mais do que adicionar um recurso. Está construindo um portfólio de ferramentas de áudio generativo sob uma única assinatura, para que o cliente tenha menos motivos para ir embora.

Para quem isso comprime trabalho

A pergunta certa sobre uma ferramenta nova não é o que ela faz, mas o trabalho de quem ela substitui. A julgar pelos usos que o Suno relatou em seu mês de testes privados, quatro grupos sentem o impacto imediatamente.

Criadores de vídeo de formato curto têm o encaixe mais óbvio. Uma introdução com assinatura musical, transições entre segmentos, uma vinheta de encerramento: ativos que antes exigiam um compositor e uma sessão de estúdio agora saem de uma única geração. A compressão é real, porque o fluxo antigo tinha uma etapa difícil, em que uma pessoa combinava a faixa com o roteiro, e essa etapa agora está dentro do modelo.

Podcasters também ganham uma versão disso. Um trecho narrado com música original por baixo é um problema de duas partes que acabou de virar uma, e o botão que desliga a música significa que há uma leitura limpa disponível quando um cliente precisar.

O terceiro grupo é menos óbvio e provavelmente maior. Os casos de teste relatados pelo Suno pendem fortemente para conteúdo pessoal e semipessoal: leituras dramáticas de mensagens de amigos, notas de voz com trilhas épicas, meditações guiadas, discursos motivacionais e histórias para dormir para os próprios filhos da equipe. É o mesmo padrão que o gerador de músicas do Suno seguiu. Ele virou presença garantida em aniversários e piadas internas antes de se tornar ferramenta de produção, e a empresa posiciona o Speech na mesma faixa, chamando a categoria de entretenimento criativo.

Os concorrentes já estão na sala. A ElevenLabs domina a síntese de voz desde 2023, a Adobe tem uma ferramenta de texto para fala e o Google DeepMind trabalha com fala há uma década. A vantagem do Suno não é a qualidade da voz, que, a julgar pelas ressalvas do beta, está atrás dos líderes. É o pareamento: um prompt, uma tomada, palavras faladas e música original que já combinam entre si.

A parte não resolvida

A lacuna entre a história de produto do Suno e sua história jurídica é onde isso fica interessante. O Speech amplia o que a plataforma pode criar e também amplia aquilo de que a plataforma pode ser acusada de criar. Uma ferramenta de voz que produz narração no estilo escolhido pelo usuário chega perto da imitação de identidade, e um modelo que gera música junto com a fala herda todas as questões sobre dados de treinamento que o lado musical já disputa.

A resposta do Suno até agora são acordos e transparência. A empresa assinou com as gravadoras, adicionou triagem para áudios e letras enviados e prometeu adesão voluntária de artistas com pagamento. Isso é mais do que a maioria das empresas de áudio generativo fez. Também não é uma resposta definitiva, porque a acusação de lavagem de modelos, se comprovada, descreve um problema dentro do próprio histórico de treinamento do Suno, e não em suas margens.

O que o Speech faz bem é eliminar uma etapa que antes exigia dois especialistas e uma reserva de estúdio. O que ele não faz é resolver se os modelos por trás dele foram construídos da forma como a empresa agora diz que os constrói. Essas duas perguntas vão continuar correndo em paralelo, e apenas uma delas será respondida ao usar o produto.

Artigos relacionados