← Retour au blog
AiEnviron 8 min de lecture

Suno parle désormais, et apporte sa propre bande-son

Publié le 2 oct. 2026
Suno parle désormais, et apporte sa propre bande-son

Le 1er octobre, Suno a ouvert Speech en bêta publique à tous les utilisateurs sur le web, iOS et Android. Vous saisissez une idée, un poème ou un script que vous avez déjà écrit, puis vous décrivez la voix et l’ambiance musicale que vous souhaitez en dessous. Speech renvoie les deux sous la forme d’une seule piste.

Jack Brody, directeur produit de Suno, l’a décrit dans l’annonce comme le premier modèle audio qui génère la voix et la musique ensemble, en une seule piste cohérente. Cette formulation résume tout le produit. Beaucoup d’outils produisent une voix synthétique, et beaucoup produisent de la musique. L’argument ici, c’est que le rythme et l’ambiance sont accordés au sens pendant que les deux sont générés, plutôt que d’être vissés ensemble après coup dans un éditeur, là où toute intro de podcast amateur va mourir.

La mécanique est volontairement simple. Le mode Simple prend une invite en langage naturel, par exemple « un capitaine de navire ralliant son équipage avant une tempête », et génère à la fois la parole et la musique. Le mode Avancé prend un script exact et expose des contrôles pour le genre de la voix, le style vocal, le débit et le degré de variété de chaque génération. Un interrupteur permet de supprimer complètement la musique si vous ne voulez qu’une narration claire. La bêta limite une génération à environ huit minutes.

Ce que « bêta » signifie ici

Suno se montre d’une franchise inhabituelle sur l’état de la chose. La note de Brody indique qu’un accent britannique peut parfois s’aventurer jusqu’en Australie et revenir, et que les pauses dramatiques peuvent être très dramatiques. Ce genre de divulgation est plus rare qu’il ne le devrait dans les billets de lancement, et cela dit quelque chose de l’endroit où en est encore la modélisation vocale.

L’entreprise n’a d’ailleurs cité aucune langue prise en charge, ce qui signifie que les performances en dehors de l’anglais ne sont pas vérifiées tant que vous ne les essayez pas. Étant donné que l’audience existante de Suno est mondiale, l’absence d’une liste de langues dans un lancement vocal est un signal plutôt qu’un oubli. Le clonage vocal est difficile en anglais et plus encore dans des langues aux systèmes tonaux plus riches, et Suno livre avant de pouvoir promettre grand-chose.

Rien n’a été dit non plus sur les niveaux tarifaires, les limites de génération ou les droits commerciaux sur l’audio. Ces éléments figurent dans les détails des forfaits, et quiconque envisage d’utiliser Speech pour le travail d’un client devrait les lire attentivement, compte tenu de l’historique de Suno.

Le virage des licences

L’année écoulée de Suno a été un lent pivot du scraping vers la signature de contrats. Le 9 septembre, elle a publié v6, une génération de modèles musicaux construite avec Warner Music Group, BMG et Believe. La famille comporte trois volets : le v6 phare et un v6-wild orienté exploration pour les abonnés Pro et Premier, ainsi qu’un v6-mini pour tout le monde. Suno affirme que v6 peut modifier une partie d’une chanson existante en langage courant, construire un mashup à partir de plusieurs sources en une seule requête, isoler de l’audio pour créer un nouveau beat, créer de la musique à partir de texte, d’audio, d’images et de vidéo, et réécrire une seule parole sans reconstruire toute la chanson. À mesure que v6 est déployé, l’entreprise prévoit de retirer ses anciens modèles et de faire passer entièrement la plateforme à la nouvelle génération.

C’est une véritable montée en puissance, et c’est aussi une stratégie juridique. Les accords de licence transforment Suno de défendeur en partenaire, et les expériences d’artistes en opt-in que l’entreprise dit construire, où les artistes choisissent de participer et sont payés, dessinent la forme d’une activité qui veut cesser d’être poursuivie en justice.

Les poursuites ne se sont pas arrêtées. Sony Music et Universal Music Group ont poursuivi Suno pour violation du droit d’auteur et, en septembre 2026, les labels ont élargi l’affaire avec une accusation de blanchiment de modèles : l’utilisation de modèles plus anciens, prétendument contrefaisants, pour générer de l’audio synthétique destiné à entraîner les nouveaux. C’est une accusation plus pointue que l’entraînement sur des chansons scrapées, car elle décrit une chaîne de contrefaçon qui se poursuit après qu’une entreprise affirme avoir fait le ménage.

Pendant ce temps, le PDG Mikey Shulman a déclaré à Bloomberg, le jour même du lancement de Speech, que Suno avait largement dépassé les 2 millions d’abonnés et les 300 millions de dollars de revenus annoncés la dernière fois. Une entreprise de cette taille qui s’étend à la parole fait plus qu’ajouter une fonctionnalité. Elle construit un portefeuille d’outils audio génératifs sous un seul abonnement afin qu’un client ait moins de raisons de partir.

Qui voit son travail se compresser

La bonne question pour un nouvel outil n’est pas ce qu’il fait, mais le travail de qui il remplace. À en juger par les usages rapportés par Suno durant son mois de tests privés, quatre groupes le ressentent immédiatement.

Les créateurs de vidéos courtes sont les plus concernés de façon évidente. Une intro signature musicale, des transitions entre segments, un jingle de fin : des éléments qui exigeaient autrefois un compositeur et une séance de studio sortent désormais d’une seule génération. La compression est réelle, car l’ancien pipeline comportait une étape difficile où un humain faisait correspondre une piste à un script, et cette étape se trouve maintenant à l’intérieur du modèle.

Les podcasteurs y ont aussi droit. Un segment narré avec de la musique originale en dessous est un problème en deux parties qui vient de n’en devenir qu’une, et l’interrupteur pour désactiver la musique signifie qu’une lecture propre est disponible quand un client en a besoin.

Le troisième groupe est moins évident et probablement plus large. Les cas de test rapportés par Suno s’appuient fortement sur du contenu personnel et semi-personnel : lectures dramatiques de messages texte d’amis, notes vocales avec des bandes originales épiques, méditations guidées, discours d’encouragement et histoires du soir pour les propres enfants de l’équipe. C’est le même schéma que celui suivi par le générateur de chansons de Suno. Il est devenu un incontournable des anniversaires et des blagues privées avant de devenir un outil de production, et l’entreprise positionne Speech dans la même voie, en qualifiant la catégorie de divertissement créatif.

Les concurrents sont déjà présents. ElevenLabs domine la synthèse vocale depuis 2023, Adobe dispose d’un outil de synthèse vocale, et Google DeepMind travaille sur la parole depuis une décennie. L’avantage de Suno n’est pas la qualité de la voix, que les mises en garde de la bêta suggèrent en retrait par rapport aux leaders. C’est l’association : une invite, une seule prise, des paroles prononcées et une musique originale qui s’accordent déjà.

Ce qui reste non résolu

L’écart entre le récit produit de Suno et son récit juridique, voilà où cela devient intéressant. Speech élargit ce que la plateforme peut créer, et élargit aussi ce dont elle peut être accusée. Un outil vocal qui produit une narration dans le style choisi par un utilisateur frôle l’usurpation d’identité, et un modèle qui génère de la musique en même temps que la parole hérite de toutes les questions sur les données d’entraînement que le volet musical se dispute déjà.

La réponse de Suno jusqu’ici, ce sont des accords et de la transparence. Elle a signé avec les labels, ajouté un filtrage pour l’audio et les paroles téléversés, et promis des opt-in d’artistes avec rémunération. C’est plus que ce que la plupart des entreprises d’audio génératif ont fait. Ce n’est pas non plus une réponse définitive, car l’accusation de blanchiment de modèles, si elle tient, décrit un problème à l’intérieur même de l’historique d’entraînement de Suno plutôt qu’à ses marges.

Ce que Speech fait bien, c’est supprimer une étape qui exigeait autrefois deux spécialistes et une réservation de séance. Ce qu’il ne fait pas, c’est résoudre la question de savoir si les modèles derrière lui ont été construits comme l’entreprise dit désormais les construire. Ces deux questions continueront de courir en parallèle, et une seule d’entre elles trouvera sa réponse en utilisant le produit.

Articles associés