← Torna al blog
Aicirca 6 min di lettura

Ora Suno parla, e porta con sé la sua colonna sonora

Pubblicato 2 ott 2026
Ora Suno parla, e porta con sé la sua colonna sonora

Il 1° ottobre, Suno ha aperto Speech in beta pubblica per tutti gli utenti su web, iOS e Android. Scrivi un’idea, una poesia o un copione che hai già scritto, poi descrivi la voce e l’atmosfera musicale che vuoi sotto. Speech restituisce i due elementi come una singola traccia.

Jack Brody, chief product officer di Suno, nell’annuncio l’ha descritto come il primo modello audio che genera voce e musica insieme come un’unica traccia coesa. Questa impostazione è l’intero prodotto. Molti strumenti producono una voce sintetica, e molti producono musica. La promessa qui è che ritmo e atmosfera siano abbinati al significato mentre entrambi vengono generati, invece di essere assemblati a posteriori in un editor, che è dove ogni introduzione amatoriale di podcast va a morire.

La meccanica è volutamente semplice. La modalità Simple accetta un prompt in linguaggio naturale, qualcosa come “un capitano di mare che incita il suo equipaggio prima di una tempesta”, e genera sia il parlato sia la colonna sonora. La modalità Advanced accetta un copione esatto e mostra controlli per genere della voce, stile vocale, ritmo e quanta varietà debba avere ogni generazione. C’è un interruttore per eliminare del tutto la musica se vuoi solo una narrazione pulita. La beta limita una generazione a circa otto minuti.

Cosa significa “beta” qui

Suno è insolitamente sincera sullo stato attuale. La nota di Brody dice che un accento britannico può occasionalmente vagare fino in Australia e tornare, e che le pause drammatiche possono essere molto drammatiche. Questo tipo di divulgazione è più raro di quanto dovrebbe essere nei post di lancio, e dice qualcosa su a che punto sia ancora la modellazione vocale.

L’azienda inoltre non ha indicato nessuna lingua supportata, il che significa che le prestazioni fuori dall’inglese non sono verificate finché non le provi. Dato che il pubblico esistente di Suno è globale, l’assenza di un elenco di lingue in un lancio dedicato al parlato è un segnale, non una dimenticanza. Il voice cloning è difficile in inglese e ancora più difficile in lingue con sistemi tonali più ricchi, e Suno pubblica prima di poter promettere molto.

Non è stato detto nulla nemmeno su piani tariffari, limiti di generazione o diritti commerciali per l’audio. Questi si trovano nei dettagli dei piani, e chiunque intenda usare Speech per lavori per clienti dovrebbe leggerli con attenzione, vista la storia di Suno.

La svolta delle licenze

L’ultimo anno di Suno è stato un lento passaggio dallo scraping alla firma di accordi. Il 9 settembre ha rilasciato v6, una generazione di modelli musicali sviluppata con Warner Music Group, BMG e Believe. La famiglia ha tre parti: la v6 di punta e una v6-wild orientata all’esplorazione per gli abbonati Pro e Premier, e v6-mini per tutti. Suno afferma che v6 può modificare parte di una canzone esistente usando il linguaggio naturale, creare un mashup da diverse fonti in un’unica richiesta, isolare l’audio per costruire un nuovo beat, creare musica da testo, audio, immagini e video, e riscrivere un singolo verso senza ricostruire l’intera canzone. Man mano che v6 viene distribuito, l’azienda prevede di ritirare i modelli più vecchi e spostare l’intera piattaforma sulla nuova generazione.

Si tratta di un vero aggiornamento delle capacità, ed è anche una strategia legale. Gli accordi di licenza trasformano Suno da convenuta in partner, e le esperienze opt-in per gli artisti che l’azienda dice di stare costruendo, in cui gli artisti scelgono di partecipare e vengono pagati, sono la forma di un business che vuole smettere di essere citato in giudizio.

Le cause legali non si sono fermate. Sony Music e Universal Music Group hanno citato Suno per violazione del copyright, e a settembre 2026 le etichette hanno ampliato il caso con un’accusa di model laundering: usare modelli più vecchi, presunti illeciti, per generare audio sintetico destinato ad addestrare quelli nuovi. È un’accusa più affilata di quella di addestramento su canzoni scraped, perché descrive una catena di violazioni che continua dopo che un’azienda dichiara di essersi ripulita.

Nel frattempo, l’amministratore delegato Mikey Shulman ha detto a Bloomberg, lo stesso giorno del lancio di Speech, che Suno ha superato abbondantemente i 2 milioni di abbonati e i 300 milioni di dollari di ricavi comunicati l’ultima volta. Un’azienda così grande che si espande nel parlato sta facendo qualcosa di più che aggiungere una funzione. Sta costruendo un portafoglio di strumenti audio generativi sotto un unico abbonamento, così che un cliente abbia meno motivi per andarsene.

Per chi comprime il lavoro

La domanda giusta per un nuovo strumento non è cosa fa, ma il lavoro di chi sostituisce. A giudicare dagli usi che Suno ha riportato dal suo mese di test privati, quattro gruppi lo sentono immediatamente.

I creatori di video brevi sono il caso più ovvio. Un’introduzione con una firma musicale, transizioni tra segmenti, uno stacchetto finale: asset che prima richiedevano un compositore e una sessione ora escono da una singola generazione. La compressione è reale, perché la vecchia pipeline aveva un passaggio obbligato in cui un essere umano abbinava una traccia a un copione, e quel passaggio ora è dentro il modello.

Anche i podcaster ne hanno una versione. Un segmento narrato con musica originale sotto è un problema in due parti appena diventato uno, e l’interruttore per disattivare la musica significa che una lettura pulita è disponibile quando un cliente ne ha bisogno.

Il terzo gruppo è meno ovvio e probabilmente più ampio. I casi di test riportati da Suno puntano molto su contenuti personali e semi-personali: letture drammatiche dei messaggi di testo degli amici, note vocali con colonne sonore epiche, meditazioni guidate, discorsi motivazionali e storie della buonanotte per i figli del team stesso. È lo stesso schema seguito dal generatore di canzoni di Suno. È diventato un punto fermo di compleanni e battute interne prima di diventare uno strumento di produzione, e l’azienda sta posizionando Speech nella stessa corsia, definendo la categoria intrattenimento creativo.

I concorrenti sono già nella stanza. ElevenLabs domina la sintesi vocale dal 2023, Adobe ha uno strumento di text-to-speech e Google DeepMind lavora sul parlato da un decennio. Il vantaggio di Suno non è la qualità della voce, che secondo le avvertenze della beta è dietro ai leader. È l’abbinamento: un prompt, un solo take, parole parlate e musica originale che già si adattano l’una all’altra.

La parte irrisolta

Il divario tra la storia di prodotto di Suno e la sua storia legale è dove la cosa si fa interessante. Speech amplia ciò che la piattaforma può creare, e amplia anche ciò di cui la piattaforma può essere accusata di creare. Uno strumento vocale che produce narrazione nello stile scelto dall’utente è vicino all’impersonificazione, e un modello che genera musica insieme al parlato eredita ogni questione sui dati di addestramento su cui il lato musicale sta già litigando.

La risposta di Suno finora sono accordi e trasparenza. Ha firmato con le etichette, ha aggiunto controlli per audio e testi caricati, e ha promesso opt-in per gli artisti con pagamento. È più di quanto abbiano fatto la maggior parte delle aziende di audio generativo. Non è nemmeno una risposta definitiva, perché l’accusa di model laundering, se regge, descrive un problema dentro la stessa storia di addestramento di Suno, non ai suoi margini.

Ciò che Speech fa bene è eliminare un passaggio che prima richiedeva due specialisti e la prenotazione di una sessione. Ciò che non fa è risolvere se i modelli dietro di esso siano stati costruiti nel modo in cui l’azienda ora dice di costruirli. Queste due domande continueranno a correre in parallelo, e solo una di esse troverà risposta usando il prodotto.

Articoli correlati