← Torna al blog
Aicirca 7 min di lettura

ElevenLabs ha risolto la voce e poi ha alzato il prezzo dell'essere ascoltati

Pubblicato 3 ott 2026
ElevenLabs ha risolto la voce e poi ha alzato il prezzo dell'essere ascoltati

Il 28 settembre, ElevenLabs ha rilasciato due modelli vocali. Eleven v4 è pensato per la narrazione e il dialogo preparato. Eleven v4 Turbo è pensato per la conversazione dal vivo, con una latenza di inferenza mediana vicina ai 100 millisecondi e circa 150 millisecondi fino al primo parlato. Due giorni dopo, l'azienda ha chiuso un'offerta di acquisto di azioni riservata ai dipendenti che l'ha valutata 22 miliardi di dollari, il doppio degli 11 miliardi di febbraio.

Quei due annunci sono lo stesso annuncio. Una volta che un modello vocale è abbastanza veloce da far smettere le persone di notare il ritardo, la domanda che resta è chi suona reale, e quella è una questione di prodotto con un prezzo attaccato.

La latenza era l'ultima scusa tecnica

Gli agenti vocali hanno avuto per anni un modo di fallire ostinato. Le parole sono corrette, il tempismo è sbagliato. Una pausa che dura un battito di troppo trasforma un assistente utile in qualcosa riattaccando il telefono, e la soluzione è sempre stata più hardware o una frase più corta. I numeri di Turbo stanno sotto la soglia in cui gli esseri umani se ne accorgono. Circa 100 millisecondi corrispondono all'incirca alla durata di una normale pausa conversazionale, il che significa che il ritardo smette di essere letto come una macchina che pensa e comincia a essere letto come una persona che riflette.

La nuova architettura copre inoltre oltre 90 lingue, in aumento rispetto alle più di 70 della v3, con un dettaglio che conta più del numero. Una voce clonata da una registrazione in inglese parlerà giapponese con un accento giapponese naturale, invece di trascinarsi dietro l'accento di partenza. I brand che localizzano un unico portavoce su più mercati ottengono un risultato più pulito, e la narrativa che dipende dall'accento di un personaggio richiede una decisione deliberata anziché un'impostazione predefinita.

Le richieste ora accettano fino a 10.000 caratteri, il doppio del limite precedente. I tag di resa inline come [laughs], [whispers] e [said angrily] funzionano ancora e possono essere impilati. Le Instant Voice Clone richiedono ancora circa 10 secondi di audio.

Il salto da una settantina di lingue a oltre 90 è più piccolo del salto nel modo in cui una voce clonata si comporta attraverso di esse. Una singola registrazione può ora presentare un prodotto in una dozzina di mercati senza che ogni versione suoni come la stessa persona che si sforza di imitare un accento locale. Per un'azienda che localizza un solo portavoce, questo elimina un passaggio che prima richiedeva una seconda sessione di registrazione per ogni lingua.

L'espressività è dove stanno i soldi

Artificial Analysis ha classificato la v4 al primo posto per espressività, ed ElevenLabs riferisce che circa il 75 percento degli ascoltatori l'ha preferita in test in cieco. Entrambe le cifre provengono dall'azienda o dai suoi partner, quindi vanno considerate marketing finché qualcuno non rifà il test. La direzione è comunque rivelatrice. Ogni grande laboratorio è ormai in grado di produrre parlato intelligibile. Il fattore distintivo si è spostato sul fatto che il parlato sappia trasmettere tono, ritmo e una personalità riconoscibile lungo una registrazione lunga senza che la voce vada alla deriva tra un capitolo e l'altro.

Il quadro commerciale dice la stessa cosa da un'angolazione diversa. ElevenAgents, la piattaforma per agenti conversazionali, rappresenta ora il 55 percento dei ricavi di ElevenLabs. La voce non viene venduta principalmente come narrazione per audiolibri. Viene venduta come livello di interfaccia per software che parla.

Questo spostamento spiega la struttura dei prezzi. Eleven v4 costa 0,08 dollari per 1.000 caratteri tramite API, e Turbo costa 0,04. Entrambi sono scontati fino al 12 ottobre, rispettivamente a 0,022 e 0,011. Le tariffe di riferimento sono quelle su cui bisogna impostare il budget, perché lo sconto di lancio è temporaneo e le correzioni aggiungono caratteri. Turbo è anche limitato in un modo specifico facile da non notare: il WebSocket Text to Dialogue accetta fino a dieci voci registrate per connessione su v4, ma solo una su Turbo.

Il resto del mercato non sta fermo

ElevenLabs non è l'unica a trattare la voce come interfaccia dell'agente. Il 30 settembre, Inception Labs ha lanciato Mercury Voice, un modello linguistico a diffusione costruito specificamente per agenti vocali a bassa latenza, con un tempo mediano al primo token di risposta di 320 millisecondi e un prezzo di circa nove decimi di centesimo al minuto di conversazione al lancio. Suno ha rilasciato in beta un modello vocale. Vercel ha aggiunto i modelli audio di Microsoft al suo AI Gateway con conservazione dati zero.

Gli approcci differiscono su dove collocano la parte difficile. ElevenLabs tratta la sintesi come il prodotto e modella le parole separatamente. Inception incorpora il modello linguistico nel budget di latenza, sostenendo che un livello di sintesi veloce è inutile se il modello dietro di esso impiega due secondi a pensare. Entrambi sono coerenti, e continueranno a scontrarsi, perché un utente che sperimenta un agente vocale non riesce a dire quale componente sia stato lento.

Le parti scomode

Il cloning è protetto da una verifica obbligatoria dell'identità del proprietario e da filtri che bloccano i cloni non autorizzati di figure pubbliche di rilievo. È un livello minimo ragionevole, non una soluzione. Un campione da dieci secondi ora basta per un clone ad alta fedeltà, e il numero di persone che possiedono dieci secondi dell'audio di qualcuno è praticamente tutti.

C'è un problema di secondo livello che nessun filtro affronta. Man mano che i modelli espressivi migliorano nel suonare come una persona specifica, il valore della voce come segnale di verifica crolla. Un'impronta vocale era una prova debole e ora è quasi per niente una prova. Banche e call center che avevano costruito i controlli di identità su "riconosciamo la voce del cliente" stanno ritirando silenziosamente quell'assunto da due anni, e questo rilascio rende il ritiro ormai in ritardo.

Anche la cifra sulla latenza è più limitata di quanto sembri. È misurata sul protocollo di benchmark di ElevenLabs con la latenza di rete rimossa. Un assistente reale deve comunque riconoscere la richiesta, decidere una risposta e consegnarla attraverso una rete. Turbo elimina una fonte di ritardo da una catena che ne ha diverse.

Un'onda delicata di luce che viaggia attraverso un tubo di vetro curvo su una superficie scura lucida, turchese con caldi riflessi ambrati

Cosa dice davvero la valutazione

Raddoppiare una valutazione in otto mesi, su una vendita secondaria da 300 milioni di dollari anziché nuovo capitale primario, è una dichiarazione sulla retention e su una categoria che non si è ancora commoditizzata. I modelli vocali sono il raro prodotto AI in cui gli utenti notano subito la qualità e cambiano fornitore per ottenerla. Gli hyperscaler e i concorrenti specializzati stanno tutti rilasciando, e il divario di qualità si è andato restringendo.

La scommessa dietro il numero di 22 miliardi è che il divario resti abbastanza ampio da poterci far pagare, e che la piattaforma per agenti continui a crescere più in fretta di quanto scenda il prezzo puro della sintesi. Il passaggio di Turbo a 0,011 dollari per 1.000 caratteri durante il lancio suggerisce che la seconda metà di quella scommessa sia la più difficile. Quando il costo marginale di una voce si avvicina a zero, la cosa che si può ancora vendere è la voce che nessun altro ha.

C'è anche una ragione strutturale per cui un'azienda vocale può sostenere una valutazione simile mentre le aziende di immagini e video fanno fatica. Un agente vocale funziona in continuo, in ogni chiamata e in ogni sessione, quindi l'utilizzo scala con il successo del prodotto anziché con una generazione una tantum. Narrazione e agenti hanno economie diverse: uno è un progetto, l'altro è un contatore che non si ferma mai. ElevenLabs ha costruito verso il secondo, e il 55 percento dei ricavi dice che la strategia ha funzionato. La domanda a cui risponderà il prossimo anno è se il vantaggio di qualità sopravviverà abbastanza a lungo perché il contatore continui a girare.

L'inquadramento dell'azienda stessa punta nella stessa direzione. Il materiale di lancio mette in primo piano l'espressività anziché l'accuratezza o la velocità, perché quelle due hanno smesso di essere fattori distintivi già diverse release fa. Ciò che un agente vocale deve fare per sembrare reale è trasmettere esitazione, enfasi e un'identità coerente per una sessione di quaranta minuti, e questo è un obiettivo più difficile che produrre un paragrafo pulito. Il modello che lo vincerà non sarà necessariamente il più economico per carattere. Sarà quello il cui output le persone non riescono a distinguere da una persona con cui hanno già parlato, un'asticella che si alza ogni volta che viene superata.

Articoli correlati