← Torna al blog
Aicirca 6 min di lettura

Alibaba ha diviso in due il voice agent, poi ha tagliato il prezzo fino al 95 percento

Pubblicato 2 ott 2026
Alibaba ha diviso in due il voice agent, poi ha tagliato il prezzo fino al 95 percento

Il team Qwen di Alibaba ha rilasciato Qwen-Audio-3.1 nell'ultima settimana di settembre 2026, uno stack audio composto da cinque modelli che copre riconoscimento vocale, sintesi vocale e interazione in tempo reale. I numeri che hanno circolato più in fretta sono stati i tagli di prezzo: circa l'85 percento in meno sul modello realtime, circa il 70 percento in meno sulla sintesi vocale e fino al 95 percento in meno sul riconoscimento vocale automatico.

I numeri contano, perché arrivano in una settimana in cui l'intero settore stava tagliando i prezzi. Microsoft, OpenAI e Anthropic hanno tutti rilasciato modelli più economici o riequilibrati nello stesso periodo, e la mossa di Alibaba si legge come un'escalation deliberata proprio nell'audio. Ma la cosa più interessante di Qwen-Audio-3.1 non è lo sconto. È come è costruito il modello di punta.

Due modelli dietro una sola voce

Il modello di punta è Qwen-Audio-3.1-Realtime, un sistema vocale full-duplex pensato per voice agent che devono richiamare strumenti nel mezzo di una conversazione.

La sua decisione progettuale centrale è una separazione. Invece di un unico grande sistema end-to-end che ascolta e parla, Qwen esegue due modelli con un encoder audio e un backbone di language model condivisi. Un modello decisionale prevede se continuare ad ascoltare, iniziare a parlare, fermarsi o riprendere. Un modello generativo separato gestisce il parlato vero e proprio. In termini semplici, un modello decide quando parlare e l'altro decide cosa dire.

Questa separazione è una risposta pratica a un guasto specifico. I voice agent sembrano rotti il più delle volte non perché ti fraintendono, ma perché sbagliano a valutare il momento. Parlano sopra di te, oppure tacciono, oppure rispondono prima che tu abbia finito. Il rimedio è di solito quello di agganciare la gestione dei turni a un modello più grande e sperare che il comportamento emerga. Qwen tratta il "quando parlare" come un problema ingegneristico a sé, con un modello dedicato, separato dalla generazione dei contenuti. L'azienda riferisce che le risposte rivolte all'interlocutore sbagliato scendono da 0,13 a 0,03 su un benchmark, e che il tasso di parole riempitive cala da 0,759 a 0,296 su un altro. Riferisce anche un compromesso: il tasso indesiderato di ripresa dopo un'interruzione sale da 0,035 a 0,130, il tipo di divulgazione che le note di rilascio raramente includono.

Il modello è disponibile come API gestita. Qwen-Audio-3.1-Realtime-Plus gira su QwenCloud via WebSocket. Non ci sono pesi aperti, cosa che conta per chi segue il lavoro open di Qwen sulle immagini, perché lo stack audio viene gestito come prodotto chiuso e gestito.

Le specifiche e i prezzi

L'endpoint realtime elenca testo e audio sia come input sia come output. Il contesto arriva a 262K token, con un massimo di 245K in input e 16K in output. I limiti di throughput predefiniti sono 60 richieste e 100.000 token al minuto. Il prezzo è di 6,4 $ per milione di token audio in input e 0,8 $ per milione di token di testo in input, con l'output combinato testo e audio a 24 $ per milione e il testo in output non addebitato affatto. Function calling, ricerca web, output strutturati, caching del contesto e fine-tuning sono tutti integrati.

Un modello complementare, Qwen-Audio-3.1-ASR-Flash-Filetrans, è pensato per la trascrizione offline di audio lunghi. Supporta hot word, separazione degli speaker, punteggiatura e riconoscimento in più lingue oltre ai dialetti cinesi, a 0,15 $ in input e 0,47 $ in output per milione di token. Per chiunque abbia preventivato la trascrizione di contenuti lunghi su larga scala, si tratta di un calo netto di quello che era un costo fisso.

La storia dell'addestramento è organizzata in tre livelli, che Qwen etichetta Think, Act e Speak. Il livello Think riancora il modello audio a un modello di testo di origine usando dati appaiati su scala di milioni di ore, poi applica la distillazione on-policy invece dell'imitazione di risposte pre-scritte. Il livello Act costruisce ambienti eseguibili, ognuno dei quali raggruppa un pool di strumenti, un database con stato e una policy di business scritta, con i task valutati prima sullo stato finale. Il livello Speak decide se, quando e come parlare.

Il dettaglio del livello Act è quello su cui vale la pena soffermarsi. La valutazione controlla lo stato risultante prima di controllare la formulazione, così una risposta fluente non può salvare un'azione fallita. È il modo giusto di valutare un agente che dovrebbe fare qualcosa invece di chiacchierare al riguardo.

Perché la guerra dei prezzi è la vera storia

Tolta l'architettura, Qwen-Audio-3.1 è una mossa strategica chiara: Alibaba corre contro OpenAI e Google sul costo e sulla latenza dell'infrastruttura vocale, non sull'apertura.

Il confronto che rende tutto questo leggibile è la latenza. Qwen riferisce una latenza di arresto in caso di interruzione di circa 1,116 secondi, contro 0,383 secondi di GPT-Realtime-2. Essere più lenti a fermarsi quando l'utente interrompe è una debolezza visibile, e il fatto che Qwen l'abbia pubblicata insieme ai risultati positivi dice qualcosa sullo stato della cultura dei benchmark nell'audio, dove numeri onesti sono ancora un elemento distintivo.

Per chi costruisce prodotti, l'effetto pratico è un backend più economico. Se il parlato in tempo reale costa l'85 percento in meno e il riconoscimento fino al 95 percento in meno, allora le funzionalità vocali che prima erano riservate ai piani premium diventano sostenibili in prodotti ordinari. Ascolto sempre attivo, traduzione in tempo reale e interfacce vocali per gli agenti stanno tutti a valle di quella curva di costo. Quando il costo di un minuto parlato crolla, decisioni di prodotto che erano insostenibili il trimestre scorso diventano ovvie in questo.

Il caveat è quello che vale per ogni API gestita. Ottieni il comportamento, non gli interni. Non puoi ispezionare il modello di gestione dei turni, fare fine-tuning della logica decisionale sui tuoi dati in modo del tutto controllato, né eseguire lo stack sul tuo hardware. Per la maggior parte delle startup è uno scambio accettabile. Per chi costruisce qualcosa in cui il profilo di latenza o il percorso dei dati è il prodotto, è una dipendenza di cui tenere conto nel prezzo.

Il contesto competitivo rende il punto più netto. Nello stesso periodo di settembre, OpenAI e Anthropic hanno entrambe rilasciato modelli impostati per fare più lavoro a costi inferiori, e Microsoft ha aggiunto alla propria linea interna un modello di trascrizione in streaming e due modelli di sintesi vocale. L'audio non è più un angolo tranquillo dove un laboratorio più piccolo può essere il migliore senza che nessuno se ne accorga. È una categoria in cui i giocatori più grandi competono pubblicamente su prezzo e latenza, il che è una buona notizia per gli acquirenti e una stretta per chiunque faccia pagare un premio per la voce.

Cosa tenere d'occhio

La domanda ovvia è se Qwen prima o poi renderà open source qualche parte di questo stack, e come il design a due modelli regge sotto un vero carico di tool calling multi-turno invece che in condizioni da benchmark. Separare la gestione dei turni dal contenuto è elegante sulla carta. Se resti elegante quando un utente interrompe, cambia idea e cambia attività a metà frase è il tipo di domanda a cui le demo non rispondono.

Per ora il messaggio è più ristretto e più chiaro. Alibaba ha preso la parte dei voice agent che sembrava più rotta, le ha dato un nome e le ha assegnato un modello dedicato. Poi ha tagliato il prezzo finché l'intera categoria è diventata più economica. Se il prossimo anno di prodotti vocali sarà costruito su un parlato più economico e più interrompibile, questo rilascio sembrerà una delle ragioni.

Articoli correlati