← Torna al blog
Aicirca 7 min di lettura

Microsoft riduce la latenza delle trascrizioni parziali a 100 millisecondi. Questo cambia lo scopo della trascrizione.

Pubblicato 5 ott 2026
Microsoft riduce la latenza delle trascrizioni parziali a 100 millisecondi. Questo cambia lo scopo della trascrizione.

Il 2 ottobre 2026, Microsoft AI ha annunciato MAI-Transcribe-2-Streaming, un modello di riconoscimento vocale che restituisce trascrizioni parziali in poco più di 100 millisecondi in 60 lingue. Si classifica al primo posto su Artificial Analysis sia per l'accuratezza delle trascrizioni finali che parziali. Il prezzo introduttivo è di $0,54 per ora di audio fino alla fine dell'anno.

L'azienda ha anche annunciato MAI-Voice-2.1 e MAI-Voice-2.1-Flash, che coprono 23 lingue e 26 locale. Il modello è accessibile tramite Azure Speech, Microsoft Foundry, il MAI Playground, OpenRouter con l'id microsoft/mai-transcribe-2, Vercel e Azure Voice Live, con un'integrazione LiveKit indicata come in arrivo.

Cento millisecondi sono una soglia, non una curiosità da benchmark. Si colloca al limite di ciò che le persone percepiscono come istantaneo. Al di sotto, un'interfaccia può rispondere mentre qualcuno sta ancora parlando, e questa è la differenza tra un prodotto che produce un documento e un prodotto che partecipa a una conversazione.

Un primo piano estremo del diaframma di un microfono in fine maglia dorata sotto luce ciano

Perché l'accuratezza finale non è mai stata tutta la storia

Il riconoscimento vocale è una categoria matura da anni, e le classifiche hanno per lo più misurato una cosa: con quanta accuratezza un modello rende un enunciato completo una volta che l'oratore si è fermato. Questa metrica risponde alla domanda a cui tiene un servizio di trascrizione. Non risponde alla domanda a cui tiene un prodotto live.

Un assistente per riunioni che mostra le parole solo dopo che l'oratore ha finito è un registratore con una formattazione migliore. Un assistente per riunioni che mostra le parole mentre arrivano può evidenziare l'oratore corrente, far emergere un nome nel momento in cui viene menzionato, attivare una ricerca mentre l'argomento è ancora in discussione e consentire a qualcuno di scorrere indietro a metà frase senza perdere il segno. Tutto ciò dipende dalla latenza parziale piuttosto che dall'accuratezza finale.

L'accuratezza parziale è il problema più difficile, ed è quello che Artificial Analysis ora monitora separatamente. Generare un'ipotesi stabile prima che la frase sia completa significa impegnarsi in un'interpretazione che potresti dover rivedere. I modelli che rivedono costantemente producono testo che sfarfalla, il che è peggio che aspettare. I modelli che si impegnano troppo aggressivamente lasciano errori sullo schermo. La classifica sulle parziali premia il modello che azzecca il testo provvisorio abbastanza spesso da far sì che un lettore possa fidarsi di ciò che sta guardando.

Il fatto che Microsoft rivendichi il primo posto in entrambe le classifiche significa che non sta scambiando la stabilità provvisoria con la correttezza finale, che è il modo usuale in cui i modelli ottengono velocità parziale. Questa combinazione è l'annuncio vero.

Il numero di 100 millisecondi

La latenza end-to-end nel riconoscimento in streaming è una catena, non un singolo valore. L'audio arriva in frame. Un modello di endpointing decide quando un enunciato può essere terminato. Il modello di riconoscimento produce testo. Un sistema a valle lo visualizza. Ogni anello aggiunge ritardo e il totale determina se l'esperienza sembra dal vivo.

Il valore di 100 millisecondi di Microsoft copre l'output del modello stesso, basato sulla misurazione dell'azienda e sulla posizione in Artificial Analysis piuttosto che su un audit indipendente della latenza. Il confronto rilevante riguarda se il numero regge nelle condizioni che un prodotto live crea, che è una domanda diversa da una lettura del cronometro in isolamento: diversi oratori, rumore di fondo, un microfono da conferenza scadente e 60 lingue che arrivano sulla stessa pipeline. I fornitori raramente pubblicano distribuzioni di latenza in quelle condizioni, e sono proprio quelle che determinano se un prodotto per riunioni è utilizzabile in una riunione reale.

La struttura dei prezzi è l'altra metà della storia. $0,54 per ora di audio è una tariffa introduttiva che dura fino alla fine dell'anno, il che ti dice che Microsoft prevede di modificarla. L'intento strategico è leggibile. La trascrizione in streaming è il livello di input per ogni assistente per riunioni, prodotto di analisi per call center e servizio di sottotitoli dal vivo. Essere l'opzione veloce più economica per 60 lingue è una mossa di distribuzione, e la distribuzione in un livello di input è appiccicosa, perché la seconda squadra che cambia fornitore deve ricostruire la propria gestione per un diverso insieme di comportamenti intermedi.

Con cosa compete

Microsoft non sta entrando in un campo vuoto. Deepgram, AssemblyAI e Speechmatics hanno tutti costruito business sull'accuratezza dello streaming e sulla bassa latenza, e Google e Amazon includono il riconoscimento competitivo nei propri stack cloud. L'acquirente realistico è uno sviluppatore che già opera su Azure, apprezza il fatto che MAI-Transcribe-2-Streaming appaia in Foundry e OpenRouter insieme al resto della famiglia MAI, e preferirebbe non mantenere una seconda relazione con un fornitore per un singolo componente.

Anche l'annuncio di MAI-Voice-2.1 è importante qui, e l'abbinamento è deliberato. Il riconoscimento vocale e la sintesi vocale sono i due estremi della stessa conversazione, e una piattaforma che vende entrambi può proporre un'unica pipeline: audio in ingresso, trascrizione in uscita, risposta sintetizzata, parlato restituito. L'aggiunta di 23 lingue e 26 locale sul fronte della sintesi amplia il numero di mercati in cui quella pipeline può essere venduta come un unico prodotto.

Cosa cambiano le parziali veloci nel design del prodotto

Una volta che il testo provvisorio arriva entro un decimo di secondo, una serie di decisioni sull'interfaccia che prima erano irragionevoli diventano ordinarie.

Considera l'interruzione. Se una trascrizione si stabilizza solo dopo che un oratore si ferma, un sistema deve aspettare il silenzio prima di poter agire su ciò che è stato detto, il che significa che non può rispondere finché la conversazione non è già andata avanti. Con parziali veloci, un sistema può riconoscere un comando nel momento in cui viene pronunciato e intervenire, che è il comportamento che le persone si aspettano da una persona nella stanza. Gli agenti vocali che supportano il barge-in dipendono da questo. Così come i sistemi di sottotitoli dal vivo che devono tenere il passo con un oratore veloce invece di rimanere tre frasi indietro.

La ricerca è il secondo beneficiario. Un assistente per riunioni che può cercare nella trascrizione mentre viene scritta può far emergere un documento nel momento in cui compare il nome di un progetto, mentre la discussione è ancora in corso. Questo è un prodotto fondamentalmente diverso da un registratore che produce note ricercabili un'ora dopo.

L'estrazione strutturata è la terza. Se il testo parziale è abbastanza affidabile, un modello a valle può iniziare a leggerlo prima che la riunione finisca, etichettando decisioni e punti d'azione mentre vengono pronunciati. Il guadagno qui deriva dal poter rivedere l'output mentre i partecipanti ricordano ancora cosa intendevano, piuttosto che dalla velocità grezza.

Ognuno di questi comportamenti aumenta la posta in gioco sulla stabilità parziale. Una trascrizione che si riscrive due o tre volte al secondo rende tutte e tre le funzionalità fastidiose anziché utili, ed è per questo che la storia più profonda nell'annuncio di Microsoft è la posizione di accuratezza sulle parziali piuttosto che il dato di latenza di per sé.

Dove si colloca il rischio interessante

Le cifre di accuratezza della trascrizione sono di solito riportate come percentuali aggregate, e le percentuali aggregate nascondono la distribuzione sottostante. Le prestazioni su parlato con accento, code-switching tra lingue a metà frase, voci di bambini e microfoni non standard variano enormemente tra i modelli, e quelle sono proprio le condizioni in cui un prodotto live è più probabile che venga utilizzato. Un modello che registra una media elevata può comunque essere la scelta sbagliata per uno specifico call center i cui clienti cambiano lingua a metà frase.

Il secondo rischio è più strategico. Una volta che la trascrizione è abbastanza veloce ed economica da essere eseguita in modo continuo, il passo successivo naturale è eseguirla sempre. Un modello che costa mezzo dollaro all'ora rende l'ascolto continuo accessibile in un modo che un modello di prezzo al minuto non consentiva, e l'ascolto continuo è una registrazione ambientale di tutto ciò che viene detto vicino a un dispositivo. Questa è una decisione di governance dei dati che nessuna classifica di accuratezza prenderà al posto dei team che acquistano questo.

MAI-Transcribe-2-Streaming è un pezzo di infrastruttura genuinamente utile, e la classifica di accuratezza parziale è la parte da tenere d'occhio, perché misura la metrica da cui i prodotti live dipendono effettivamente. Ciò che rimane irrisolto è se un numero di 100 millisecondi misurato dal fornitore regga in una stanza con acustica scadente e quattro persone che parlano una sopra l'altra. Questo è il test che ogni acquirente eseguirà, in privato, prima di affidare ad esso una pipeline di produzione.

Articoli correlati