Microsoft redujo la latencia de las transcripciones parciales a 100 milisegundos. Eso cambia para qué sirve la transcripción.

El 2 de octubre de 2026, Microsoft AI anunció MAI-Transcribe-2-Streaming, un modelo de reconocimiento de voz que devuelve transcripciones parciales en poco más de 100 milisegundos en 60 idiomas. Ocupa el primer puesto en Artificial Analysis tanto en precisión de transcripción final como parcial. El precio introductorio es de 0,54 dólares por hora de audio hasta finales de año.
La compañía también anunció MAI-Voice-2.1 y MAI-Voice-2.1-Flash, que cubren 23 idiomas y 26 locales. Se puede acceder al modelo a través de Azure Speech, Microsoft Foundry, el MAI Playground, OpenRouter con el id microsoft/mai-transcribe-2, Vercel y Azure Voice Live, con una integración con LiveKit indicada como próxima.
Cien milisegundos es un umbral, no una curiosidad de benchmark. Se sitúa en el límite de lo que las personas perciben como instantáneo. Por debajo de él, una interfaz puede responder mientras alguien todavía está hablando, y esa es la diferencia entre un producto que genera un documento y un producto que participa en una conversación.

Por qué la precisión final nunca fue toda la historia
El reconocimiento de voz lleva años siendo una categoría madura, y las clasificaciones han medido sobre todo una cosa: con qué precisión reproduce un modelo un enunciado completo una vez que el hablante ha terminado. Esa métrica responde a la pregunta que le importa a un servicio de transcripción. No responde a la pregunta que le importa a un producto en vivo.
Un asistente de reuniones que solo muestra las palabras después de que el hablante termina es una grabadora con mejor formato. Un asistente de reuniones que muestra las palabras a medida que llegan puede resaltar al hablante actual, mostrar un nombre en el momento en que se menciona, activar una búsqueda mientras el tema sigue sobre la mesa y permitir que alguien retroceda a mitad de frase sin perder su sitio. Todo eso depende de la latencia parcial y no de la precisión final.
La precisión parcial es el problema más difícil, y es el que Artificial Analysis ahora rastrea por separado. Generar una conjetura estable antes de que la frase esté completa implica comprometerse con una interpretación que quizá haya que revisar. Los modelos que revisan constantemente producen texto que parpadea, lo cual es peor que esperar. Los modelos que se comprometen con demasiada agresividad dejan errores en pantalla. Clasificar por parciales premia al modelo que acierta el texto provisional con la suficiente frecuencia como para que un lector pueda confiar en lo que está viendo.
Que Microsoft afirme el primer puesto en ambas tablas significa que no está sacrificando la estabilidad provisional por la corrección final, que es la forma habitual en que los modelos compran velocidad parcial. Esa combinación es el anuncio real.
El número de 100 milisegundos
La latencia de extremo a extremo en el reconocimiento en streaming es una cadena, no una única cifra. El audio llega en tramas. Un modelo de endpointing decide cuándo puede haber terminado un enunciado. El modelo de reconocimiento produce texto. Un sistema posterior lo renderiza. Cada eslabón añade retraso, y el total determina si la experiencia se siente en vivo.
La cifra de 100 milisegundos de Microsoft cubre la salida del propio modelo, basándose en la medición de la propia compañía y en la posición en Artificial Analysis, en lugar de una auditoría de latencia independiente. La comparación relevante tiene que ver con si el número se mantiene bajo las condiciones que crea un producto en vivo, lo cual es una pregunta distinta de una lectura de cronómetro aislada: varios hablantes, ruido de fondo, un micrófono de conferencia deficiente y 60 idiomas llegando por el mismo pipeline. Los proveedores rara vez publican distribuciones de latencia en esas condiciones, y son las que determinan si un producto de reuniones es utilizable en una reunión real.
La estructura de precios es la otra mitad de la historia. 0,54 dólares por hora de audio es una tarifa introductoria vigente hasta finales de año, lo que indica que Microsoft espera cambiarla. La intención estratégica es legible. La transcripción en streaming es la capa de entrada de cada asistente de reuniones, producto de analítica de centros de llamadas y servicio de subtitulado en vivo. Ser la opción rápida más barata para 60 idiomas es una jugada de distribución, y la distribución en una capa de entrada es pegajosa, porque el segundo equipo que cambia de proveedor tiene que reconstruir su forma de gestionar un conjunto distinto de comportamientos provisionales.
Contra qué compite
Microsoft no entra en un campo vacío. Deepgram, AssemblyAI y Speechmatics han construido negocios sobre la precisión en streaming y la baja latencia, y Google y Amazon incluyen reconocimiento competitivo en sus propias plataformas en la nube. El comprador realista es un desarrollador que ya trabaja en Azure, valora que MAI-Transcribe-2-Streaming aparezca en Foundry y OpenRouter junto al resto de la familia MAI, y preferiría no mantener una segunda relación con proveedores por un solo componente.
El anuncio de MAI-Voice-2.1 también importa aquí, y el emparejamiento es deliberado. El reconocimiento de voz y la síntesis de voz son los dos extremos de la misma conversación, y una plataforma que vende ambos puede ofrecer un único pipeline: entra audio, sale transcripción, se sintetiza la respuesta y se devuelve la voz. Añadir 23 idiomas y 26 locales en el lado de la síntesis amplía el número de mercados donde ese pipeline puede venderse como un solo producto.
Qué cambian los parciales rápidos en el diseño de producto
Una vez que el texto provisional llega en menos de una décima de segundo, un conjunto de decisiones de interfaz que antes eran irrazonables se vuelven normales.
Pensemos en la interrupción. Si una transcripción solo se asienta después de que un hablante se detiene, un sistema tiene que esperar al silencio antes de poder actuar sobre lo dicho, lo que significa que no puede responder hasta que la conversación ya ha avanzado. Con parciales rápidos, un sistema puede reconocer un comando en el momento en que se pronuncia y meterse en la conversación, que es el comportamiento que la gente espera de una persona presente en la sala. Los agentes de voz que admiten barge-in dependen de esto. También los sistemas de subtitulado en vivo que necesitan seguir a un hablante rápido en lugar de ir tres frases por detrás.
La búsqueda es el segundo beneficiario. Un asistente de reuniones que puede buscar en la transcripción mientras se está escribiendo puede mostrar un documento en el momento en que surge el nombre de un proyecto, mientras la discusión aún está ocurriendo. Eso es un producto fundamentalmente distinto de una grabadora que produce notas consultables una hora después.
La extracción estructurada es el tercero. Si el texto parcial es lo bastante fiable, un modelo posterior puede empezar a leerlo antes de que termine la reunión, etiquetando decisiones y elementos de acción a medida que se pronuncian. La ganancia aquí viene de poder revisar el resultado mientras los participantes aún recuerdan qué querían decir, más que de la velocidad bruta.
Cada uno de esos comportamientos aumenta lo que está en juego con la estabilidad parcial. Una transcripción que se reescribe dos o tres veces por segundo hace que las tres funciones sean molestas en lugar de útiles, y por eso la historia más profunda del anuncio de Microsoft es la posición de precisión en los parciales y no la cifra de latencia por sí sola.
Dónde está el riesgo interesante
Las cifras de precisión de transcripción suelen presentarse como porcentajes agregados, y los porcentajes agregados ocultan la distribución que hay debajo. El rendimiento con habla con acento, alternancia de idiomas a mitad de frase, voces infantiles y micrófonos no estándar varía enormemente entre modelos, y esas son precisamente las condiciones en las que es más probable que se use un producto en vivo. Un modelo con una media sólida puede seguir siendo la elección equivocada para un centro de llamadas concreto cuyos clientes cambian de idioma a mitad de frase.
El segundo riesgo es más estratégico. Una vez que la transcripción es lo bastante rápida y barata como para ejecutarse de forma continua, el siguiente paso natural es ejecutarla siempre. Un modelo que cuesta medio dólar por hora hace que la escucha continua sea asequible de una forma que un modelo de precios por minuto no permitía, y la escucha continua es una grabación ambiental de todo lo que se dice cerca de un dispositivo. Esa es una decisión de gobernanza de datos que ninguna clasificación de precisión tomará por los equipos que compran esto.
MAI-Transcribe-2-Streaming es una pieza de infraestructura genuinamente útil, y la clasificación de precisión parcial es la parte que vale la pena seguir, porque mide la métrica de la que realmente dependen los productos en vivo. Lo que queda sin resolver es si una cifra de 100 milisegundos medida por el proveedor se mantiene en una sala con mala acústica y cuatro personas hablando a la vez. Esa es la prueba que todo comprador hará, en privado, antes de comprometer un pipeline de producción a ello.
Artículos relacionados
Step 5 se saltó cuatro números de versión, quedó segundo entre los modelos abiertos y nadie lo está llamando
La posición en los benchmarks es una señal que usan los productores para juzgar un modelo. El volumen de llamadas es una señal que producen los consumidores al usarlo.
Gemini Omni 1.1 Flash encadenó cuatro solicitudes en una toma de 40 segundos. El flujo de trabajo es el producto.
Google lanzó un pipeline de producción con un control de revisión incorporado en el precio.
Synthesia pasó una década grabando avatares. Ahora quiere que respondan.
Una herramienta de capacitación que las personas repiten voluntariamente es un producto distinto de una que completan porque alguien se la asignó.
Un modelo que se niega a escribir frases ahora procesa un billón de tokens al día
Un clasificador con una interfaz mucho mejor, dirigido al trabajo que el software ya quería estructurado.