← Volver al blog
Aiaprox. 8 min de lectura

AssemblyAI redujo la latencia del habla en tiempo real a 91 milisegundos. Esta es la razón por la que esa cifra importa

Publicado 7 oct 2026
AssemblyAI redujo la latencia del habla en tiempo real a 91 milisegundos. Esta es la razón por la que esa cifra importa

AssemblyAI lanzó Universal 3.6 Pro Realtime, su nuevo modelo de reconocimiento de voz en streaming. La tasa de error de palabras bajó al 1,77 por ciento. En pruebas con más de 1.000 grabaciones de llamadas, la latencia mediana desde el final del habla hasta la salida de texto final fue de 91 milisegundos. La latencia P95 cayó de 692 milisegundos a 225.

Parecen mejoras incrementales sobre una tecnología madura. Están más cerca de un evento umbral, debido a la cifra específica que se movió.

Por qué 91 milisegundos es un producto diferente

El reconocimiento de voz ha sido lo bastante preciso para dictado durante años. La restricción para las aplicaciones conversacionales nunca ha sido la tasa de error de palabras. Ha sido la toma de turnos.

La conversación humana funciona con superposición rápida. La brecha mediana entre que un hablante termina y el siguiente empieza es de alrededor de 200 milisegundos, y la brecha se reduce en conversaciones familiares y se reduce aún más en una discusión. Ese es el presupuesto dentro del cual tiene que encajar cualquier sistema conversacional.

Con 692 milisegundos de latencia P95, un agente de voz está perceptiblemente por detrás. Los usuarios se adaptan (hacen pausas, repiten, hablan por encima del sistema) y la interacción adquiere una cualidad ligeramente forzada que todos reconocen como hablar con una máquina. Con 225 milisegundos de P95, el agente está dentro del rango de una respuesta humana reflexiva. Con una mediana de 91 milisegundos, es más rápido que la mayoría de las personas.

Esa es la diferencia entre un agente de voz que funciona como demo y uno que funciona como producto. Y la mejora va mucho más allá de un factor de dos, porque la distribución importa tanto como la mediana. Reducir la P95 de 692 a 225 significa que la cola (las respuestas que hacían que las conversaciones se sintieran rotas) se ha eliminado en gran medida.

Hay una consecuencia de diseño que se deriva de esto y que a menudo se pasa por alto. Cuando el reconocimiento es lento, los equipos de producto compensan haciendo que el agente tome turnos más largos: espera una pausa clara, habla en párrafos completos, evita superponerse con el usuario por completo. Esas compensaciones producen un estilo conversacional específico que los usuarios reconocen como robótico incluso cuando las palabras son naturales.

Cuando el reconocimiento es rápido, el agente puede usar turnos cortos. Puede dar una señal de reconocimiento mientras el usuario todavía está hablando. Puede interponer una pregunta aclaratoria en el momento en que aparece la ambigüedad en lugar de después de que termina la frase. El estilo conversacional solo queda disponible después de que el presupuesto de latencia lo permite, lo que significa que la mejora de latencia desbloquea un diseño de interacción diferente en lugar de simplemente mejorar cómo se siente el actual.

Qué más incluye el lanzamiento

El modelo integra detección de turnos consciente de entidades: sabe cuándo una entidad reconocida, como un número de teléfono o una dirección, está completa, en lugar de tratar silencios adyacentes a la puntuación como el final de un turno. También añade corrección de ruido de fondo.

Ambas funciones apuntan al mismo problema: que los entornos de voz de producción son desordenados. El audio de un centro de llamadas tiene música en espera, ruido de teclado, cruce de voces y acentos. La detección de turnos que depende de umbrales de silencio simples cortará a los hablantes a mitad de cláusula cada vez que hagan una pausa para pensar, y mantendrá la línea abierta durante ruido que suena como habla.

La detección consciente de entidades aborda una categoría específica y costosa de error: un sistema que trata “mi número es cinco cinco cinco” como un turno completo generará una respuesta a una frase a medio terminar, y el usuario empezará de nuevo. A lo largo de una llamada, esos reinicios son la diferencia entre una interacción de dos minutos y una de seis.

Dónde encaja esto en el stack de agentes

El momento no es casual. La misma semana, Decagon anunció Voice 3 y un framework llamado PACT dirigido a preparar el soporte al cliente para llamantes que son ellos mismos agentes. Anthropic ha estado construyendo niveles de verificación cibernética. OpenAI abrió una API de decisiones. La capa de infraestructura de agentes se está construyendo en todas direcciones a la vez, y la voz es la interfaz donde el presupuesto de latencia es más ajustado.

La razón por la que la voz es la más ajustada: los agentes de texto pueden ser lentos. Un usuario que escribe en una ventana de chat tolerará varios segundos de tiempo de pensamiento, porque el modelo de interacción ya incluye esperar. Un usuario en una llamada telefónica no lo hará. Un silencio de más de un segundo se interpreta como desconexión, y el usuario dice “¿hola?” antes de que el sistema haya terminado de procesar.

Esa asimetría significa que el reconocimiento de voz en tiempo real no es un componente entre muchos en un producto de voz. Establece el techo de lo que el producto puede ser. Un agente de voz con un razonamiento excelente y 700 milisegundos de latencia de reconocimiento es un agente de voz lento, independientemente de lo bueno que sea el razonamiento, porque el razonamiento nunca tiene la oportunidad de ejecutarse sobre un turno limpio.

Qué cuesta una tasa de error del 1,77 por ciento

La cifra de tasa de error de palabras necesita contexto. En habla leída limpia, los mejores modelos han estado por debajo del 3 por ciento desde hace tiempo. En audio ruidoso de centros de llamadas con nombres, números de cuenta y direcciones, las tasas de error históricamente son mucho más altas, y ahí es donde la precisión de entidades importa más que la tasa de error de palabras agregada.

Una tasa de error del 1,77 por ciento en el conjunto de prueba del proveedor no te dice qué ocurre con tu audio. Los detalles que importan para la compra son más estrechos: precisión en nombres propios, precisión en cadenas alfanuméricas (números de cuenta, códigos de confirmación) y precisión cuando el hablante no es nativo de la lengua que se reconoce.

Esa última es donde fallan la mayoría de los sistemas de producción y donde la mayoría de los benchmarks no miden. La variación de acento produce errores sistemáticos, no aleatorios; un reconocedor que oye consistentemente “fifteen” como “fifty” no se arreglará promediando. La detección de turnos consciente de entidades de AssemblyAI ayuda con la consecuencia posterior, pero la precisión de transcripción en habla con acento es una evaluación aparte.

La lectura práctica

Para cualquiera que construya voz, el lanzamiento cambia lo que vale la pena intentar. El reconocimiento en streaming con latencia conversacional significa que un producto puede manejar interrupciones, idas y venidas rápidas, y los tipos de turnos superpuestos que contienen las conversaciones reales. Las aplicaciones que antes eran técnicamente posibles pero se sentían mal al usarlas ahora vale la pena construirlas.

La dimensión de costo importa junto con la latencia. El reconocimiento en streaming a este ritmo tiene que ejecutarse continuamente durante una llamada, lo que significa que la factura de cómputo escala con el tiempo de conversación en lugar de con el audio transcrito. Para un despliegue de alto volumen, eso cambia la economía unitaria, y vale la pena modelarlo antes de comprometerse con una arquitectura que asume reconocimiento siempre activo.

Tres cosas que hay que probar en lugar de asumir. Latencia en P99, no P95, porque el peor 1 por ciento de los turnos es lo que los usuarios recuerdan. Precisión con tu propio audio, no con el conjunto de benchmarks del proveedor, con especial atención a nombres y números. Y comportamiento ante interrupciones, ya que un sistema que maneja la toma de turnos limpia pero se congela cuando un usuario habla por encima fallará exactamente en las conversaciones donde la voz más importa.

Hay una cuarta prueba que la mayoría de las evaluaciones se salta: qué ocurre cuando el reconocimiento se equivoca. Todo reconocedor oirá mal algo, y la calidad de un producto de voz depende en gran medida de cómo se recupera, si pide aclaración, si continúa silenciosamente con una transcripción errónea, si puede identificar que una cadena de palabras es implausible en contexto y preguntar de nuevo. Un modelo con una tasa de error del 1,77 por ciento que nunca detecta sus propios errores es menos útil en la práctica que uno con una tasa de error mayor y buenas señales de incertidumbre.

El cambio más grande es que el habla ya no es el cuello de botella que era. La pregunta para los equipos de productos de voz a finales de 2026 es si el resto del stack (el razonamiento, la ejecución de acciones, la recuperación de errores) es lo bastante rápido para seguir el ritmo de un oído que ahora funciona a velocidad humana.

Artículos relacionados