← Volver al blog
Aiaprox. 8 min de lectura

Alibaba dividió en dos el agente de voz y luego recortó el precio hasta un 95 por ciento

Publicado 2 oct 2026
Alibaba dividió en dos el agente de voz y luego recortó el precio hasta un 95 por ciento

El equipo Qwen de Alibaba lanzó Qwen-Audio-3.1 en la última semana de septiembre de 2026, una pila de audio de cinco modelos que cubre reconocimiento de voz, conversión de texto a voz e interacción en tiempo real. Las cifras que más rápido circularon fueron los recortes de precio: alrededor de un 85 por ciento menos en el modelo en tiempo real, cerca de un 70 por ciento menos en texto a voz y hasta un 95 por ciento menos en reconocimiento automático de voz.

Las cifras importan, porque llegan en una semana en la que toda la industria estaba recortando precios. Microsoft, OpenAI y Anthropic lanzaron modelos más baratos o reequilibrados en el mismo tramo, y el movimiento de Alibaba se lee como una escalada deliberada en audio en concreto. Pero lo más interesante de Qwen-Audio-3.1 no es el descuento. Es cómo está construido el modelo insignia.

Dos modelos detrás de una sola voz

El modelo estrella es Qwen-Audio-3.1-Realtime, un sistema de voz full-duplex diseñado para agentes de voz que necesitan llamar a herramientas en mitad de una conversación.

Su decisión de diseño central es una división. En lugar de un único sistema grande de extremo a extremo que escucha y habla, Qwen ejecuta dos modelos con un codificador de audio y una columna vertebral de modelo de lenguaje compartidos. Un modelo de decisión predice si seguir escuchando, empezar a hablar, detenerse o reanudar. Un modelo generativo aparte se encarga del habla real. En términos sencillos, un modelo decide cuándo hablar y el otro decide qué decir.

Esa división es una respuesta práctica a un fallo concreto. Los agentes de voz suelen sentirse rotos no porque te entiendan mal, sino porque juzgan mal el momento. Hablan por encima de ti, o se quedan en silencio, o responden antes de que termines. El tratamiento habitual ha sido añadir la gestión de turnos a un modelo más grande y esperar que el comportamiento emerja. Qwen trata el «cuándo hablar» como un problema de ingeniería propio, con su propio modelo, separado de la generación de contenido. La compañía informa de que las respuestas dirigidas al interlocutor equivocado bajan de 0,13 a 0,03 en un benchmark, y de que la tasa de muletillas cae de 0,759 a 0,296 en otro. También informa de un compromiso: la tasa de reanudación no deseada tras una interrupción sube de 0,035 a 0,130, que es el tipo de divulgación que las notas de lanzamiento rara vez incluyen.

El modelo está disponible como API gestionada. Qwen-Audio-3.1-Realtime-Plus se ejecuta en QwenCloud a través de WebSocket. No hay pesos abiertos, algo que importa a quien siga el trabajo de imagen abierta de Qwen, porque la pila de audio se opera como un producto cerrado y gestionado.

Las especificaciones y el precio

El endpoint en tiempo real admite texto y audio tanto de entrada como de salida. El contexto llega a 262K tokens, con un máximo de 245K de entrada y 16K de salida. Los límites de rendimiento predeterminados son 60 solicitudes y 100.000 tokens por minuto. El precio es de 6,4 dólares por millón de tokens de audio de entrada y 0,8 dólares por millón de tokens de texto de entrada, con la salida combinada de texto y audio a 24 dólares por millón y el texto de salida sin coste alguno. La llamada a funciones, la búsqueda web, las salidas estructuradas, el almacenamiento en caché de contexto y el ajuste fino vienen integrados.

Un modelo complementario, Qwen-Audio-3.1-ASR-Flash-Filetrans, está orientado a la transcripción offline de audio largo. Admite palabras clave, separación de hablantes, puntuación y reconocimiento en múltiples idiomas además de dialectos chinos, a 0,15 dólares de entrada y 0,47 dólares de salida por millón de tokens. Para cualquiera que haya calculado el precio de la transcripción de formato largo a escala, es una caída pronunciada en lo que solía ser un coste fijo.

La historia del entrenamiento se organiza en tres capas, que Qwen denomina Think, Act y Speak. La capa Think reancla el modelo de audio a un modelo de texto de origen usando datos emparejados a escala de millones de horas, y luego aplica destilación on-policy en lugar de imitación de respuestas preescritas. La capa Act construye entornos ejecutables, cada uno con un conjunto de herramientas, una base de datos con estado y una política de negocio escrita, y las tareas se puntúan primero por el estado final. La capa Speak decide si hablar, cuándo y cómo.

El detalle de la capa Act es el que merece una pausa. La puntuación comprueba el estado resultante antes de comprobar la redacción, así que una respuesta fluida no puede rescatar una acción fallida. Esa es la forma correcta de evaluar a un agente que se supone que hace algo en lugar de charlar sobre ello.

Por qué la guerra de precios es la verdadera historia

Si dejamos a un lado la arquitectura, Qwen-Audio-3.1 es un movimiento estratégico claro: Alibaba compite con OpenAI y Google en el coste y la latencia de la infraestructura de voz, y no en la apertura.

La comparación que hace esto legible es la latencia. Qwen informa de una latencia de parada ante interrupción de aproximadamente 1,116 segundos, frente a 0,383 segundos de GPT-Realtime-2. Tardar más en detenerse cuando un usuario interrumpe es una debilidad visible, y el hecho de que Qwen lo publicara junto a las victorias dice algo sobre el estado de la cultura de benchmarks en audio, donde las cifras honestas siguen siendo un diferenciador.

Para los desarrolladores, el efecto práctico es un backend más barato. Si el habla en tiempo real es un 85 por ciento más barata y el reconocimiento hasta un 95 por ciento más barato, entonces las funciones de voz que antes se reservaban a los planes premium se vuelven viables en productos corrientes. La escucha permanente, la traducción en vivo y las interfaces habladas para agentes están todas aguas abajo de esa curva de costes. Cuando el coste de un minuto hablado se desploma, decisiones de producto que eran inasequibles el trimestre pasado se vuelven obvias en este.

La advertencia es la que se aplica a toda API gestionada. Obtienes el comportamiento, no las tripas. No puedes inspeccionar el modelo de gestión de turnos, ni ajustar la lógica de decisión con tus propios datos de una forma que controles por completo, ni ejecutar la pila en tu propio hardware. Para la mayoría de las startups es un intercambio aceptable. Para quien construya algo donde el perfil de latencia o la ruta de los datos sea el producto, es una dependencia que conviene incluir en el precio.

El contexto competitivo afila el argumento. En el mismo tramo de septiembre, OpenAI y Anthropic lanzaron modelos planteados para hacer más trabajo a menor coste, y Microsoft añadió un modelo de transcripción en streaming y dos modelos de texto a voz a su línea propia. El audio ya no es un rincón tranquilo donde un laboratorio más pequeño pueda ser el mejor sin que nadie se entere. Es una categoría en la que los actores más grandes compiten en precio y latencia en público, lo que es una buena noticia para los compradores y un aprieto para quien cobre una prima por la voz.

Qué hay que vigilar

La pregunta obvia es si Qwen acabará liberando como código abierto alguna parte de esta pila, y cómo aguanta el diseño de dos modelos bajo una carga real de llamadas a herramientas multiturno en lugar de en condiciones de benchmark. Separar la gestión de turnos del contenido es elegante sobre el papel. Si sigue siendo elegante cuando un usuario interrumpe, cambia de opinión y cambia de tarea a mitad de frase es el tipo de pregunta que las demos no responden.

Por ahora, la conclusión es más acotada y más clara. Alibaba ha tomado la parte de los agentes de voz que se sentía más rota, le ha puesto nombre y le ha dado un modelo dedicado. Después recortó el precio hasta que toda la categoría se abarató. Si el próximo año de productos de voz se construye sobre un habla más barata y más interrumpible, este lanzamiento parecerá una de las razones.

Artículos relacionados