Alibaba scinde l'agent vocal en deux, puis réduit le prix jusqu'à 95 %

L'équipe Qwen d'Alibaba a publié Qwen-Audio-3.1 lors de la dernière semaine de septembre 2026, une pile audio de cinq modèles couvrant la reconnaissance vocale, la synthèse vocale et l'interaction en temps réel. Les chiffres qui ont le plus circulé étaient les baisses de prix : environ 85 % de réduction sur le modèle temps réel, environ 70 % sur la synthèse vocale, et jusqu'à 95 % sur la reconnaissance automatique de la parole.
Ces chiffres comptent, car ils tombent dans une semaine où toute l'industrie réduisait ses prix. Microsoft, OpenAI et Anthropic ont tous livré des modèles moins chers ou rééquilibrés dans la même période, et le geste d'Alibaba se lit comme une escalade délibérée sur l'audio en particulier. Mais ce qui est plus intéressant dans Qwen-Audio-3.1, ce n'est pas la remise. C'est la façon dont le modèle phare est construit.
Deux modèles derrière une seule voix
Le modèle vedette est Qwen-Audio-3.1-Realtime, un système vocal full-duplex conçu pour les agents vocaux qui doivent appeler des outils au milieu d'une conversation.
Sa décision de conception centrale est une séparation. Au lieu d'un grand système bout en bout qui écoute et parle, Qwen fait tourner deux modèles avec un encodeur audio et un socle de modèle de langage partagés. Un modèle de décision prédit s'il faut continuer à écouter, commencer à parler, s'arrêter ou reprendre. Un modèle génératif distinct gère la parole proprement dite. En clair, un modèle décide quand parler et l'autre décide quoi dire.
Cette séparation est une réponse pratique à une défaillance précise. Les agents vocaux semblent cassés le plus souvent non pas parce qu'ils vous comprennent mal, mais parce qu'ils jugent mal le moment. Ils parlent par-dessus vous, ou restent silencieux, ou répondent avant que vous ayez fini. Le traitement consistait généralement à greffer la gestion des tours de parole sur un modèle plus gros en espérant que le comportement émerge. Qwen traite le « moment de parler » comme un problème d'ingénierie à part entière, avec son propre modèle, distinct de la génération de contenu. L'entreprise rapporte que les réponses adressées au mauvais locuteur passent de 0,13 à 0,03 sur un benchmark, et que le taux de mots de remplissage chute de 0,759 à 0,296 sur un autre. Elle rapporte aussi un compromis : le taux de reprise indésirable après une interruption passe de 0,035 à 0,130, le genre de divulgation que les notes de version incluent rarement.
Le modèle est disponible sous forme d'API managée. Qwen-Audio-3.1-Realtime-Plus tourne sur QwenCloud via WebSocket. Il n'y a pas de poids ouverts, ce qui compte pour quiconque suit le travail de Qwen sur les images ouvertes, car la pile audio est exploitée comme un produit fermé et managé.
Les spécifications et la tarification
Le point de terminaison temps réel accepte le texte et l'audio en entrée comme en sortie. Le contexte va jusqu'à 262 K tokens, avec un maximum de 245 K en entrée et 16 K en sortie. Les limites de débit par défaut sont de 60 requêtes et 100 000 tokens par minute. La tarification est de 6,4 $ par million de tokens d'entrée audio et 0,8 $ par million de tokens d'entrée texte, la sortie combinée texte et audio étant à 24 $ par million et le texte en sortie n'étant pas facturé du tout. L'appel de fonctions, la recherche web, les sorties structurées, la mise en cache du contexte et le fine-tuning sont tous intégrés.
Un modèle compagnon, Qwen-Audio-3.1-ASR-Flash-Filetrans, cible la transcription hors ligne d'audio long. Il prend en charge les mots-clés personnalisés, la séparation des locuteurs, la ponctuation et la reconnaissance dans plusieurs langues ainsi que des dialectes chinois, à 0,15 $ en entrée et 0,47 $ en sortie par million de tokens. Pour quiconque a chiffré la transcription longue à grande échelle, c'est une chute brutale de ce qui était autrefois un coût fixe.
L'histoire de l'entraînement s'organise en trois couches, que Qwen nomme Think, Act et Speak. La couche Think réancre le modèle audio sur un modèle texte source à l'aide de données appariées à l'échelle du million d'heures, puis applique une distillation on-policy plutôt qu'une imitation de réponses préécrites. La couche Act construit des environnements exécutables, chacun regroupant un pool d'outils, une base de données à état et une politique métier écrite, les tâches étant notées d'abord sur l'état terminal. La couche Speak décide si, quand et comment parler.
Le détail de la couche Act mérite qu'on s'y arrête. La notation vérifie l'état résultant avant de vérifier la formulation, de sorte qu'une réponse fluide ne peut pas sauver une action échouée. C'est la bonne façon d'évaluer un agent censé faire quelque chose plutôt que d'en discuter.
Pourquoi la guerre des prix est la vraie histoire
Si l'on met de côté l'architecture, Qwen-Audio-3.1 est un mouvement stratégique clair : Alibaba rivalise avec OpenAI et Google sur le coût et la latence de l'infrastructure vocale plutôt que sur l'ouverture.
La comparaison qui rend cela lisible est la latence. Qwen rapporte une latence d'arrêt sur interruption d'environ 1,116 seconde, contre 0,383 seconde pour GPT-Realtime-2. Être plus lent à s'arrêter quand un utilisateur interrompt est une faiblesse visible, et le fait que Qwen l'ait publiée aux côtés des victoires dit quelque chose de l'état de la culture du benchmark dans l'audio, où des chiffres honnêtes restent un facteur différenciant.
Pour les développeurs, l'effet pratique est un backend moins cher. Si la parole en temps réel coûte 85 % de moins et la reconnaissance jusqu'à 95 % de moins, alors des fonctionnalités vocales jusque-là réservées aux offres premium deviennent viables dans des produits ordinaires. L'écoute permanente, la traduction en direct et les interfaces parlées pour les agents se situent tous en aval de cette courbe de coûts. Quand le coût d'une minute parlée s'effondre, des décisions produit inabordables le trimestre précédent deviennent évidentes le trimestre suivant.
La réserve est celle qui s'applique à toute API managée. Vous obtenez le comportement, pas les rouages internes. Vous ne pouvez pas inspecter le modèle de gestion des tours de parole, affiner la logique de décision sur vos propres données d'une manière que vous contrôlez pleinement, ni exécuter la pile sur votre propre matériel. Pour la plupart des startups, c'est un compromis acceptable. Pour quiconque construit quelque chose où le profil de latence ou le chemin des données est le produit, c'est une dépendance qu'il faut intégrer au calcul.
Le contexte concurrentiel aiguise le propos. Dans la même période de septembre, OpenAI et Anthropic ont tous deux livré des modèles présentés comme faisant plus de travail à moindre coût, et Microsoft a ajouté un modèle de transcription en flux et deux modèles de synthèse vocale à sa gamme interne. L'audio n'est plus un coin tranquille où un petit laboratoire peut être le meilleur sans que personne ne le remarque. C'est une catégorie où les plus grands acteurs rivalisent publiquement sur le prix et la latence, ce qui est une bonne nouvelle pour les acheteurs et une pression pour quiconque facture la voix au prix fort.
Ce qu'il faut surveiller
La question évidente est de savoir si Qwen finira par ouvrir une partie de cette pile, et comment la conception à deux modèles résiste à une véritable charge d'appels d'outils multi-tours plutôt qu'à des conditions de benchmark. Séparer la gestion des tours de parole du contenu est élégant sur le papier. Savoir si cela reste élégant quand un utilisateur interrompt, change d'avis et passe à une autre tâche en pleine phrase est le genre de question à laquelle les démos ne répondent pas.
Pour l'instant, la conclusion est plus étroite et plus claire. Alibaba a pris la partie des agents vocaux qui semblait la plus cassée, l'a nommée et lui a donné un modèle dédié. Puis il a baissé le prix jusqu'à ce que toute la catégorie devienne moins chère. Si l'année à venir de produits vocaux se construit sur une parole moins chère et plus interruptible, cette sortie apparaîtra comme l'une des raisons.
Articles associés
Un semi-humanoïde à roues a terminé une heure de lessive sans aide
Des tâches individuelles peuvent réussir alors qu'un flux de travail échoue encore. Dyna a changé la métrique.
LTX 2.5 veut transformer votre brouillon Blender en un plan finalisé
En texte-vidéo, vous ne contrôlez pas ce qui se passe. Cet outil tente d'y remédier.
ServiceNow transforme les échecs des agents en données d'entraînement
La génération sans vérification est du bruit. Les portes sont le produit.
Un seul cadre pour le langage et la vision : le modèle ouvert 1,6B d’Horizon
Un pari : les ponts entre le langage et la vision n’ont jamais été nécessaires.