← Retour au blog
AiEnviron 9 min de lecture

Microsoft réduit la latence des transcriptions partielles à 100 millisecondes. Cela change la vocation de la transcription.

Publié le 5 oct. 2026
Microsoft réduit la latence des transcriptions partielles à 100 millisecondes. Cela change la vocation de la transcription.

Le 2 octobre 2026, Microsoft AI a annoncé MAI-Transcribe-2-Streaming, un modèle de reconnaissance vocale qui renvoie des transcriptions partielles en un peu plus de 100 millisecondes dans 60 langues. Il occupe la première place sur Artificial Analysis pour l'exactitude des transcriptions finales et partielles. Le tarif de lancement est de 0,54 $ par heure d'audio jusqu'à la fin de l'année.

L'entreprise a également annoncé MAI-Voice-2.1 et MAI-Voice-2.1-Flash, couvrant 23 langues et 26 locales. Le modèle est accessible via Azure Speech, Microsoft Foundry, le MAI Playground, OpenRouter sous l'identifiant microsoft/mai-transcribe-2, Vercel et Azure Voice Live, avec une intégration LiveKit annoncée comme prochainement disponible.

Cent millisecondes est un seuil, pas une curiosité de benchmark. Il se situe à la limite de ce que les gens perçoivent comme instantané. En dessous, une interface peut répondre pendant que quelqu'un parle encore, et c'est la différence entre un produit qui produit un document et un produit qui participe à une conversation.

Gros plan extrême d'un diaphragme de microphone dans une fine grille dorée sous une lumière cyan

Pourquoi l'exactitude finale n'a jamais été toute l'histoire

La reconnaissance vocale est une catégorie mature depuis des années, et les classements ont principalement mesuré une chose : avec quelle exactitude un modèle retranscrit un énoncé complet une fois que le locuteur s'est arrêté. Cette métrique répond à la question qui intéresse un service de transcription. Elle ne répond pas à la question qui intéresse un produit en direct.

Un assistant de réunion qui n'affiche les mots qu'après que le locuteur a fini est un enregistreur avec un meilleur formatage. Un assistant de réunion qui affiche les mots à mesure qu'ils arrivent peut mettre en évidence le locuteur actuel, faire apparaître un nom au moment où il est mentionné, déclencher une recherche pendant que le sujet est encore à l'ordre du jour et permettre à quelqu'un de revenir en arrière au milieu d'une phrase sans perdre sa place. Tout cela dépend de la latence partielle plutôt que de l'exactitude finale.

L'exactitude partielle est le problème le plus difficile, et c'est celui qu'Artificial Analysis suit désormais séparément. Générer une estimation stable avant que la phrase soit terminée implique de s'engager sur une interprétation qu'il faudra peut-être réviser. Les modèles qui révisent constamment produisent un texte qui scintille, ce qui est pire qu'attendre. Les modèles qui s'engagent trop agressivement laissent des erreurs à l'écran. Le classement sur les partielles récompense le modèle qui obtient le texte intermédiaire correct suffisamment souvent pour qu'un lecteur puisse faire confiance à ce qu'il voit.

Le fait que Microsoft revendique la première place sur les deux tableaux signifie qu'il ne sacrifie pas la stabilité intermédiaire à l'exactitude finale, ce qui est la façon habituelle dont les modèles achètent la vitesse partielle. Cette combinaison est la véritable annonce.

Le chiffre de 100 millisecondes

La latence de bout en bout en reconnaissance en flux est une chaîne, pas un chiffre unique. L'audio arrive par trames. Un modèle de détection de fin d'énoncé décide quand un énoncé a pu se terminer. Le modèle de reconnaissance produit du texte. Un système en aval l'affiche. Chaque maillon ajoute du délai, et le total détermine si l'expérience semble en direct.

Le chiffre de 100 millisecondes de Microsoft couvre la sortie du modèle lui-même, sur la base de la propre mesure de l'entreprise et du classement d'Artificial Analysis, plutôt que d'un audit de latence indépendant. La comparaison pertinente consiste à savoir si ce chiffre tient dans les conditions que crée un produit en direct, ce qui est une question différente d'une lecture au chronomètre isolée : plusieurs locuteurs, du bruit de fond, un mauvais microphone de conférence et 60 langues arrivant dans le même pipeline. Les fournisseurs publient rarement des distributions de latence dans ces conditions, et ce sont elles qui déterminent si un produit de réunion est utilisable dans une vraie réunion.

La structure tarifaire constitue l'autre moitié de l'histoire. 0,54 $ par heure d'audio est un tarif de lancement qui court jusqu'à la fin de l'année, ce qui indique que Microsoft s'attend à le modifier. L'intention stratégique est lisible. La transcription en flux est la couche d'entrée de chaque assistant de réunion, produit d'analyse de centre d'appels et service de sous-titrage en direct. Être l'option rapide la moins chère pour 60 langues est un pari de distribution, et la distribution dans une couche d'entrée est très fidélisante, car la deuxième équipe à changer de fournisseur doit reconstruire sa gestion pour un ensemble différent de comportements intermédiaires.

Avec quoi cela entre en concurrence

Microsoft n'entre pas dans un champ vide. Deepgram, AssemblyAI et Speechmatics ont tous bâti des activités sur l'exactitude en flux et la faible latence, et Google et Amazon intègrent une reconnaissance compétitive dans leurs propres piles cloud. L'acheteur réaliste est un développeur qui exécute déjà sur Azure, apprécie le fait que MAI-Transcribe-2-Streaming apparaisse dans Foundry et OpenRouter aux côtés du reste de la famille MAI, et préférerait ne pas maintenir une seconde relation fournisseur pour un seul composant.

L'annonce de MAI-Voice-2.1 compte aussi ici, et l'appariement est délibéré. La reconnaissance vocale et la synthèse vocale sont les deux extrémités de la même conversation, et une plateforme qui vend les deux peut proposer un pipeline unique : audio en entrée, transcription en sortie, réponse synthétisée, parole renvoyée. L'ajout de 23 langues et 26 locales du côté de la synthèse élargit le nombre de marchés où ce pipeline peut être vendu comme un seul produit.

Ce que les partielles rapides changent dans la conception produit

Une fois que le texte intermédiaire arrive en un dixième de seconde, un ensemble de décisions d'interface qui étaient auparavant déraisonnables deviennent ordinaires.

Prenons l'interruption. Si une transcription ne se stabilise qu'après qu'un locuteur s'est arrêté, un système doit attendre le silence avant de pouvoir agir sur ce qui a été dit, ce qui signifie qu'il ne peut pas répondre avant que la conversation ait déjà avancé. Avec des partielles rapides, un système peut reconnaître une commande au moment où elle est prononcée et interrompre, ce qui est le comportement que les gens attendent d'une personne présente dans la pièce. Les agents vocaux qui prennent en charge l'interruption dépendent de cela. Tout comme les systèmes de sous-titrage en direct qui doivent suivre un locuteur rapide au lieu de traîner trois phrases derrière.

La recherche est le deuxième bénéficiaire. Un assistant de réunion qui peut effectuer une recherche dans la transcription au fur et à mesure qu'elle s'écrit peut faire apparaître un document au moment où un nom de projet est mentionné, pendant que la discussion est encore en cours. C'est un produit fondamentalement différent d'un enregistreur qui produit des notes consultables une heure plus tard.

L'extraction structurée est le troisième. Si le texte partiel est suffisamment fiable, un modèle en aval peut commencer à le lire avant la fin de la réunion, en étiquetant les décisions et les tâches au moment où elles sont énoncées. Le gain vient ici de la possibilité de revoir la sortie pendant que les participants se souviennent encore de ce qu'ils voulaient dire, plutôt que de la vitesse brute.

Chacun de ces comportements augmente l'enjeu de la stabilité partielle. Une transcription qui se réécrit deux ou trois fois par seconde rend ces trois fonctionnalités ennuyeuses plutôt qu'utiles, ce qui explique pourquoi l'histoire plus profonde de l'annonce de Microsoft est le classement d'exactitude sur les partielles plutôt que le chiffre de latence en lui-même.

Où se situe le risque intéressant

Les chiffres d'exactitude de transcription sont généralement rapportés sous forme de pourcentages agrégés, et les pourcentages agrégés masquent la distribution sous-jacente. La performance sur les accents, le passage d'une langue à l'autre au milieu d'une phrase, les voix d'enfants et les microphones non standard varie énormément d'un modèle à l'autre, et ce sont précisément les conditions dans lesquelles un produit en direct est le plus susceptible d'être utilisé. Un modèle qui affiche une moyenne solide peut rester le mauvais choix pour un centre d'appels spécifique dont les clients changent de langue au milieu d'une phrase.

Le deuxième risque est plus stratégique. Une fois que la transcription est assez rapide et bon marché pour tourner en continu, l'étape naturelle suivante est de la faire tourner en permanence. Un modèle qui coûte un demi-dollar par heure rend l'écoute continue abordable d'une manière qu'un tarif à la minute ne permettait pas, et l'écoute continue est un enregistrement ambiant de tout ce qui est dit près d'un appareil. C'est une décision de gouvernance des données qu'aucun classement d'exactitude ne prendra à la place des équipes qui achètent cela.

MAI-Transcribe-2-Streaming est une brique d'infrastructure réellement utile, et le classement d'exactitude partielle est l'élément à surveiller, car il mesure la métrique dont les produits en direct dépendent réellement. Ce qui reste non résolu est de savoir si un chiffre de 100 millisecondes mesuré par le fournisseur tient dans une pièce à mauvaise acoustique avec quatre personnes qui se coupent la parole. C'est le test que chaque acheteur effectuera, en privé, avant d'y engager un pipeline de production.

Articles associés