A Microsoft reduziu a latência de transcrições parciais para 100 milissegundos. Isso muda para que serve a transcrição.

Em 2 de outubro de 2026, a Microsoft AI anunciou o MAI-Transcribe-2-Streaming, um modelo de reconhecimento de fala que retorna transcrições parciais em pouco mais de 100 milissegundos em 60 idiomas. Ele ocupa o primeiro lugar no Artificial Analysis tanto em precisão de transcrições finais quanto parciais. O preço introdutório é de US$ 0,54 por hora de áudio até o fim do ano.
A empresa também anunciou o MAI-Voice-2.1 e o MAI-Voice-2.1-Flash, cobrindo 23 idiomas e 26 localidades. O modelo pode ser acessado pelo Azure Speech, Microsoft Foundry, MAI Playground, OpenRouter sob o id microsoft/mai-transcribe-2, Vercel e Azure Voice Live, com uma integração com o LiveKit listada como em breve.
Cem milissegundos é um limiar, não uma curiosidade de benchmark. Fica no limite daquilo que as pessoas percebem como instantâneo. Abaixo disso, uma interface pode responder enquanto alguém ainda está falando, e essa é a diferença entre um produto que produz um documento e um produto que participa de uma conversa.

Por que a precisão final nunca foi a história completa
O reconhecimento de fala é uma categoria madura há anos, e os rankings medem basicamente uma coisa: com que precisão um modelo reproduz um enunciado completo depois que o falante para. Essa métrica responde à pergunta com que se importa um serviço de transcrição. Não responde à pergunta com que se importa um produto ao vivo.
Um assistente de reunião que só mostra palavras depois que o falante termina é um gravador com formatação melhor. Um assistente de reunião que mostra palavras conforme elas chegam pode destacar o falante atual, exibir um nome no momento em que é mencionado, disparar uma busca enquanto o assunto ainda está em pauta e permitir que alguém volte no meio da frase sem perder o lugar. Tudo isso depende da latência das parciais, e não da precisão final.
A precisão das parciais é o problema mais difícil, e é ela que o Artificial Analysis agora acompanha separadamente. Gerar um palpite estável antes de a frase terminar significa assumir uma interpretação que talvez seja preciso revisar. Modelos que revisam o tempo todo produzem texto que pisca, o que é pior do que esperar. Modelos que se comprometem de forma agressiva demais deixam erros na tela. A classificação em parciais recompensa o modelo que acerta o texto provisório com frequência suficiente para que o leitor possa confiar no que está vendo.
O fato de a Microsoft reivindicar o primeiro lugar nos dois rankings significa que ela não está trocando estabilidade provisória por correção final, que é a forma habitual como os modelos compram velocidade nas parciais. Essa combinação é o anúncio de fato.
O número de 100 milissegundos
A latência ponta a ponta no reconhecimento em streaming é uma corrente, não um número isolado. O áudio chega em quadros. Um modelo de detecção de fim de fala decide quando um enunciado pode ter terminado. O modelo de reconhecimento produz texto. Um sistema downstream o renderiza. Cada elo acrescenta atraso, e o total determina se a experiência parece ao vivo.
O número de 100 milissegundos da Microsoft cobre a saída do próprio modelo, com base na medição da própria empresa e na posição no Artificial Analysis, e não em uma auditoria independente de latência. A comparação relevante é se o número se sustenta nas condições que um produto ao vivo cria, o que é uma pergunta diferente de uma leitura de cronômetro isolada: vários falantes, ruído de fundo, um microfone de conferência ruim e 60 idiomas chegando pelo mesmo pipeline. Os fornecedores raramente publicam distribuições de latência nessas condições, e são justamente elas que determinam se um produto de reunião é utilizável em uma reunião real.
A estrutura de preços é a outra metade da história. US$ 0,54 por hora de áudio é uma tarifa introdutória válida até o fim do ano, o que indica que a Microsoft espera alterá-la. A intenção estratégica é legível. A transcrição em streaming é a camada de entrada de todo assistente de reunião, produto de análise de call center e serviço de legendagem ao vivo. Ser a opção rápida mais barata para 60 idiomas é uma jogada de distribuição, e a distribuição em uma camada de entrada é pegajosa, porque a segunda equipe a trocar de fornecedor precisa reconstruir seu tratamento para um conjunto diferente de comportamentos provisórios.
Com o que isso compete
A Microsoft não está entrando em um campo vazio. Deepgram, AssemblyAI e Speechmatics construíram negócios com base em precisão de streaming e baixa latência, e Google e Amazon empacotam reconhecimento competitivo em suas próprias pilhas de nuvem. O comprador realista é um desenvolvedor que já opera na Azure, valoriza o fato de o MAI-Transcribe-2-Streaming aparecer no Foundry e no OpenRouter junto com o restante da família MAI e prefere não manter uma segunda relação com fornecedor para um único componente.
O anúncio do MAI-Voice-2.1 também importa aqui, e o pareamento é deliberado. Reconhecimento de fala e síntese de fala são as duas pontas da mesma conversa, e uma plataforma que vende ambas pode propor um único pipeline: áudio entra, transcrição sai, resposta sintetizada, fala retornada. Acrescentar 23 idiomas e 26 localidades no lado da síntese amplia o número de mercados onde esse pipeline pode ser vendido como um único produto.
O que as parciais rápidas mudam no design de produto
Quando o texto provisório chega em menos de um décimo de segundo, um conjunto de decisões de interface que antes eram desarrazoadas se torna comum.
Considere a interrupção. Se uma transcrição só se firma depois que o falante para, um sistema precisa esperar pelo silêncio antes de agir sobre o que foi dito, o que significa que ele não pode responder até que a conversa já tenha avançado. Com parciais rápidas, um sistema pode reconhecer um comando no momento em que ele é falado e interromper, que é o comportamento que as pessoas esperam de alguém presente na sala. Agentes de voz que suportam barge-in dependem disso. Também dependem disso os sistemas de legendagem ao vivo que precisam acompanhar um falante rápido em vez de ficar três frases atrás.
A busca é o segundo beneficiário. Um assistente de reunião que consegue buscar na transcrição enquanto ela está sendo escrita pode mostrar um documento no momento em que o nome de um projeto surge, enquanto a discussão ainda acontece. Esse é um produto fundamentalmente diferente de um gravador que produz notas pesquisáveis uma hora depois.
A extração estruturada é o terceiro. Se o texto parcial for confiável o bastante, um modelo downstream pode começar a lê-lo antes de a reunião terminar, marcando decisões e itens de ação conforme são falados. O ganho aqui vem de poder revisar a saída enquanto os participantes ainda se lembram do que queriam dizer, e não da velocidade bruta.
Cada um desses comportamentos aumenta a aposta na estabilidade das parciais. Uma transcrição que se reescreve duas ou três vezes por segundo torna as três funcionalidades irritantes em vez de úteis, e é por isso que a história mais profunda no anúncio da Microsoft é a posição de precisão em parciais, e não o número de latência por si só.
Onde está o risco interessante
Os números de precisão de transcrição costumam ser relatados como percentuais agregados, e percentuais agregados escondem a distribuição por baixo. O desempenho com fala sotaqueada, alternância de idiomas no meio da frase, vozes de crianças e microfones não padronizados varia enormemente entre modelos, e são exatamente essas as condições em que um produto ao vivo tem maior probabilidade de ser usado. Um modelo com uma média forte ainda pode ser a escolha errada para um call center específico cujos clientes trocam de idioma no meio de uma frase.
O segundo risco é mais estratégico. Quando a transcrição é rápida e barata o suficiente para rodar continuamente, o próximo passo natural é rodá-la sempre. Um modelo que custa meio dólar por hora torna a escuta contínua acessível de uma forma que um modelo de preços por minuto não tornava, e a escuta contínua é uma gravação ambiente de tudo o que é dito perto de um dispositivo. Essa é uma decisão de governança de dados que nenhum ranking de precisão vai tomar pelas equipes que compram isso.
O MAI-Transcribe-2-Streaming é uma peça de infraestrutura genuinamente útil, e a classificação de precisão em parciais é a parte que vale acompanhar, porque mede a métrica da qual os produtos ao vivo realmente dependem. O que permanece sem resposta é se um número de 100 milissegundos medido pelo fornecedor se sustenta em uma sala com acústica ruim e quatro pessoas falando ao mesmo tempo. Esse é o teste que todo comprador vai fazer, em privado, antes de comprometer um pipeline de produção com ele.
Artigos relacionados
O Step 5 pulou quatro números de versão, ficou em segundo entre os modelos abertos e ninguém o está chamando
A posição em benchmark é um sinal que os produtores usam para julgar um modelo. O volume de chamadas é um sinal que os consumidores produzem ao usá-lo.
Gemini Omni 1.1 Flash Encadeou Quatro Requisições em uma Tomada de 40 Segundos. O Fluxo de Trabalho É o Produto.
O Google lançou um pipeline de produção com um portão de revisão embutido na precificação.
A Synthesia passou uma década gravando avatares. Agora quer que eles respondam.
Uma ferramenta de treinamento que as pessoas repetem por vontade própria é um produto diferente daquela que concluem porque alguém a atribuiu.
Um modelo que se recusa a escrever frases agora processa um trilhão de tokens por dia
Um classificador com uma interface muito melhor, voltado para o trabalho que o software já queria estruturado.