Microsoft senkt die Latenz für Teiltranskripte auf 100 Millisekunden. Das verändert, wofür Transkription da ist.

Am 2. Oktober 2026 kündigte Microsoft AI MAI-Transcribe-2-Streaming an, ein Spracherkennungsmodell, das Teiltranskripte in etwas mehr als 100 Millisekunden über 60 Sprachen hinweg liefert. Bei Artificial Analysis belegt es Platz eins – sowohl bei der Genauigkeit finaler als auch partieller Transkripte. Der Einführungspreis liegt bis Ende des Jahres bei 0,54 US-Dollar pro Stunde Audio.
Das Unternehmen kündigte außerdem MAI-Voice-2.1 und MAI-Voice-2.1-Flash an, die 23 Sprachen und 26 Locales abdecken. Das Modell ist über Azure Speech, Microsoft Foundry, den MAI Playground, OpenRouter unter der ID microsoft/mai-transcribe-2, Vercel und Azure Voice Live erreichbar; eine LiveKit-Integration ist als „coming soon“ angekündigt.
Hundert Millisekunden sind eine Schwelle, keine Benchmark-Kuriosität. Sie liegen an der Grenze dessen, was Menschen als augenblicklich wahrnehmen. Unterhalb dieser Schwelle kann eine Schnittstelle reagieren, während jemand noch spricht – und genau das ist der Unterschied zwischen einem Produkt, das ein Dokument erzeugt, und einem Produkt, das an einem Gespräch teilnimmt.

Warum die finale Genauigkeit nie die ganze Geschichte war
Spracherkennung ist seit Jahren eine ausgereifte Kategorie, und die Bestenlisten haben meist eines gemessen: wie genau ein Modell eine abgeschlossene Äußerung wiedergibt, nachdem die sprechende Person aufgehört hat. Diese Kennzahl beantwortet die Frage, die einen Transkriptionsdienst interessiert. Sie beantwortet nicht die Frage, die ein Live-Produkt interessiert.
Ein Meeting-Assistent, der Wörter erst zeigt, wenn die sprechende Person fertig ist, ist ein Rekorder mit besserer Formatierung. Ein Meeting-Assistent, der Wörter zeigt, sobald sie eintreffen, kann die aktuell sprechende Person hervorheben, einen Namen in dem Moment einblenden, in dem er fällt, eine Suche auslösen, während das Thema noch auf dem Tisch liegt, und jemanden mitten im Satz zurückblättern lassen, ohne die Stelle zu verlieren. All das hängt von der Teil-Latenz ab, nicht von der finalen Genauigkeit.
Die Genauigkeit von Teiltranskripten ist das schwierigere Problem, und genau sie erfasst Artificial Analysis nun separat. Eine stabile Vermutung zu erzeugen, bevor der Satz vollständig ist, bedeutet, sich auf eine Interpretation festzulegen, die man möglicherweise revidieren muss. Modelle, die ständig korrigieren, erzeugen flackernden Text – schlimmer als Warten. Modelle, die sich zu aggressiv festlegen, lassen Fehler auf dem Bildschirm stehen. Ein Ranking auf Basis von Teiltranskripten belohnt das Modell, das den Zwischentext oft genug richtig trifft, dass eine lesende Person dem, was sie sieht, vertrauen kann.
Wenn Microsoft auf beiden Listen den ersten Platz beansprucht, bedeutet das, dass das Unternehmen nicht Zwischenstabilität gegen finale Korrektheit eintauscht – der übliche Weg, auf dem Modelle Teil-Geschwindigkeit erkaufen. Diese Kombination ist die eigentliche Ankündigung.
Die Zahl 100 Millisekunden
Die Ende-zu-Ende-Latenz bei der Streaming-Erkennung ist eine Kette, keine einzelne Zahl. Audio trifft in Frames ein. Ein Endpointing-Modell entscheidet, wann eine Äußerung beendet sein könnte. Das Erkennungsmodell erzeugt Text. Ein nachgelagertes System stellt ihn dar. Jedes Glied fügt Verzögerung hinzu, und die Summe entscheidet, ob sich das Erlebnis live anfühlt.
Microsofts Angabe von 100 Millisekunden bezieht sich auf die eigene Ausgabe des Modells und beruht auf der firmeneigenen Messung sowie der Platzierung bei Artificial Analysis, nicht auf einem unabhängigen Latenz-Audit. Der relevante Vergleich betrifft die Frage, ob die Zahl unter den Bedingungen hält, die ein Live-Produkt erzeugt – eine andere Frage als ein Stoppuhrwert im luftleeren Raum: mehrere sprechende Personen, Hintergrundgeräusche, ein schlechtes Konferenzmikrofon und 60 Sprachen, die in dieselbe Pipeline eintreffen. Anbieter veröffentlichen selten Latenzverteilungen über solche Bedingungen, und genau sie entscheiden darüber, ob ein Meeting-Produkt in einem echten Meeting brauchbar ist.
Die Preisstruktur ist die andere Hälfte der Geschichte. 0,54 US-Dollar pro Stunde Audio ist ein Einführungspreis, der bis Ende des Jahres gilt – was zeigt, dass Microsoft erwartet, ihn zu verändern. Die strategische Absicht ist erkennbar. Streaming-Transkription ist die Eingabeschicht für jeden Meeting-Assistenten, jedes Callcenter-Analyseprodukt und jeden Live-Untertitelungsdienst. Die günstigste schnelle Option für 60 Sprachen zu sein, ist ein Distributionsspiel, und Distribution in einer Eingabeschicht ist klebrig, weil das zweite Team, das den Anbieter wechselt, seinen Umgang mit einem anderen Satz von Zwischenverhalten neu aufbauen muss.
Womit das konkurriert
Microsoft betritt kein leeres Feld. Deepgram, AssemblyAI und Speechmatics haben alle Geschäfte auf Streaming-Genauigkeit und niedrige Latenz aufgebaut, und Google und Amazon bündeln konkurrenzfähige Erkennung in ihre eigenen Cloud-Stacks. Der realistische Käufer ist ein Entwickler, der bereits auf Azure läuft, es zu schätzen weiß, dass MAI-Transcribe-2-Streaming neben dem Rest der MAI-Familie in Foundry und OpenRouter auftaucht, und lieber keine zweite Anbieterbeziehung für eine einzelne Komponente unterhalten möchte.
Die Ankündigung von MAI-Voice-2.1 ist hier ebenfalls relevant, und die Paarung ist beabsichtigt. Spracherkennung und Sprachsynthese sind die beiden Enden desselben Gesprächs, und eine Plattform, die beides verkauft, kann eine einzige Pipeline anbieten: Audio rein, Transkript raus, Antwort synthetisiert, Sprache zurückgegeben. 23 Sprachen und 26 Locales auf der Syntheseseite zu ergänzen, erweitert die Zahl der Märkte, in denen diese Pipeline als ein Produkt verkauft werden kann.
Was schnelle Teiltranskripte im Produktdesign verändern
Sobald Zwischentext innerhalb einer Zehntelsekunde eintrifft, wird eine Reihe von Interface-Entscheidungen, die früher unvernünftig waren, alltäglich.
Man denke an Unterbrechungen. Wenn sich ein Transkript erst nach dem Ende einer Äußerung setzt, muss ein System auf Stille warten, bevor es auf das Gesagte reagieren kann – es kann also nicht antworten, bevor das Gespräch bereits weitergezogen ist. Mit schnellen Teiltranskripten kann ein System einen Befehl in dem Moment erkennen, in dem er gesprochen wird, und dazwischengehen – das Verhalten, das Menschen von einer Person im Raum erwarten. Sprachagenten, die Barge-in unterstützen, sind darauf angewiesen. Ebenso Live-Untertitelungssysteme, die mit einer schnell sprechenden Person mithalten müssen, statt drei Sätze hinterherzuhängen.
Die Suche ist der zweite Profiteur. Ein Meeting-Assistent, der das Transkript durchsuchen kann, während es geschrieben wird, kann ein Dokument in dem Moment einblenden, in dem ein Projektname fällt, während die Diskussion noch läuft. Das ist ein grundlegend anderes Produkt als ein Rekorder, der eine Stunde später durchsuchbare Notizen liefert.
Strukturierte Extraktion ist der dritte Punkt. Wenn Teiltext zuverlässig genug ist, kann ein nachgelagertes Modell beginnen, ihn zu lesen, bevor das Meeting endet, und Entscheidungen und To-dos markieren, während sie gesprochen werden. Der Gewinn liegt darin, die Ausgabe überprüfen zu können, solange die Teilnehmenden noch wissen, was sie gemeint haben, und nicht in der reinen Geschwindigkeit.
Jedes dieser Verhaltensweisen erhöht den Einsatz für die Stabilität der Teilergebnisse. Ein Transkript, das sich zwei- oder dreimal pro Sekunde neu schreibt, macht alle drei Funktionen nervig statt nützlich – weshalb die tiefere Geschichte in Microsofts Ankündigung die Genauigkeitsplatzierung bei Teiltranskripten ist, nicht die Latenzzahl allein.
Wo das interessante Risiko liegt
Genauigkeitswerte für Transkription werden üblicherweise als aggregierte Prozentzahlen berichtet, und aggregierte Prozentzahlen verbergen die darunterliegende Verteilung. Die Leistung bei akzentuierter Sprache, Code-Switching mitten im Satz, Kinderstimmen und ungewöhnlichen Mikrofonen variiert enorm zwischen Modellen – und genau das sind die Bedingungen, unter denen ein Live-Produkt am wahrscheinlichsten genutzt wird. Ein Modell mit starkem Durchschnitt kann für ein bestimmtes Callcenter die falsche Wahl sein, wenn dessen Kundinnen und Kunden mitten im Satz die Sprache wechseln.
Das zweite Risiko ist strategischer. Sobald Transkription schnell und günstig genug ist, um kontinuierlich zu laufen, ist der natürliche nächste Schritt, sie immer laufen zu lassen. Ein Modell, das einen halben Dollar pro Stunde kostet, macht kontinuierliches Zuhören bezahlbar, was mit einem Preismodell pro Minute nicht der Fall war – und kontinuierliches Zuhören ist eine permanente Aufnahme von allem, was in der Nähe eines Geräts gesagt wird. Das ist eine Data-Governance-Entscheidung, die kein Genauigkeits-Leaderboard für die Teams trifft, die das kaufen.
MAI-Transcribe-2-Streaming ist ein wirklich nützliches Stück Infrastruktur, und die Platzierung bei der Teil-Genauigkeit ist der Teil, den man beobachten sollte, denn sie misst die Kennzahl, auf die Live-Produkte tatsächlich angewiesen sind. Ungeklärt bleibt, ob eine vom Anbieter gemessene Zahl von 100 Millisekunden in einem Raum mit schlechter Akustik und vier Personen, die durcheinanderreden, standhält. Das ist der Test, den jeder Käufer privat durchführen wird, bevor er eine Produktions-Pipeline darauf festlegt.
Verwandte Artikel
Step 5 übersprang vier Versionsnummern, landete auf Platz zwei unter offenen Modellen – und niemand ruft es ab
Die Benchmark-Position ist ein Signal, das Produzenten nutzen, um ein Modell zu beurteilen. Das Aufrufvolumen ist ein Signal, das Nutzer durch seine Nutzung erzeugen.
Gemini Omni 1.1 Flash verkettete vier Anfragen zu einer 40-Sekunden-Aufnahme. Der Workflow ist das Produkt.
Google hat eine Produktionspipeline ausgeliefert, bei der ein Review-Gate in die Preisgestaltung eingebaut ist.
Synthesia hat ein Jahrzehnt lang Avatare aufgezeichnet. Jetzt sollen sie zurücksprechen.
Ein Trainingswerkzeug, das Menschen freiwillig wiederholen, ist ein anderes Produkt als eines, das sie abschließen, weil es ihnen zugewiesen wurde.
Ein Modell, das sich weigert, Sätze zu schreiben, verarbeitet jetzt eine Billion Token pro Tag
Ein Klassifikator mit einer viel besseren Schnittstelle, ausgerichtet auf die Arbeit, die Software schon immer strukturiert haben wollte.