← Zurück zum Blog
Aica. 6 Min. Lesezeit

Alibaba teilte den Voice-Agenten in zwei Teile – und senkte dann den Preis um bis zu 95 Prozent

Veröffentlicht 2. Okt. 2026
Alibaba teilte den Voice-Agenten in zwei Teile – und senkte dann den Preis um bis zu 95 Prozent

Das Qwen-Team von Alibaba hat in der letzten Septemberwoche 2026 Qwen-Audio-3.1 veröffentlicht, einen Audio-Stack aus fünf Modellen, der Spracherkennung, Text-zu-Sprache und Realtime-Interaktion abdeckt. Die Zahlen, die sich am schnellsten verbreiteten, waren die Preissenkungen: rund 85 Prozent Rabatt beim Realtime-Modell, etwa 70 Prozent bei Text-zu-Sprache und bis zu 95 Prozent bei der automatischen Spracherkennung.

Die Zahlen sind wichtig, denn sie fielen in eine Woche, in der die gesamte Branche die Preise senkte. Microsoft, OpenAI und Anthropic lieferten im selben Zeitraum allesamt günstigere oder neu ausbalancierte Modelle aus, und Alibabas Schritt liest sich als bewusste Eskalation speziell im Audiobereich. Doch das Interessantere an Qwen-Audio-3.1 ist nicht der Rabatt. Es ist, wie das Flaggschiffmodell gebaut ist.

Zwei Modelle hinter einer Stimme

Das Hauptmodell ist Qwen-Audio-3.1-Realtime, ein Vollduplex-Sprachsystem für Voice-Agenten, die mitten im Gespräch Tools aufrufen müssen.

Seine zentrale Designentscheidung ist eine Aufteilung. Statt eines großen End-to-End-Systems, das zuhört und spricht, betreibt Qwen zwei Modelle mit einem gemeinsamen Audio-Encoder und einem gemeinsamen Sprachmodell-Backbone. Ein Entscheidungsmodell sagt voraus, ob weiter zugehört, mit dem Sprechen begonnen, aufgehört oder fortgesetzt werden soll. Ein separates generatives Modell übernimmt die eigentliche Sprache. Einfach gesagt: Das eine Modell entscheidet, wann gesprochen wird, das andere, was gesagt wird.

Diese Aufteilung ist eine praktische Antwort auf ein konkretes Versagen. Voice-Agenten wirken meist nicht deshalb kaputt, weil sie einen missverstehen, sondern weil sie den Moment falsch einschätzen. Sie reden dazwischen, verstummen oder antworten, bevor man fertig ist. Die übliche Lösung bestand darin, Turn-Taking an ein größeres Modell anzudocken und zu hoffen, dass das Verhalten entsteht. Qwen behandelt „wann gesprochen wird“ als eigenes Engineering-Problem, mit einem eigenen Modell, getrennt von der Inhaltsgenerierung. Das Unternehmen berichtet, dass Antworten an den falschen Sprecher gerichtet in einem Benchmark von 0,13 auf 0,03 sinken und die Füllwortrate in einem anderen von 0,759 auf 0,296 fällt. Es berichtet außerdem von einem Trade-off: Die unerwünschte Wiederaufnahme-Rate nach einer Unterbrechung steigt von 0,035 auf 0,130 – genau die Art Offenlegung, die Release-Notes selten enthalten.

Das Modell ist als Managed API verfügbar. Qwen-Audio-3.1-Realtime-Plus läuft auf QwenCloud über WebSocket. Es gibt keine offenen Gewichte, was für alle relevant ist, die Qwens Open-Image-Arbeit verfolgen, denn der Audio-Stack wird als geschlossenes, verwaltetes Produkt betrieben.

Die Spezifikationen und die Preisgestaltung

Der Realtime-Endpunkt listet Text und Audio sowohl als Eingabe als auch als Ausgabe. Der Kontext reicht bis 262K Token, mit maximal 245K Eingabe und maximal 16K Ausgabe. Die standardmäßigen Durchsatzlimits liegen bei 60 Anfragen und 100.000 Token pro Minute. Die Preisgestaltung beträgt 6,4 US-Dollar pro Million Audio-Eingabe-Token und 0,8 US-Dollar pro Million Text-Eingabe-Token, wobei kombinierte Text- und Audio-Ausgabe 24 US-Dollar pro Million kostet und Ausgabe-Text überhaupt nicht berechnet wird. Funktionsaufrufe, Websuche, strukturierte Ausgaben, Kontext-Caching und Fine-Tuning sind alle integriert.

Ein Begleitmodell, Qwen-Audio-3.1-ASR-Flash-Filetrans, zielt auf die Offline-Transkription langer Audioinhalte. Es unterstützt Hot Words, Sprechertrennung, Interpunktion und Erkennung über mehrere Sprachen hinweg sowie chinesische Dialekte, zu 0,15 US-Dollar Eingabe und 0,47 US-Dollar Ausgabe pro Million Token. Für alle, die langformatige Transkription im großen Maßstab kalkuliert haben, ist das ein steiler Rückgang bei dem, was einst eine feste Kostenposition war.

Die Trainingsgeschichte ist in drei Schichten organisiert, die Qwen als Think, Act und Speak bezeichnet. Die Think-Schicht verankert das Audiomodell mithilfe paarweiser Daten im Millionenstunden-Maßstab neu an einem Quelltextmodell und wendet dann On-Policy-Distillation an, statt vorgefertigte Antworten zu imitieren. Die Act-Schicht baut ausführbare Umgebungen, die jeweils einen Tool-Pool, eine zustandsbehaftete Datenbank und eine schriftliche Geschäftsrichtlinie bündeln, wobei Aufgaben zuerst anhand des Endzustands bewertet werden. Die Speak-Schicht entscheidet, ob, wann und wie gesprochen wird.

Das Detail in der Act-Schicht ist eines, bei dem man innehalten sollte. Die Bewertung prüft den resultierenden Zustand, bevor sie die Formulierung prüft, sodass eine flüssige Antwort eine fehlgeschlagene Aktion nicht retten kann. So sollte man einen Agenten benoten, der etwas tun und nicht nur darüber plaudern soll.

Warum der Preiskampf die eigentliche Geschichte ist

Blendet man die Architektur aus, ist Qwen-Audio-3.1 ein klarer strategischer Schachzug: Alibaba wetteifert mit OpenAI und Google bei den Kosten und der Latenz von Voice-Infrastruktur, nicht bei Offenheit.

Der Vergleich, der das nachvollziehbar macht, ist die Latenz. Qwen berichtet eine Unterbrechungs-Stopp-Latenz von etwa 1,116 Sekunden gegenüber 0,383 Sekunden bei GPT-Realtime-2. Langsamer zu stoppen, wenn ein Nutzer unterbricht, ist eine sichtbare Schwäche, und die Tatsache, dass Qwen sie zusammen mit den Erfolgen veröffentlicht hat, sagt etwas über den Zustand der Benchmark-Kultur im Audiobereich aus, wo ehrliche Zahlen noch immer ein Differenzierungsmerkmal sind.

Für Entwickler ist der praktische Effekt ein günstigeres Backend. Wenn Realtime-Sprache 85 Prozent günstiger ist und Spracherkennung bis zu 95 Prozent günstiger, dann werden Sprachfunktionen, die zuvor Premium-Tarifen vorbehalten waren, in gewöhnlichen Produkten machbar. Always-on-Zuhören, Live-Übersetzung und gesprochene Schnittstellen für Agenten hängen alle von dieser Kostenkurve ab. Wenn die Kosten einer gesprochenen Minute einbrechen, werden Produktentscheidungen, die im letzten Quartal unbezahlbar waren, in diesem Quartal offensichtlich.

Der Vorbehalt ist der, der für jede Managed API gilt. Man bekommt das Verhalten, nicht die Interna. Man kann das Turn-Taking-Modell nicht inspizieren, die Entscheidungslogik nicht mit eigenen Daten so feinjustieren, dass man sie vollständig kontrolliert, oder den Stack nicht auf eigener Hardware betreiben. Für die meisten Start-ups ist das ein akzeptabler Kompromiss. Für alle, die etwas bauen, bei dem das Latenzprofil oder der Datenpfad das Produkt ist, ist es eine Abhängigkeit, die man einpreisen sollte.

Der Wettbewerbskontext schärft den Punkt. Im selben September-Zeitraum lieferten OpenAI und Anthropic beide Modelle aus, die darauf ausgerichtet waren, mehr Arbeit zu geringeren Kosten zu erledigen, und Microsoft ergänzte seine hauseigene Linie um ein Streaming-Transkriptionsmodell und zwei Text-zu-Sprache-Modelle. Audio ist kein stiller Winkel mehr, in dem ein kleineres Labor unbemerkt der Beste sein kann. Es ist eine Kategorie, in der die größten Akteure öffentlich um Preis und Latenz konkurrieren, was gute Nachrichten für Käufer und ein Druck für alle ist, die für Voice einen Aufpreis verlangen.

Was zu beobachten ist

Die offensichtliche Frage ist, ob Qwen irgendwann einen Teil dieses Stacks als Open Source veröffentlicht und wie das Zwei-Modell-Design unter echter mehrstufiger Tool-Calling-Last bestehen bleibt, statt nur unter Benchmark-Bedingungen. Turn-Taking von Inhalt zu trennen, ist auf dem Papier elegant. Ob es elegant bleibt, wenn ein Nutzer unterbricht, seine Meinung ändert und mitten im Satz die Aufgabe wechselt, ist die Art von Frage, die Demos nicht beantworten.

Vorerst ist die Erkenntnis enger und klarer. Alibaba hat den Teil von Voice-Agenten genommen, der am kaputtesten wirkte, ihn benannt und ihm ein eigenes Modell gegeben. Dann senkte es den Preis, bis die ganze Kategorie günstiger wurde. Wenn das nächste Jahr an Voice-Produkten auf günstigerer, besser unterbrechbarer Sprache aufbaut, wird dieses Release wie einer der Gründe aussehen.

Verwandte Artikel