Alibaba veröffentlicht 30B-Multimodell als Open Source: 3 Milliarden aktive Parameter, direkter Angriff auf GPT-5-Mini

Am 4. Oktober hat das Qwen-Team von Alibaba Cloud mit einem Schlag zwei Versionen von Qwen3-VL-30B-A3B veröffentlicht – Instruct und Thinking – zusammen mit FP8-quantisierten Gewichten; außerdem kam die FP8-Version des größeren Qwen3-VL-235B-A22B hinzu. Die offizielle Bilanz ist eindeutig: In fünf Bereichen – STEM-Reasoning, visuelle Fragebeantwortung, OCR-Texterkennung, Videoverständnis und Agent-Aufgaben – tritt es gegen GPT-5-Mini und Claude 4-Sonnet an, bei einigen Punkten sogar mit besseren Ergebnissen.
Was wirklich einen zweiten Blick verdient, ist die Zeichenfolge A3B im Namen.
30B-Hülle, 3B-Appetit
Qwen3-VL-30B-A3B hat insgesamt 30 Milliarden Parameter, aber bei jeder Inferenz sind nur etwa 3 Milliarden tatsächlich an der Berechnung beteiligt. Das ist eine typische Mixture-of-Experts-(MoE-)Architektur: Im Modell sind viele Experten angelegt; bei der Verarbeitung jedes Tokens wird nur eine kleine, passende Auswahl aktiviert, während der Rest in Bereitschaft bleibt.

Stellen Sie sich das wie ein Unternehmen vor: Das gesamte Unternehmen hat 30.000 Mitarbeitende, aber für jedes konkrete Projekt werden nur etwa 3.000 passende Fachkräfte herangezogen, der Rest bleibt in Bereitschaft. Die Kompetenzreserve des Unternehmens liegt auf dem Niveau von 30.000 Personen, die Personalkosten für ein einzelnes Projekt entsprechen jedoch eher 3.000 Personen.
Dieser Aufbau bringt sehr praktische Vorteile. VRAM-Bedarf und Inferenzgeschwindigkeit ähneln eher einem dichten Modell, das deutlich kleiner als 30B ist, während die Leistungsobergrenze weiterhin ein Fundament auf 30B-Niveau behält. Für Teams, die multimodale Fähigkeiten lokal oder in einer privaten Umgebung betreiben müssen, ist genau das die Kombination, die in den vergangenen Jahren am schwersten zusammenzubekommen war: Ergebnisse, die mit geschlossenen Flaggschiffen mithalten können, ohne eine mit VRAM vollgestopfte Karte zu verlangen.
Warum die Bilanz in genau diesen fünf Bereichen veröffentlicht wird
Die offiziell für den Vergleich ausgewählten Richtungen sind genau die umkämpftesten Felder der multimodalen Praxis.
OCR ist ein Grundbedarf bei der Digitalisierung von Dokumenten, der Erkennung von Belegen oder dem Auslesen von Text aus Screenshots. Videoverständnis ist der Eingang zur Content-Produktion im Zeitalter der Kurzvideos: Wer Videos versteht, kann sie in durchsuchbares und bearbeitbares Material verwandeln. Agenten sorgen dafür, dass ein Modell nicht nur versteht, sondern auch handelt – das ist in diesem Jahr die Hauptlinie, auf die in der Branche fast alle setzen. STEM und VQA sind wiederum die Eintrittskarten für hochwertige Szenarien in Bildung, Forschung und industrieller Qualitätskontrolle.
Dass ein Modell mit nur 3 Milliarden aktivierten Parametern auf diesen Linien mit geschlossenen Flaggschiffen mithalten kann, ist für sich genommen ein stärkeres Signal als jede Einzelpunktzahl. Es zeigt, dass die Fähigkeitsdichte weiter neu komprimiert wird: Für denselben Effekt sinkt der benötigte Rechenaufwand; anders gesagt, für dieselbe Rechenleistung steigt die erreichbare Fähigkeit.
Die Open-Source-Karte zielt auf die Bereitstellungskosten
Qwen hat in dieser Runde nicht nur eine Version veröffentlicht. Instruct richtet sich an übliches Instruction-Following und Frage-Antwort-Aufgaben, Thinking verfolgt den Reasoning-Pfad, zuerst nachzudenken und dann zu antworten, und die FP8-Gewichte sind für diejenigen gedacht, die das gesamte Modell in begrenztem VRAM unterbringen wollen.
Drei Versionen auf einmal weisen in dieselbe Richtung: Multimodalität von „API-Aufruf in der Cloud“ hin zu „selbst bereitstellbar“ zu verschieben. Sobald Gewichte herunterladbar, quantisierbar und auf privaten Servern lauffähig sind, ändert sich die Beschaffungslogik. Früher rechneten Unternehmen, wie viel eine Million Token kostet; jetzt gibt es eine weitere Option, bei der sie berechnen, wie viel die eigene Grafikkarte pro Million Token kostet. Für Teams mit hohem Nutzungsvolumen fällt die letztere Rechnung oft günstiger aus – und die Daten verlassen das interne Netz nicht.
Das ist auch die stabilste Angriffsrichtung chinesischer Open-Source-Modelle im vergangenen Jahr. Es geht nicht mehr nur darum, wer mehr Parameter hat oder in Rankings höher steht, sondern darum, wer mehr Menschen mit niedrigerer Einstiegshürde zur Nutzung des Modells bringt. Wenn der Fähigkeitsunterschied auf ein akzeptables Maß gedrückt wird, werden Preis und Verfügbarkeit zum eigentlichen entscheidenden Faktor.
Die andere Seite von Open Source
Offene Gewichte bedeuten, dass jeder sie herunterladen, feinabstimmen und weiterverbreiten kann. Der Vorteil ist, dass das Ökosystem extrem schnell wächst: Quantisierte Versionen, branchenspezifische Fine-Tunings und Anpassungen für Edge-Geräte werden in der Community rasch entstehen. Das Risiko ist ebenso klar: Sobald das Modell den Blick des Herausgebers verlässt, kann dieser kaum kontrollieren, wo und wie es eingesetzt wird.
Für Entwickler bedeutet das umgekehrt, dass die Wahl bei ihnen liegt. Man muss seine Compliance-Grenzen kennen, wissen, ob Daten das Land verlassen dürfen, und die Lizenzbedingungen für die Weiterverbreitung kennen. Open Source gibt einem das Werkzeug – und zugleich die Verantwortung.
Was als Nächstes zu beobachten ist
Der Vergleich in diesen fünf Bereichen ist nur der Anfang. Ob ein multimodales Modell im Produktivbetrieb bestehen kann, entscheidet selten die Punktzahl in einem einzelnen Benchmark, sondern ob es über Dutzende aufeinanderfolgende Aufgaben hinweg plötzlich versagt und wie stabil es bei echten Dokumenten, echten Videos und echten chaotischen Eingaben bleibt.
Ob der Weg mit 3 Milliarden aktivierten Parametern weiter nach oben führen kann, hängt von der Effizienz des Experten-Routings der nächsten Generation, der Qualität der Trainingsdaten und der Post-Training-Strategie ab. Wenn dieser Weg funktioniert, wird nicht nur irgendein Ranking neu geschrieben, sondern die Standardannahme der gesamten Branche darüber, wie groß ein Modell sein muss, um auszureichen.
Wenn ein Modell mit nahezu Flaggschiff-Fähigkeiten nur einen Bruchteil der Betriebskosten eines Flaggschiffs verursacht, dann ist nicht mehr Rechenleistung das eigentlich Knappe, sondern Menschen, die klar durchdacht haben, wofür sie es einsetzen wollen.
Verwandte Artikel
Ein Framework für Sprache und Vision: Horizons offenes 1,6-Milliarden-Modell
Eine Wette darauf, dass die Brücken zwischen Sprache und Vision nie nötig waren.
Eine photonische Speicherwand ist die 88-Millionen-Dollar-Wette, die Volantis gerade eingegangen ist
Der Kompromiss, mit dem alle zu leben gelernt haben, ist genau das, was es zu beseitigen versucht.
KI-Produktbilder treffen auf eine Compliance-Hürde, die niemand eingepreist hat
Die Kosten wurden immer pro Generierung angegeben. Die echten Kosten werden pro Asset bemessen, das die Prüfung übersteht.
Roboter können 74 Prozent der körperlichen Arbeit erledigen – und fast nichts davon rechnet sich
Die Fähigkeit ist weitgehend vorhanden. Die Wirtschaftlichkeit nicht. Vierzig Jahre bis zehn Prozent sind keine Prognose, die Panik rechtfertigt.