← Zurück zum Blog
Aica. 5 Min. Lesezeit

Kimi K3 tritt in OpenAIs Enterprise-Bezahlsystem ein: Der Auslandsweg chinesischer Open-Source-Modelle wird neu geschrieben

Veröffentlicht 5. Okt. 2026
Kimi K3 tritt in OpenAIs Enterprise-Bezahlsystem ein: Der Auslandsweg chinesischer Open-Source-Modelle wird neu geschrieben

Am 1. Oktober bestätigte das US-amerikanische KI-Infrastrukturunternehmen Baseten eines: Unternehmensentwickler können in OpenAIs Programmierwerkzeug Codex direkt Kimi K3 von Moonshot AI aufrufen, und die anfallenden Kosten werden direkt auf das bereits vorhandene OpenAI-Einkaufsvolumen des Unternehmens angerechnet. Es ist weder ein neuer Lieferantenstammdatensatz erforderlich noch eine erneute Beschaffungsgenehmigung. Dies ist das erste Mal, dass ein chinesisches Open-Source-Modell in das kostenpflichtige Enterprise-Abrechnungssystem von OpenAI eintritt.

Die Bedeutung dieser Sache liegt nicht in den Parametern und auch nicht in Rankings, sondern darin, dass sie die Pfadabhängigkeit der Unternehmensbeschaffung verändert.

Der Beschaffungsprozess selbst ist die Hürde

Wenn ein Großunternehmen einen neuen Modellanbieter einbindet, ist das Schwierige nie die technische Anbindung, sondern die Compliance- und Finanzprozesse. Ein neuer Anbieter muss eine Zulassungsprüfung durchlaufen, muss Abrechnungs- und Settlement-Systeme separat aufbauen und muss Rechts- und Beschaffungsabteilung erneut durchlaufen. Für ein Team, das nur prüfen möchte, ob ein bestimmtes Modell brauchbar ist, sind die Kosten dieses Prozesses oft viel höher als das Modell selbst.

Kimi K3 nutzt die Kontingentabrechnung von OpenAI und umgeht damit diesen gesamten Reibungsverlust. Das bereits genehmigte KI-Budget im Unternehmen kann direkt für Kimi K3 ausgegeben werden, und in der Finanzabteilung sieht man weiterhin eine OpenAI-Rechnung. Baseten fungiert als zugrunde liegender Einstiegspunkt und hat die Modellfähigkeiten von Moonshot AI in den OpenAI-Ökosystemkanal eingebunden.

Zuvor war Kimi K3 bereits auf der Amazon-Cloud-Plattform Amazon Bedrock verfügbar, wodurch Moonshot AI zum ersten chinesischen KI-Unternehmen wurde, das mit einem globalen Top-Cloud-Anbieter im Umsatzbeteiligungsmodell zusammenarbeitet. Das eine ist Umsatzbeteiligung über eine Cloud-Plattform, das andere ist Kontingentverrechnung über ein Entwicklerwerkzeug; beide Wege führen zum selben Ergebnis: Chinesische große Modelle beginnen, von der Technologiedemonstrationsphase in die Phase der skalierbaren kommerziellen Umsetzung überzugehen.

Welches Niveau hat das Modell selbst?

Kimi K3 wurde im Juli dieses Jahres veröffentlicht, hat eine Parametergröße von 2,8 Billionen und war zum Zeitpunkt der Veröffentlichung das weltweit größte Open-Source-Modell. Es unterstützt ein Kontextfenster von 1 Million Token, verfügt nativ über visuelles Verständnis und wurde speziell für Codeentwicklung, tiefgehende Recherche und komplexe Wissensverarbeitung optimiert.

Am Tag der Veröffentlichung erreichte Kimi K3 Platz eins der internationalen Code-Benchmark-Rangliste Arena und war das erste chinesische große Modell, das diesen Spitzenplatz errang. Auch Tesla-CEO Musk bewertete dieses Ergebnis öffentlich als beeindruckend.

Bemerkenswerter ist sein Architekturansatz. Kimi K3 verwendet Kimi Delta Attention und Attention Residuals, um den Informationsfluss in langen Sequenzen zu verbessern, und setzt auf eine Stable-LatentMoE-Struktur, bei der von 896 Experten nur 16 aktiviert werden; laut offiziellen Angaben wurde die Skalierungseffizienz im Vergleich zur vorherigen Generation um etwa das 2,5-Fache gesteigert. Diese Designrichtung deckt sich mit den kollektiven Aktivitäten chinesischer Labore in den letzten Monaten: Es geht nicht darum, wer mehr Parameter hat, sondern darum, wie viel nutzbare Fähigkeit jede Einheit Rechenleistung liefert.

Ein autonomes Chipdesign in 48 Stunden

Wenn der Eintritt in Codex eine Sache auf kommerzieller Ebene ist, dann ist ein anderer Fortschritt näher an der Technologie selbst.

Öffentlichen Informationen zufolge hat Kimi K3 einen Machbarkeitsnachweis für autonomes Chipdesign durch KI abgeschlossen. In einem ununterbrochenen 48-stündigen Agententest hat es mithilfe von Open-Source-EDA-Werkzeugen und einer 45-nm-Prozessbibliothek unabhängig das Design, die Iteration und die vollständige Verifikation eines angepassten Chips abgeschlossen. Das Ergebnis ist ein leichtgewichtiger Chip mit 4 Quadratmillimetern, 1,46 Millionen Standardzellen und 0,277 MB SRAM, der bei 100 MHz eine stabile Timing-Konvergenz erreicht und einen maximalen Dekodierungsdurchsatz von über 8.700 Token pro Sekunde erzielt.

Eine Pinzette hält einen quadratischen Siliziumchip mit irisierendem Glanz, schwebend über einem warmfarbenen Labortisch

Solche Ergebnisse sind mit Vorsicht zu betrachten. Ein Machbarkeitsnachweis ist kein massenproduktionsfähiger Chip, und 45 nm ist kein fortschrittlicher Fertigungsprozess. Aber was er validiert, ist ein geschlossener Prozesskreislauf: Kann ein Modell eine Ingenieuraufgabe, die mehrere Iterationen erfordert, ohne schrittweise menschliche Eingriffe von Anfang bis Ende erledigen? Für Leute, die Agenten entwickeln, sagt das mehr aus als die Frage, ob ein einzelnes Bild gut aussieht.

Wohin sich die Wettbewerbsebene bewegt

Kimi K3s Auslandsexpansion läuft parallel zu einer anderen Entwicklungslinie.

In derselben Woche veröffentlichte Zhipu das Open-Source-Modell GLM-4.6, das vor allem die agentische Codierungsfähigkeit verbessert und die Anpassung an chinesische Chips wie Cambricon und Moore Threads abgeschlossen hat, wodurch eine stabile Bereitstellung von FP8+Int4-Mischquantisierungsinferenz auf chinesischer Hardware ermöglicht wird. DeepSeek hat am 2. Oktober außerdem das Desktop-Agenten-Ausführungsframework Harness v0.2 als Open Source veröffentlicht. Es nutzt eine Architektur, in der „alles ein Plugin ist“, bietet integrierte Funktionen wie Dateiorganisation, Datenanalyse, Dokumententwurf und Codeänderung und ist unter der MIT-Lizenz offen.

Betrachtet man all dies zusammen, wird eine Richtung klar: Das Modell selbst wird zur Infrastruktur, und die eigentliche Differenzierung beginnt sich an zwei Stellen zu verlagern. Zum einen das Laufzeitframework, also die Schicht außerhalb des Modells – wer Entwicklern und Unternehmen ermöglicht, das Modell kostengünstig in ihre Arbeitsabläufe einzubinden. Zum anderen die Hardware-Anpassung – wer die Inferenz auf günstigerer und stärker autonom kontrollierbarer Rechenleistung laufen lassen kann.

Kimi K3 hat bereits K3.1 angekündigt, das 1 Million Token Kontext unterstützt und drei Inferenzstufen – Low, High und Max – bietet, die der Nutzer je nach Aufgabenkomplexität wählt. Lange Texte und wählbare Inferenzstufen werden allmählich zur Standardausstattung, mit der chinesische Open-Source-Modelle um Entwickler werben.

Für chinesische große Modelle bedeutete Auslandsexpansion in der Vergangenheit meist eine Eins-zu-eins-Anbindung an Überseekunden; wollten Großunternehmen sie einbinden, mussten sie eine zusätzliche Lieferantenqualifikationsprüfung durchführen, was die Hürde für die Umsetzung sehr hoch machte. Mit diesen beiden Schritten hat Kimi K3 die Hürde ein Stück gesenkt. Ob Unternehmen bereit sind, dafür zu bezahlen, werden die nächsten Quartale zeigen.

Verwandte Artikel