Kimi K3 intègre le système de facturation entreprise d'OpenAI : la route à l'international des grands modèles open source chinois est en train d'être réécrite

Le 1er octobre, l'entreprise américaine d'infrastructure IA Baseten a confirmé une chose : les développeurs en entreprise peuvent appeler directement Kimi K3 de Moonshot AI depuis l'outil de programmation Codex d'OpenAI, et les coûts générés sont directement imputés au quota d'achat OpenAI dont l'entreprise dispose déjà. Nul besoin d'ajouter un nouveau fournisseur, ni de repasser une nouvelle fois par la procédure d'approbation des achats. C'est la première fois qu'un grand modèle open source chinois entre dans le système de règlement payant entreprise d'OpenAI.
Le poids de cette affaire ne tient ni aux paramètres, ni aux classements, mais au fait qu'elle modifie la dépendance au sentier des entreprises en matière d'achat.
Le processus d'achat est en soi un obstacle
Quand une grande entreprise intègre un nouveau fournisseur de modèles, ce qui pose problème n'est jamais la connexion technique, mais les processus de conformité et de finance. Un nouveau fournisseur doit passer un audit d'admission, mettre en place une facturation et un système de règlement distincts, et repasser une fois de plus par le juridique et les achats. Pour une équipe qui veut simplement vérifier si un modèle est utilisable ou non, le coût de ce processus est souvent bien plus élevé que celui du modèle lui-même.
En passant par le règlement au titre du quota OpenAI, Kimi K3 contourne tout cet ensemble de frictions. Le budget IA déjà approuvé dans l'entreprise peut être dépensé directement sur Kimi K3, et côté finances, on voit toujours une facture OpenAI. Baseten, en tant que point d'entrée d'accueil sous-jacent, a raccordé les capacités de modèle de Moonshot AI au canal écosystémique d'OpenAI.
Avant cela, Kimi K3 avait déjà débarqué sur Amazon Bedrock, la plateforme cloud d'Amazon, ce qui a fait de Moonshot AI la première entreprise d'IA chinoise à coopérer selon un modèle de partage des revenus avec un grand fournisseur cloud mondial. D'un côté, le partage des revenus d'une plateforme cloud ; de l'autre, la déduction sur le quota d'un outil de développement : les deux voies mènent au même résultat. Les grands modèles chinois commencent à passer de la phase de démonstration technique à celle d'un déploiement commercial à grande échelle.
Quel est le niveau du modèle lui-même
Kimi K3 a été publié en juillet de cette année, avec une échelle de 2 800 milliards de paramètres, ce qui en faisait, au moment de sa sortie, le plus grand modèle open source du monde. Il prend en charge une fenêtre de contexte d'un million de tokens, possède nativement des capacités de compréhension visuelle, et a fait l'objet d'optimisations spécifiques pour le développement de code, la recherche approfondie et le traitement de connaissances complexes.
Le jour de sa sortie, Kimi K3 a pris la première place du classement international d'évaluation de code Arena, devenant le premier grand modèle chinois à atteindre la tête de ce classement. Le CEO de Tesla, Elon Musk, a lui aussi publiquement jugé ce résultat impressionnant.
Plus remarquable encore est sa philosophie d'architecture. Kimi K3 utilise Kimi Delta Attention et Attention Residuals pour améliorer la circulation de l'information dans les longues séquences, et adopte une structure Stable LatentMoE qui n'active que 16 experts sur 896 ; selon l'éditeur, cela améliore l'efficacité de mise à l'échelle d'environ 2,5 fois par rapport à la génération précédente. Cette direction de conception rejoint le mouvement collectif des laboratoires chinois ces derniers mois : ne pas rivaliser sur la taille des paramètres, mais sur ce que chaque unité de puissance de calcul permet d'obtenir en capacités réellement utilisables.
Une conception de puce autonome en 48 heures
Si l'entrée dans Codex relève du domaine commercial, une autre avancée touche de plus près à la technique elle-même.
Selon des informations publiques, Kimi K3 a déjà réalisé une preuve de concept de conception de puce en autonomie par IA. Au cours d'un test d'agent de 48 heures consécutives sans interruption, il s'est appuyé sur des outils EDA open source et une bibliothèque de processus 45 nm pour mener à bien de manière indépendante la conception, les itérations et la validation de bout en bout d'une puce adaptée. Le résultat est une puce légère de 4 millimètres carrés, dotée de 1,46 million de cellules standard et de 0,277 Mo de SRAM, atteignant une convergence temporelle stable à une fréquence de 100 MHz, avec un débit de décodage maximal pouvant dépasser 8 700 tokens par seconde.

Ce genre de résultat doit être considéré avec prudence. Une preuve de concept n'équivaut pas à une puce produisible en série, et le 45 nm n'est pas non plus un procédé de fabrication avancé. Mais ce qui est validé ici, c'est la boucle de processus : un modèle est-il capable, sans intervention humaine étape par étape, de mener de bout en bout une tâche d'ingénierie exigeant de multiples essais et erreurs. Pour ceux qui travaillent sur les agents, c'est bien plus révélateur que la beauté d'une image isolée.
Vers où se déplace le niveau de la concurrence
L'expansion à l'international de Kimi K3 se déroule en parallèle d'une autre ligne de développement.
La même semaine, Zhipu a publié le modèle open source GLM-4.6, dont la mise à niveau porte principalement sur les capacités de codage agentique, et a achevé son adaptation aux puces chinoises telles que Cambricon et Moore Threads, permettant un déploiement stable de l'inférence à quantification mixte FP8+Int4 sur du matériel national. DeepSeek a également open-sourcé le 2 octobre Harness v0.2, un framework d'exécution d'agents pour poste de travail, adoptant une architecture « tout est plugin », avec des capacités intégrées de classement de fichiers, d'analyse de données, de rédaction de documents et de modification de code, publié sous licence MIT.
En mettant tout cela côte à côte, une direction se dessine clairement : le modèle lui-même est en train de devenir une infrastructure, et la véritable différenciation commence à se déplacer vers deux endroits. D'une part le framework d'exécution, c'est-à-dire la couche située au-dessus du modèle : qui saura permettre aux développeurs et aux entreprises d'intégrer le modèle à leur flux de travail à faible coût. D'autre part l'adaptation matérielle : qui saura faire tourner l'inférence sur une puissance de calcul moins chère et plus autonome et maîtrisable.
Kimi K3 a déjà annoncé K3.1, qui prendra en charge un contexte d'un million de tokens et offrira trois niveaux d'intensité de raisonnement — Low, High et Max — que l'utilisateur choisit selon la complexité de la tâche. Le texte long et les niveaux de raisonnement optionnels sont en train de devenir la dotation standard des modèles open source chinois dans leur course aux développeurs.
Par le passé, l'expansion à l'international des grands modèles chinois se faisait surtout par un contact individuel avec chaque client étranger ; pour une grande entreprise, l'intégration impliquait d'ajouter un audit de qualification de fournisseur, ce qui rendait le seuil de déploiement très élevé. Ces deux étapes de Kimi K3 ont abaissé ce seuil d'un cran. Reste à savoir si les entreprises accepteront de payer pour lui : les prochains trimestres apporteront la réponse.
Articles associés
Les outils vidéo IA obtiennent 9 sur 10 pour leur facilité d’utilisation. Le score de conformité, c’est une autre histoire.
Les utilisateurs adorent les générateurs vidéo IA. Les services juridiques, eux, n’ont pas encore été consultés.
InternLumina-U2 réunit texte, images, vidéo et 3D dans un seul modèle 16B, puis livre deux jeux de poids
La liste des tâches est ambitieuse. Le format de publication porte davantage de signal.
HappyOyster vend un monde dans lequel on entre, pas un clip que l'on regarde
La plupart des modèles vidéo vous remettent un fichier. Celui-ci vous remet une pièce avec une porte.
Luma Ray3 Modify préserve la performance et renégocie le monde qui l'entoure
Le problème le plus difficile dans le montage vidéo IA n'est pas l'effet. C'est de ne pas saccager la prise que vous avez déjà payée.