DeepSeek met en open source son expérience d’ingénierie pour faire tourner des modèles à mille milliards de paramètres : cette fois, la puissance de calcul chinoise comble la couche logicielle

Le 30 septembre, DeepSeek a publié une série de codes sur son compte officiel WeChat, mettant en open source six modules pour la plateforme Huawei Ascend : TileLang, DeepGEMM-Ascend, DeepEP-Ascend, TileKernels, FlashMLA, DeepSelect. Les noms semblent disparates, mais le périmètre couvert est en réalité très cohérent : un langage de programmation, une série de noyaux de calcul, et en plus la communication distribuée.
Cela ressemble peu à une open source classique. Ce qui est mis en open source ici, ce n’est pas le modèle, mais la couche de fondation nécessaire pour le faire tourner.
Quand les puces suffisent, le blocage vient d’ailleurs
Ces dernières années, ce dont on a le plus parlé à propos de la puissance de calcul chinoise, ce sont les chiffres de performance. Les fiches techniques sont de plus en plus séduisantes d’année en année, mais les ingénieurs qui ont réellement migré des modèles savent que les ennuis viennent rarement de la puissance de calcul de pointe.
L’écosystème CUDA de NVIDIA se construit depuis plus de vingt ans. Compilateurs, bibliothèques mathématiques, bibliothèques de communication : couche après couche, le développeur reçoit une carte et peut s’en servir ; la documentation, la communauté, les retours d’expérience sont déjà là. En passant à un autre matériel, le même opérateur doit parfois être écrit soi-même, l’ordonnancement doit être réglé à la main, et les bibliothèques de communication multi-machines et multi-cartes doivent être implémentées soi-même. Les scores de la puce ne sont pas mauvais, mais le simple fait d’y porter un modèle coûte déraisonnablement cher.
Cet écart comporte une autre dimension dont on parle peu. Le matériel peut s’acheter en un investissement ponctuel ; l’écosystème logiciel ne se construit qu’à force d’années de travail humain. Acheter des cartes est un problème d’approvisionnement ; compléter la chaîne d’outils est une question de temps, et ce temps ne peut s’obtenir qu’à travers de vrais projets. La première équipe dont le modèle tourne, tourne de façon stable et atteint l’échelle sur une plateforme pourra accumuler une expérience réutilisable. C’est aussi pourquoi cette mise en open source mérite d’être traitée à part : il ne s’agit pas de ce qui a été acheté, mais de quelqu’un qui remet ce qu’il a accumulé.
La véritable faiblesse à long terme de la puissance de calcul chinoise est donc logicielle. Les puces savent calculer, mais elles ne sont pas faciles à utiliser. Ce que DeepSeek ouvre cette fois tombe précisément dans ce vide.
Parmi les six modules, le plus intéressant est TileLang
Parmi les six modules, le plus important est TileLang. Il s’agit d’un langage de programmation de haut niveau développé en interne par DeepSeek, jusqu’ici principalement destiné au backend NVIDIA ; cette fois, il prend officiellement en charge l’Ascend 950, avec génération de code native, ordonnancement et synchronisation automatiques. DeepSeek le positionne très directement : une alternative à CUDA, avec un « modèle de programmation plus simple ».
Le TileKernels qui l’accompagne résout un autre problème ancien. Il peut sélectionner automatiquement le backend NVIDIA ou Huawei et exposer la même API Python à la couche supérieure. Autrement dit, le même code tourne sur deux plateformes matérielles, et le coût du changement est ramené au niveau de la configuration, plutôt que de devoir réécrire le noyau.
Les données de tests internes rendues publiques ne sont pas non plus ambiguës. Certains noyaux atteignent sur l’Ascend 950DT une proportion très élevée de la limite matérielle nominale : 99,8 % pour la multiplication matricielle dense en BF16, environ 99,5 % en FP8 ; l’implémentation d’attention creuse destinée à DeepSeek V4.1 atteint 410 TFLOPS en phase de prefill, soit environ 95 % de la valeur théorique. Les deux entreprises ont aussi optimisé conjointement une solution de super-nœud basée sur 128 puces Ascend 950, spécialement conçue pour équilibrer calcul et déplacement des données.
La valeur de ces chiffres tient à ce qu’ils prouvent que cette voie est praticable. Avant, quand on parlait de puissance de calcul chinoise, on parlait de savoir si elle était utilisable ; aujourd’hui, des équipes commencent à accepter de rendre publique leur expérience d’optimisation poussée du matériel, ce qui signifie qu’au moins certaines sont arrivées à un niveau qui mérite d’être partagé.
Une seule API pour deux backends : quel intérêt ?
En regardant TileLang et TileKernels ensemble, leur utilité devient plus claire. TileKernels peut choisir automatiquement le backend NVIDIA ou Huawei et exposer la même API Python au niveau supérieur. Cela signifie qu’une équipe ne maintient qu’un seul code, et non deux.
En pratique, un service d’inférence un tant soit peu sérieux doit souvent tourner sur plusieurs types de matériel à la fois. Le cloud reste peut-être sur NVIDIA, les scénarios auto-hébergés ou de souveraineté technologique utilisent des cartes chinoises, et l’edge une autre plateforme encore. Si chaque changement de matériel impose de réécrire le noyau, l’équipe doit maintenir plusieurs implémentations en parallèle et refaire les tests pour chacune. Une même API fait passer cette tâche de « réécriture » à « modification de configuration » ; ce qui est économisé, ce n’est pas seulement de la main-d’œuvre, mais aussi des occasions d’erreur.

Pour une équipe qui veut simplement livrer un produit, ce genre de changement ne figurera dans aucun communiqué, mais il détermine si elle est prête à essayer du matériel chinois.
Le vrai changement se situe au niveau du coût de migration
Pour un développeur ordinaire, l’impact le plus concret de cette ouverture est le coût de migration.
Auparavant, pour migrer l’entraînement ou l’inférence vers Ascend, il fallait compléter soi-même les opérateurs de bas niveau et adapter ses propres outils ; il n’était pas rare qu’un projet y consacre plusieurs mois. Aujourd’hui, ces chaînes d’outils sont directement open source, beaucoup de pièges ont déjà été rencontrés et corrigés, et peuvent être réutilisés tels quels. La barrière passe de « devoir disposer d’une équipe dédiée à l’adaptation des opérateurs » à « avoir dans l’équipe quelqu’un capable de comprendre ces outils ».
Cela explique aussi pourquoi cette annonce a suscité une réaction notable dans la communauté des développeurs. Ces derniers temps, les modèles sont sortis en abondance ; ce qui manque vraiment, c’est de pouvoir éviter un détour.
Ce qu’il faut regarder maintenant, c’est si les autres l’adoptent
Pour juger de l’importance de cette ouverture, il ne faut pas seulement regarder ce que DeepSeek dit, mais ce que les autres feront dans les six prochains mois.
Qu’une chaîne d’outils s’impose ou non dépend de la volonté de tiers d’y investir. Si TileLang ne sert qu’aux propres modèles de DeepSeek, sa portée s’arrête à l’intérieur de l’entreprise ; si d’autres équipes l’utilisent pour écrire des opérateurs, ouvrent des issues ou étendent les backends matériels, alors il commence à devenir une infrastructure commune. Les chiffres ont beau être beaux, ils ne compteront vraiment qu’après plusieurs mois d’épreuve en charge réelle.
Une autre variable est de savoir si d’autres puces chinoises suivront. Pour l’instant, les informations publiques se concentrent sur Ascend ; si ce langage de haut niveau peut être porté sur davantage de plateformes selon la même logique, sa valeur franchira un cap supplémentaire. La réponse n’est pas encore connue.
Ouvrir les fondations est plus lent que d’ouvrir des modèles
Depuis deux ans, le principal champ de bataille de l’open source chinois reste les poids de modèles. Paramètres, classements, nombre de téléchargements : autant de choses immédiatement visibles. La chaîne d’outils de bas niveau, elle, est différente : elle n’apparaît pas dans les classements et ne crée pas de sujet à court terme. Mais sans cette couche, on peut empiler autant de modèles que l’on veut, tout reste en suspens.
En livrant son expérience d’ingénierie pour faire tourner des modèles de l’ordre de mille milliards de paramètres sur Ascend, DeepSeek fait précisément ce rattrapage discret, mais déterminant pour savoir si le secteur peut continuer d’avancer.
Faut-il migrer dès maintenant ses projets NVIDIA vers Ascend ? La réponse dépend encore du cas précis, et de savoir si l’équipe compte des personnes prêtes à consacrer du temps aux couches basses. Mais à partir de ce jour, l’argument « l’écosystème n’est pas pratique » commence à tenir beaucoup moins bien. Et une fois qu’un écosystème devient utilisable, ce qui suit va souvent plus vite que prévu.
Articles associés
Claude Sonnet 5.5 est 30 % moins cher. C'est une histoire d'achats, pas une histoire de modèle.
Les affirmations de remise des fournisseurs sont généralement mesurées sur une charge de travail représentative, et la vôtre ne l'est pas.
HPE vient de vendre 1,2 milliard de dollars de matériel parce que le réseau est devenu l'essentiel
Une commande de 1,2 milliard de dollars dont la répartition entre cinq catégories n'est pas divulguée n'équivaut pas à 1,2 milliard de marge.
Le malware qui soumet sa prochaine action au vote de quatre modèles
L'infrastructure de commande et contrôle se résume à une poignée d'API publiques et à un webhook Discord.
Shopify laisse les agents IA cliquer sur Acheter. Le marchand encaisse toujours le litige.
La plateforme d'agents négocie l'intention. Le marchand porte le risque.