← Retour au blog
NewsEnviron 8 min de lecture

DeepSeek met en open source son expérience d’ingénierie pour faire tourner des modèles à mille milliards de paramètres : cette fois, la puissance de calcul chinoise comble la couche logicielle

Publié le 3 oct. 2026
DeepSeek met en open source son expérience d’ingénierie pour faire tourner des modèles à mille milliards de paramètres : cette fois, la puissance de calcul chinoise comble la couche logicielle

Le 30 septembre, DeepSeek a publié une série de codes sur son compte officiel WeChat, mettant en open source six modules pour la plateforme Huawei Ascend : TileLang, DeepGEMM-Ascend, DeepEP-Ascend, TileKernels, FlashMLA, DeepSelect. Les noms semblent disparates, mais le périmètre couvert est en réalité très cohérent : un langage de programmation, une série de noyaux de calcul, et en plus la communication distribuée.

Cela ressemble peu à une open source classique. Ce qui est mis en open source ici, ce n’est pas le modèle, mais la couche de fondation nécessaire pour le faire tourner.

Quand les puces suffisent, le blocage vient d’ailleurs

Ces dernières années, ce dont on a le plus parlé à propos de la puissance de calcul chinoise, ce sont les chiffres de performance. Les fiches techniques sont de plus en plus séduisantes d’année en année, mais les ingénieurs qui ont réellement migré des modèles savent que les ennuis viennent rarement de la puissance de calcul de pointe.

L’écosystème CUDA de NVIDIA se construit depuis plus de vingt ans. Compilateurs, bibliothèques mathématiques, bibliothèques de communication : couche après couche, le développeur reçoit une carte et peut s’en servir ; la documentation, la communauté, les retours d’expérience sont déjà là. En passant à un autre matériel, le même opérateur doit parfois être écrit soi-même, l’ordonnancement doit être réglé à la main, et les bibliothèques de communication multi-machines et multi-cartes doivent être implémentées soi-même. Les scores de la puce ne sont pas mauvais, mais le simple fait d’y porter un modèle coûte déraisonnablement cher.

Cet écart comporte une autre dimension dont on parle peu. Le matériel peut s’acheter en un investissement ponctuel ; l’écosystème logiciel ne se construit qu’à force d’années de travail humain. Acheter des cartes est un problème d’approvisionnement ; compléter la chaîne d’outils est une question de temps, et ce temps ne peut s’obtenir qu’à travers de vrais projets. La première équipe dont le modèle tourne, tourne de façon stable et atteint l’échelle sur une plateforme pourra accumuler une expérience réutilisable. C’est aussi pourquoi cette mise en open source mérite d’être traitée à part : il ne s’agit pas de ce qui a été acheté, mais de quelqu’un qui remet ce qu’il a accumulé.

La véritable faiblesse à long terme de la puissance de calcul chinoise est donc logicielle. Les puces savent calculer, mais elles ne sont pas faciles à utiliser. Ce que DeepSeek ouvre cette fois tombe précisément dans ce vide.

Parmi les six modules, le plus intéressant est TileLang

Parmi les six modules, le plus important est TileLang. Il s’agit d’un langage de programmation de haut niveau développé en interne par DeepSeek, jusqu’ici principalement destiné au backend NVIDIA ; cette fois, il prend officiellement en charge l’Ascend 950, avec génération de code native, ordonnancement et synchronisation automatiques. DeepSeek le positionne très directement : une alternative à CUDA, avec un « modèle de programmation plus simple ».

Le TileKernels qui l’accompagne résout un autre problème ancien. Il peut sélectionner automatiquement le backend NVIDIA ou Huawei et exposer la même API Python à la couche supérieure. Autrement dit, le même code tourne sur deux plateformes matérielles, et le coût du changement est ramené au niveau de la configuration, plutôt que de devoir réécrire le noyau.

Les données de tests internes rendues publiques ne sont pas non plus ambiguës. Certains noyaux atteignent sur l’Ascend 950DT une proportion très élevée de la limite matérielle nominale : 99,8 % pour la multiplication matricielle dense en BF16, environ 99,5 % en FP8 ; l’implémentation d’attention creuse destinée à DeepSeek V4.1 atteint 410 TFLOPS en phase de prefill, soit environ 95 % de la valeur théorique. Les deux entreprises ont aussi optimisé conjointement une solution de super-nœud basée sur 128 puces Ascend 950, spécialement conçue pour équilibrer calcul et déplacement des données.

La valeur de ces chiffres tient à ce qu’ils prouvent que cette voie est praticable. Avant, quand on parlait de puissance de calcul chinoise, on parlait de savoir si elle était utilisable ; aujourd’hui, des équipes commencent à accepter de rendre publique leur expérience d’optimisation poussée du matériel, ce qui signifie qu’au moins certaines sont arrivées à un niveau qui mérite d’être partagé.

Une seule API pour deux backends : quel intérêt ?

En regardant TileLang et TileKernels ensemble, leur utilité devient plus claire. TileKernels peut choisir automatiquement le backend NVIDIA ou Huawei et exposer la même API Python au niveau supérieur. Cela signifie qu’une équipe ne maintient qu’un seul code, et non deux.

En pratique, un service d’inférence un tant soit peu sérieux doit souvent tourner sur plusieurs types de matériel à la fois. Le cloud reste peut-être sur NVIDIA, les scénarios auto-hébergés ou de souveraineté technologique utilisent des cartes chinoises, et l’edge une autre plateforme encore. Si chaque changement de matériel impose de réécrire le noyau, l’équipe doit maintenir plusieurs implémentations en parallèle et refaire les tests pour chacune. Une même API fait passer cette tâche de « réécriture » à « modification de configuration » ; ce qui est économisé, ce n’est pas seulement de la main-d’œuvre, mais aussi des occasions d’erreur.

Une puce lumineuse sur une carte de circuit imprimé sombre, la lumière se diffuse le long de fines pistes, dans des tons cyan froids

Pour une équipe qui veut simplement livrer un produit, ce genre de changement ne figurera dans aucun communiqué, mais il détermine si elle est prête à essayer du matériel chinois.

Le vrai changement se situe au niveau du coût de migration

Pour un développeur ordinaire, l’impact le plus concret de cette ouverture est le coût de migration.

Auparavant, pour migrer l’entraînement ou l’inférence vers Ascend, il fallait compléter soi-même les opérateurs de bas niveau et adapter ses propres outils ; il n’était pas rare qu’un projet y consacre plusieurs mois. Aujourd’hui, ces chaînes d’outils sont directement open source, beaucoup de pièges ont déjà été rencontrés et corrigés, et peuvent être réutilisés tels quels. La barrière passe de « devoir disposer d’une équipe dédiée à l’adaptation des opérateurs » à « avoir dans l’équipe quelqu’un capable de comprendre ces outils ».

Cela explique aussi pourquoi cette annonce a suscité une réaction notable dans la communauté des développeurs. Ces derniers temps, les modèles sont sortis en abondance ; ce qui manque vraiment, c’est de pouvoir éviter un détour.

Ce qu’il faut regarder maintenant, c’est si les autres l’adoptent

Pour juger de l’importance de cette ouverture, il ne faut pas seulement regarder ce que DeepSeek dit, mais ce que les autres feront dans les six prochains mois.

Qu’une chaîne d’outils s’impose ou non dépend de la volonté de tiers d’y investir. Si TileLang ne sert qu’aux propres modèles de DeepSeek, sa portée s’arrête à l’intérieur de l’entreprise ; si d’autres équipes l’utilisent pour écrire des opérateurs, ouvrent des issues ou étendent les backends matériels, alors il commence à devenir une infrastructure commune. Les chiffres ont beau être beaux, ils ne compteront vraiment qu’après plusieurs mois d’épreuve en charge réelle.

Une autre variable est de savoir si d’autres puces chinoises suivront. Pour l’instant, les informations publiques se concentrent sur Ascend ; si ce langage de haut niveau peut être porté sur davantage de plateformes selon la même logique, sa valeur franchira un cap supplémentaire. La réponse n’est pas encore connue.

Ouvrir les fondations est plus lent que d’ouvrir des modèles

Depuis deux ans, le principal champ de bataille de l’open source chinois reste les poids de modèles. Paramètres, classements, nombre de téléchargements : autant de choses immédiatement visibles. La chaîne d’outils de bas niveau, elle, est différente : elle n’apparaît pas dans les classements et ne crée pas de sujet à court terme. Mais sans cette couche, on peut empiler autant de modèles que l’on veut, tout reste en suspens.

En livrant son expérience d’ingénierie pour faire tourner des modèles de l’ordre de mille milliards de paramètres sur Ascend, DeepSeek fait précisément ce rattrapage discret, mais déterminant pour savoir si le secteur peut continuer d’avancer.

Faut-il migrer dès maintenant ses projets NVIDIA vers Ascend ? La réponse dépend encore du cas précis, et de savoir si l’équipe compte des personnes prêtes à consacrer du temps aux couches basses. Mais à partir de ce jour, l’argument « l’écosystème n’est pas pratique » commence à tenir beaucoup moins bien. Et une fois qu’un écosystème devient utilisable, ce qui suit va souvent plus vite que prévu.

Articles associés