DeepSeek a publié le 30 septembre six modules logiciels open source pour les accélérateurs Ascend de Huawei, annoncés via son compte WeChat. Le paquet comprend une version de TileLang, le langage de programmation de puces de haut niveau de l’entreprise, adaptée pour tourner sur l’Ascend 950 — et DeepSeek dit explicitement le placer face à CUDA de Nvidia.
Les cinq autres sont les pièces dont une chaîne d’entraînement a réellement besoin : DeepGEMM pour la multiplication matricielle, FlashMLA pour l’attention, TileKernel, DeepSelect et DeepEP. Reuters a rapporté que les deux entreprises ont aussi travaillé ensemble sur un « supernœud » constitué de 128 puces Ascend 950, optimisé pour le calcul comme pour la communication entre elles.
Le fossé, c’est le logiciel, pas la puce
L’avantage durable de Nvidia n’a jamais été que ses puces seraient les seules rapides. C’est que CUDA a dix-neuf ans, que tous les cadres logiciels le visent, et que les noyaux, profileurs et contournements accumulés valent plus que n’importe quelle génération de matériel. Les accélérateurs chinois existent depuis des années ; s’ils sont restés au laboratoire, c’est que porter un entraînement sérieux sur eux coûtait plus de mois-ingénieur que les puces n’en faisaient économiser.

L’argument de DeepSeek vise exactement là. L’entreprise décrit TileLang comme offrant « un modèle de programmation plus simple » que l’alternative, et présente l’ambition plus large comme l’établissement d’« un langage de haut niveau universel, facile à programmer, et malgré tout capable d’atteindre le plein potentiel de performance du matériel » — première pierre, selon ses termes, vers « une nouvelle génération d’écosystèmes logiciels GPU indépendants et autocontrôlés ».
C’est une phrase autant politique que technique, et elle doit être lue comme telle. C’est aussi une affirmation d’ergonomie qu’aucune partie indépendante n’a encore vérifiée.

Pourquoi c’est DeepSeek qui s’y colle
DeepSeek entraîne à l’échelle de la frontière sous contrôles à l’exportation, ce qui signifie qu’elle a déjà payé le prix de faire fonctionner du matériel contraint et dispose de noyaux écrits pour lui. Les ouvrir transforme un contournement privé en infrastructure partagée et abaisse le coût de bascule pour tous les autres laboratoires chinois qui attendaient que quelqu’un ouvre la voie. Huawei obtient ce qui lui manquait depuis les débuts de la gamme Ascend : du logiciel écrit par des gens qui entraînent de grands modèles plutôt que par des gens qui vendent des puces.
Rien de tout cela n’a été mesuré de façon indépendante, et aucun chiffre de débit n’accompagnait la publication.
Ce qu’il faut surveiller
Si un laboratoire autre que DeepSeek publie un entraînement sur Ascend avec ces bibliothèques, et si la configuration à 128 puces du supernœud apparaît dans les tarifs publics d’un nuage chinois. L’adoption par quelqu’un qui n’a aucune raison de flatter l’une ou l’autre entreprise est la seule mesure qui tranchera.