Un cluster de production sans Nvidia
Z.ai a publié un compte rendu technique le 17 septembre expliquant comment l’entreprise a bâti de zéro un service d’inférence en production pour GLM-5.3-Flash sur un cluster de plus de 100 000 accélérateurs d’IA fabriqués en Chine. Toute l’inférence de production du modèle tourne désormais sur ce système, affirme l’entreprise, qui n’a pas nommé les fabricants de puces.
Cette omission compte, car l’affirmation sous-jacente porte sur la capacité du silicium chinois : qu’un modèle à l’échelle de la frontière peut être servi commercialement sans accélérateurs américains, à un coût que la société juge compétitif.
Le modèle servi
GLM-5.3-Flash a été publié le 26 août. Il compte 320 milliards de paramètres au total, dont 18 milliards actifs, une fenêtre de contexte d’un million de jetons, et c’est le premier modèle de la série GLM-5 à accepter des entrées image et vidéo en plus du texte.
Avant sa sortie, il a été testé anonymement sous le nom d’ox-alpha. Z.ai indique qu’il est devenu en une semaine l’offre la plus utilisée sur OpenCode et OpenRouter, traitant plus de 62 000 milliards de jetons en six jours.

Un agent chargé du travail d’infrastructure
La partie du compte rendu qui ne parle pas de puces parle de qui a fait le travail. Z.ai indique qu’une grande part de l’optimisation a été menée par un Infra Agent interne tournant sur GLM-5.3 — analyse, hypothèses et modifications de code — tandis que des ingénieurs humains fixaient les objectifs, les limites du système et l’évaluation des risques.
Pour rendre cela praticable, l’équipe a construit ce qu’elle appelle un retour dense : tests de correction, journaux d’exécution, traces, événements d’exécution, microbenchmarks et métriques de bout en bout, assemblés pour qu’une modification proposée puisse être vérifiée localement au lieu d’exiger un déploiement complet après chaque édition.
Les chiffres, et leur provenance
Z.ai dit être passée de l’adaptation initiale du modèle à la mise en production en moins de deux semaines, avec un débit de bout en bout finalement triplé par rapport au point de départ, et affirme que le taux d’utilisation du matériel et le coût par jeton ont atteint des niveaux comparables aux GPU Nvidia courants.
Chacun de ces chiffres émane de l’entreprise, au sujet de son propre système, et aucun n’a été vérifié de façon indépendante. Le compte rendu énumère aussi les difficultés : capacité et bande passante mémoire limitées sur les puces, une architecture de modèle nouvelle, la fenêtre d’un million de jetons, les requêtes multimodales et un écosystème logiciel immature où la prise en charge des noyaux était incomplète et où les ingénieurs ont dû deviner des comportements qui auraient dû être documentés.

Le contexte des contrôles à l’exportation
Les contrôles américains tiennent depuis trois ans les composants Nvidia les plus performants hors de Chine, et les laboratoires chinois construisent autour de ce qu’ils peuvent acheter sur place. Huawei a avancé cette semaine de trois trimestres son prochain accélérateur Ascend, au premier trimestre 2027, et les fondeurs chinois ont relevé leurs prix alors que la mémoire à haute bande passante manque.
Des analystes cités dans la couverture du rapport ont suggéré que le cluster mêle probablement des composants Ascend de Huawei et du matériel d’autres fournisseurs, mais il s’agit d’une déduction extérieure, non d’une confirmation de Z.ai.
À surveiller
Deux choses feraient passer cela du statut d’affirmation d’entreprise à celui de fait vérifiable : que Z.ai nomme les accélérateurs, et qu’une mesure indépendante compare le coût de service par jeton à celui des fournisseurs équipés en Nvidia. D’ici là, les chiffres d’usage restent la partie la plus solide du récit : un modèle aussi sollicité doit bien tourner quelque part.