En produksjonsklynge uten Nvidia
Z.ai publiserte en teknisk redegjørelse 17. september for hvordan selskapet fra bunnen av bygde en inferenstjeneste i produksjon for GLM-5.3-Flash på en klynge med mer enn 100 000 kinesiskproduserte KI-akseleratorer. All produksjonsinferens for modellen kjører nå på dette systemet, opplyser selskapet. Brikkeprodusentene navngis ikke.
Den utelatelsen betyr noe, for påstanden under handler om kinesisk innenlandsk silisium: at en modell i frontskala kan betjenes kommersielt uten amerikanske akseleratorer, til en kostnad selskapet kaller konkurransedyktig.
Modellen som betjenes
GLM-5.3-Flash ble lansert 26. august. Den har 320 milliarder parametere totalt, hvorav 18 milliarder aktive, et kontekstvindu på én million tokens, og er den første modellen i GLM-5-serien som tar imot bilde og video i tillegg til tekst.
Før lanseringen ble den testet anonymt under navnet ox-alpha. Z.ai opplyser at den i løpet av en uke ble det mest brukte tilbudet på OpenCode og OpenRouter, og behandlet mer enn 62 billioner tokens på seks døgn.

En agent som gjorde infrastrukturarbeidet
Den delen av redegjørelsen som ikke handler om brikker, handler om hvem som gjorde arbeidet. Z.ai opplyser at mye av optimaliseringen ble utført av en intern Infra Agent som kjører på GLM-5.3 — analyse, hypoteser og kodeendringer — mens menneskelige ingeniører satte målene, systemgrensene og risikovurderingen.
For å få det til bygde teamet det de kaller tett tilbakemelding: korrekthetstester, kjørelogger, eksekveringsspor, kjørehendelser, mikrobenchmarks og ende-til-ende-målinger, satt sammen slik at en foreslått endring kunne prøves lokalt i stedet for å kreve full utrulling etter hver redigering.
Tallene, og hvor de kommer fra
Z.ai opplyser at selskapet gikk fra første modelltilpasning til produksjonsklar tjeneste på under to uker, at ende-til-ende-gjennomstrømningen til slutt ble tre ganger utgangspunktet, og at maskinvareutnyttelse og kostnad per token nådde nivåer sammenlignbare med vanlige Nvidia-grafikkprosessorer.
Hvert eneste av disse tallene er selskapets egne, om selskapets eget system, og ingen er uavhengig verifisert. Redegjørelsen lister også opp hva som var vanskelig: begrenset minnekapasitet og båndbredde på brikkene, en ny modellarkitektur, kontekstvinduet på én million tokens, multimodale forespørsler og et umodent programvareøkosystem der kjernestøtten var ufullstendig og ingeniørene måtte gjette seg til atferd som burde vært dokumentert.

Eksportkontrollenes sammenheng
Amerikanske eksportkontroller har i tre år holdt Nvidias mest kapable komponenter unna Kina, og kinesiske laboratorier har bygd rundt det de kan kjøpe hjemme. Huawei framskyndet denne uken sin neste Ascend-akselerator med tre kvartaler, til første kvartal 2027, og kinesiske brikkeprodusenter har hevet prisene mens minne med høy båndbredde er mangelvare.
Analytikere som er sitert i dekningen av redegjørelsen, har antydet at klyngen trolig er en blanding av Huaweis Ascend-komponenter og maskinvare fra andre leverandører, men det er en slutning utenfra, ikke noe Z.ai har bekreftet.
Hva vi følger med på
To ting ville gjøre dette om fra en selskapspåstand til et etterprøvbart faktum: at Z.ai navngir akseleratorene, og at noen uavhengig måler kostnaden per token mot Nvidia-baserte leverandører. Inntil da er brukstallene det fasteste i saken — en modell som brukes så mye, må kjøre et sted.