Ett produktionskluster utan Nvidia
Z.ai publicerade en teknisk redogörelse den 17 september för hur bolaget från grunden byggde en inferenstjänst i produktion för GLM-5.3-Flash på ett kluster med fler än 100 000 kinesisktillverkade AI-acceleratorer. All produktionsinferens för modellen körs nu på det systemet, uppger bolaget. Chipptillverkarna namnges inte.
Den utelämnade uppgiften spelar roll, eftersom påståendet under den handlar om kinesisk inhemsk kisel: att en modell i frontskala kan serveras kommersiellt utan amerikanska acceleratorer, till en kostnad som bolaget kallar konkurrenskraftig.
Modellen som körs
GLM-5.3-Flash släpptes den 26 augusti. Den har 320 miljarder parametrar totalt varav 18 miljarder aktiva, ett kontextfönster på en miljon tokens och är den första modellen i GLM-5-serien som tar emot bild och video utöver text.
Före lanseringen testades den anonymt under namnet ox-alpha. Z.ai uppger att den inom en vecka blev den mest använda modellen på OpenCode och OpenRouter och behandlade mer än 62 biljoner tokens på sex dygn.

En agent som gjorde infrastrukturarbetet
Den del av redogörelsen som inte handlar om chipp handlar om vem som utförde arbetet. Z.ai uppger att en intern Infra Agent som körs på GLM-5.3 stod för mycket av optimeringen — analys, hypoteser och kodändringar — medan mänskliga ingenjörer satte mål, systemgränser och riskbedömning.
För att det skulle fungera byggde teamet vad det kallar tät återkoppling: korrekthetstester, körloggar, exekveringsspår, körhändelser, mikrobenchmarks och mått från ände till ände, sammansatta så att en föreslagen ändring kunde prövas lokalt i stället för att kräva en fullständig driftsättning efter varje redigering.
Siffrorna, och varifrån de kommer
Z.ai uppger att bolaget gick från första modellanpassning till produktionsfärdighet på under två veckor, att genomströmningen från ände till ände till slut blev tre gånger utgångsläget, och att hårdvaruutnyttjande och kostnad per token nådde nivåer jämförbara med gängse Nvidia-grafikprocessorer.
Varenda en av de siffrorna är bolagets egna, om bolagets eget system, och ingen har granskats oberoende. Redogörelsen räknar också upp vad som var svårt: begränsad minneskapacitet och bandbredd på chippen, en ny modellarkitektur, kontextfönstret på en miljon tokens, multimodala förfrågningar och ett omoget programvaruekosystem där kärnstödet var ofullständigt och ingenjörerna fick gissa sig till beteenden som borde ha varit dokumenterade.

Exportkontrollernas sammanhang
Amerikanska exportkontroller har i tre år hållit Nvidias mest kapabla kretsar borta från Kina, och kinesiska laboratorier har byggt kring det de kan köpa på hemmaplan. Huawei tidigarelade den här veckan sin nästa Ascend-accelerator med tre kvartal, till första kvartalet 2027, och kinesiska tillverkare har höjt priserna när minne med hög bandbredd tryter.
Analytiker som citerats i rapporteringen om redogörelsen har antytt att klustret sannolikt är en blandning av Huaweis Ascend-kretsar och hårdvara från andra leverantörer, men det är en slutsats utifrån och inget Z.ai har bekräftat.
Att hålla ögonen på
Två saker skulle göra detta till ett kontrollerbart faktum i stället för ett företagspåstående: att Z.ai namnger acceleratorerna, och att någon oberoende mäter kostnaden per token mot Nvidia-baserade leverantörer. Tills dess är belastningssiffrorna det stadigaste i historien — en modell som används så mycket måste köras någonstans.