En produktionsklynge uden Nvidia

Z.ai offentliggjorde en teknisk redegørelse den 17. september for, hvordan selskabet fra bunden byggede en inferenstjeneste i produktion til GLM-5.3-Flash på en klynge med mere end 100.000 kinesiskproducerede AI-acceleratorer. Al produktionsinferens for modellen kører nu på det system, oplyser selskabet. Chipproducenterne nævnes ikke.

Den udeladelse betyder noget, for påstanden under den handler om kinesisk indenlandsk silicium: at en model i frontskala kan betjenes kommercielt uden amerikanske acceleratorer, til en pris selskabet kalder konkurrencedygtig.

Modellen, der betjenes

GLM-5.3-Flash blev lanceret den 26. august. Den har 320 milliarder parametre i alt, heraf 18 milliarder aktive, et kontekstvindue på én million tokens, og er den første model i GLM-5-serien, der tager imod billede og video ud over tekst.

Før lanceringen blev den testet anonymt under navnet ox-alpha. Z.ai oplyser, at den inden for en uge blev det mest brugte tilbud på OpenCode og OpenRouter og behandlede mere end 62 billioner tokens på seks døgn.

En tekniker holder et ætset kredsløbspanel ved en arbejdsbænk
Selskabet oplyser, at en agent på selskabets egen model udførte en stor del af optimeringen. Billedet er en illustration. Willquezada · pexels · Pexels License

En agent, der lavede infrastrukturarbejdet

Den del af redegørelsen, der ikke handler om chips, handler om, hvem der udførte arbejdet. Z.ai oplyser, at en stor del af optimeringen blev udført af en intern Infra Agent, der kører på GLM-5.3 — analyse, hypoteser og kodeændringer — mens menneskelige ingeniører fastlagde mål, systemgrænser og risikovurdering.

For at gøre det muligt byggede holdet det, de kalder tæt tilbagemelding: korrekthedstest, kørselslogfiler, eksekveringsspor, kørselshændelser, mikrobenchmarks og ende-til-ende-målinger, sat sammen, så en foreslået ændring kunne afprøves lokalt i stedet for at kræve fuld udrulning efter hver redigering.

Tallene, og hvor de kommer fra

Z.ai oplyser, at selskabet gik fra første modeltilpasning til produktionsklar tjeneste på under to uger, at ende-til-ende-gennemløbet endte på tre gange udgangspunktet, og at hardwareudnyttelse og pris per token nåede niveauer, der kan sammenlignes med gængse Nvidia-grafikprocessorer.

Hvert eneste af disse tal er selskabets egne om selskabets eget system, og ingen af dem er uafhængigt efterprøvet. Redegørelsen opregner også, hvad der var svært: begrænset hukommelseskapacitet og båndbredde på chippene, en ny modelarkitektur, kontekstvinduet på én million tokens, multimodale forespørgsler og et umodent softwareøkosystem, hvor kerneunderstøttelsen var ufuldstændig, og ingeniørerne måtte gætte sig til adfærd, der burde have været dokumenteret.

Netværkskabler og et krydsfelt i et datacenter
Klyngen beskrives med mere end 100.000 acceleratorer. Billedet er en illustration. Brett Sayles · pexels · Pexels License

Eksportkontrollernes sammenhæng

Amerikanske eksportkontroller har i tre år holdt Nvidias mest kapable komponenter ude af Kina, og kinesiske laboratorier har bygget omkring det, de kan købe hjemme. Huawei rykkede i denne uge sin næste Ascend-accelerator tre kvartaler frem til første kvartal af 2027, og kinesiske chipproducenter har hævet priserne, mens hukommelse med høj båndbredde er en mangelvare.

Analytikere, der er citeret i dækningen af redegørelsen, har antydet, at klyngen formentlig er en blanding af Huaweis Ascend-komponenter og hardware fra andre leverandører, men det er en slutning udefra og ikke noget, Z.ai har bekræftet.

Hvad vi holder øje med

To ting ville gøre dette til en efterprøvelig kendsgerning i stedet for en virksomhedspåstand: at Z.ai nævner acceleratorerne, og at nogen uafhængigt måler prisen per token mod Nvidia-baserede udbydere. Indtil da er brugstallene det mest solide i historien — en model, der bruges så meget, må køre et sted.