Um cluster em produção sem Nvidia

A Z.ai publicou um relato técnico a 17 de setembro sobre como construiu de raiz um serviço de inferência em produção para o GLM-5.3-Flash num cluster com mais de 100.000 aceleradores de IA fabricados na China. Toda a inferência em produção do modelo corre agora nesse sistema, diz a empresa, que não nomeou os fabricantes de chips.

A omissão importa, porque a afirmação por baixo é sobre a capacidade do silício doméstico chinês: que um modelo de escala de fronteira pode ser servido comercialmente sem aceleradores norte-americanos, a um custo que a empresa considera competitivo.

O modelo que é servido

O GLM-5.3-Flash foi lançado a 26 de agosto. Tem 320 mil milhões de parâmetros no total, com 18 mil milhões ativos, uma janela de contexto de um milhão de tokens, e é o primeiro modelo da série GLM-5 a aceitar entrada de imagem e vídeo além de texto.

Antes do lançamento foi testado anonimamente com o nome ox-alpha. A Z.ai diz que em uma semana se tornou a oferta mais usada no OpenCode e no OpenRouter, processando mais de 62 biliões de tokens em seis dias.

Um técnico segura um painel de circuitos gravado numa bancada
A empresa diz que um agente a correr no seu próprio modelo fez grande parte da otimização. Fotografia ilustrativa. Willquezada · pexels · Pexels License

Um agente a fazer o trabalho de infraestrutura

A parte do relato que não é sobre chips é sobre quem fez o trabalho. A Z.ai diz que boa parte da otimização foi levada a cabo por um Infra Agent interno a correr sobre o GLM-5.3 — tratando da análise, das hipóteses e das alterações de código — enquanto engenheiros humanos definiam os objetivos, os limites do sistema e a avaliação de risco.

Para tornar isso viável, a equipa construiu aquilo a que chama retorno denso: testes de correção, registos de execução, traços, eventos em tempo de execução, microbenchmarks e métricas de ponta a ponta, reunidos de modo a que uma alteração proposta pudesse ser verificada localmente em vez de exigir uma implantação completa a cada edição.

Os números, e de onde vêm

A Z.ai reporta ter ido da adaptação inicial do modelo à prontidão para produção em menos de duas semanas, com o débito de ponta a ponta a acabar no triplo do ponto de partida, e afirma que a utilização de hardware e o custo por token atingiram níveis comparáveis aos das GPU Nvidia correntes.

Todos esses números são da própria empresa, sobre o seu próprio sistema, e nenhum foi verificado de forma independente. O relato enumera também o que dificultou o trabalho: capacidade e largura de banda de memória limitadas nos chips, uma arquitetura de modelo nova, a janela de um milhão de tokens, os pedidos multimodais e um ecossistema de software imaturo em que o suporte de kernels era incompleto e os engenheiros tiveram de deduzir comportamentos que deveriam estar documentados.

Cabos de rede e um painel de ligações num centro de dados
O cluster é descrito com mais de 100.000 aceleradores. Fotografia ilustrativa. Brett Sayles · pexels · Pexels License

O contexto dos controlos de exportação

Os controlos de exportação norte-americanos mantêm há três anos as peças mais capazes da Nvidia fora da China, e os laboratórios chineses têm construído em torno do que podem comprar em casa. A Huawei antecipou esta semana em três trimestres o seu próximo acelerador Ascend, para o primeiro trimestre de 2027, e os fabricantes chineses têm subido preços com a escassez de memória de alta largura de banda.

Analistas citados na cobertura do relato sugeriram que o cluster será provavelmente uma mistura de peças Ascend da Huawei e hardware de outros fornecedores, mas isso é uma dedução externa, não algo que a Z.ai tenha confirmado.

O que observar

Duas coisas transformariam isto de afirmação empresarial em facto verificável: a Z.ai nomear os aceleradores e uma medição independente do custo de serviço por token face a fornecedores assentes em Nvidia. Até lá, os números de utilização são a parte mais firme da história: um modelo tão usado tem de estar a correr algures.