Un clúster en producción sin Nvidia
Z.ai publicó un informe técnico el 17 de septiembre sobre cómo construyó desde cero un servicio de inferencia en producción para GLM-5.3-Flash en un clúster de más de 100.000 aceleradores de IA fabricados en China. Toda la inferencia en producción del modelo corre ya en ese sistema, según la empresa, que no nombró a los fabricantes de chips.
Esa omisión importa, porque debajo hay una afirmación sobre la capacidad del silicio nacional chino: que un modelo de escala frontera puede servirse comercialmente sin aceleradores estadounidenses y a un coste que la compañía califica de competitivo.
El modelo que se sirve
GLM-5.3-Flash se publicó el 26 de agosto. Tiene 320.000 millones de parámetros totales con 18.000 millones activos, una ventana de contexto de un millón de tokens y es el primer modelo de la serie GLM-5 que acepta entrada de imagen y vídeo además de texto.
Antes del lanzamiento se probó de forma anónima con el nombre ox-alpha. Z.ai dice que en una semana se convirtió en la oferta más usada en OpenCode y OpenRouter, procesando más de 62 billones de tokens en seis días.

Un agente haciendo el trabajo de infraestructura
La parte del informe que no trata de chips trata de quién hizo el trabajo. Z.ai afirma que buena parte de la optimización la llevó a cabo un Infra Agent interno que corre sobre GLM-5.3 —encargado del análisis, las hipótesis y los cambios de código— mientras los ingenieros humanos fijaban los objetivos, los límites del sistema y la evaluación de riesgos.
Para que eso funcionase, el equipo construyó lo que llama retroalimentación densa: pruebas de corrección, registros de ejecución, trazas, eventos en tiempo de ejecución, microbenchmarks y métricas de extremo a extremo, reunidos de modo que un cambio propuesto pudiera comprobarse localmente en lugar de exigir un despliegue completo tras cada edición.
Las cifras, y de dónde salen
Z.ai asegura que pasó de la adaptación inicial del modelo a la disponibilidad en producción en menos de dos semanas, con un rendimiento de extremo a extremo que acabó siendo el triple del punto de partida, y sostiene que el aprovechamiento del hardware y el coste por token alcanzaron niveles comparables a los de las GPU de Nvidia más habituales.
Todas esas cifras son de la propia empresa, sobre su propio sistema, y ninguna ha sido verificada de forma independiente. El informe enumera también lo que lo hizo difícil: capacidad y ancho de banda limitados de memoria en chip, una arquitectura de modelo nueva, el contexto de un millón de tokens, las peticiones multimodales y un ecosistema de software inmaduro en el que el soporte de kernels era incompleto y los ingenieros tuvieron que deducir comportamientos que deberían haber estado documentados.

El contexto de los controles de exportación
Los controles de exportación estadounidenses llevan tres años manteniendo fuera de China las piezas más capaces de Nvidia, y los laboratorios chinos han construido alrededor de lo que pueden comprar en casa. Huawei adelantó esta semana tres trimestres su próximo acelerador Ascend, al primer trimestre de 2027, y los fabricantes chinos han subido precios ante la escasez de memoria de alto ancho de banda.
Analistas citados en la cobertura del informe han sugerido que el clúster es probablemente una mezcla de piezas Ascend de Huawei y hardware de otros proveedores, pero eso es una inferencia externa, no algo que Z.ai haya confirmado.
Qué vigilar
Dos cosas convertirían esto de una afirmación empresarial en un hecho comprobable: que Z.ai nombre los aceleradores y que alguien mida de forma independiente el coste de servicio por token frente a proveedores basados en Nvidia. Hasta entonces, las cifras de uso son la parte más firme de la historia: un modelo tan utilizado tiene que estar corriendo en alguna parte.