DeepSeek publicó el 30 de septiembre seis módulos de software de código abierto para los aceleradores Ascend de Huawei, anunciándolos a través de su cuenta de WeChat. El paquete incluye una versión de TileLang, el lenguaje de programación de chips de alto nivel de la empresa, adaptada para ejecutarse en el Ascend 950, y DeepSeek dice con claridad que lo sitúa frente a CUDA de Nvidia.

Los otros cinco son las piezas que una pila de entrenamiento necesita de verdad: DeepGEMM para multiplicación de matrices, FlashMLA para atención, TileKernel, DeepSelect y DeepEP. Reuters informó de que ambas empresas también trabajaron juntas en un “supernodo” construido con 128 chips Ascend 950, optimizado tanto para el cálculo como para la comunicación entre ellos.

El foso es el software, no la oblea

La ventaja duradera de Nvidia nunca ha sido que sus chips fueran los únicos rápidos. Ha sido que CUDA tiene diecinueve años, que todos los marcos lo tienen como destino y que los kernels, perfiladores y apaños acumulados valen más que cualquier generación de hardware. Los aceleradores chinos existen desde hace años; si se quedaron en el laboratorio fue porque portar un entrenamiento serio a ellos costaba más meses-ingeniero de los que ahorraban los chips.

Filas de servidores con cables en una sala de datos
Ambas empresas construyeron además un supernodo de 128 chips. Foto ilustrativa. Brett Sayles · pexels · Pexels License

El argumento de DeepSeek apunta justo ahí. Describe TileLang como un “modelo de programación más sencillo” que la alternativa, y plantea la ambición mayor como establecer “un lenguaje de alto nivel que sea universal, fácil de programar y aun así capaz de alcanzar todo el potencial de rendimiento del hardware”: el paso fundacional, en sus palabras, hacia “una nueva generación de ecosistemas de software de GPU independientes y autocontrolados”.

Esa es una frase tan política como técnica, y debe leerse como ambas cosas. Es además una afirmación sobre ergonomía que ninguna parte independiente ha comprobado todavía.

Una oblea de silicio manipulada en una sala limpia
El lanzamiento no incluyó cifras de rendimiento independientes. Foto ilustrativa. Jess Loiterton · pexels · Pexels License

Por qué es DeepSeek quien lo hace

DeepSeek entrena a escala de frontera bajo controles de exportación, lo que significa que ya ha pagado el coste de hacer funcionar hardware restringido y tiene kernels escritos para él. Liberarlos convierte un apaño privado en infraestructura compartida y reduce el coste de cambio para todos los demás laboratorios chinos que esperaban a que alguien diera el primer paso. Huawei obtiene lo que le hacía falta desde que nació la línea Ascend: software escrito por gente que entrena modelos grandes y no por gente que vende chips.

Nada de esto ha sido medido de forma independiente, y el lanzamiento no venía acompañado de cifras de rendimiento.

Qué vigilar

Si algún laboratorio ajeno a DeepSeek publica un entrenamiento en Ascend usando estas bibliotecas, y si la configuración de 128 chips del supernodo aparece en los precios públicos de alguna nube china. La adopción por parte de alguien sin motivo para halagar a ninguna de las dos empresas es la única medida que zanjará esto.