A DeepSeek publicou a 30 de setembro seis módulos de software de código aberto para os aceleradores Ascend da Huawei, anunciando-os através da sua conta de WeChat. O pacote inclui uma versão do TileLang, a linguagem de programação de chips de alto nível da empresa, adaptada para correr no Ascend 950 — e a DeepSeek é explícita ao colocá-la frente ao CUDA da Nvidia.
As outras cinco são as peças de que uma cadeia de treino realmente precisa: DeepGEMM para multiplicação de matrizes, FlashMLA para atenção, TileKernel, DeepSelect e DeepEP. A Reuters noticiou que as duas empresas também trabalharam juntas num “supernó” construído a partir de 128 chips Ascend 950, optimizado tanto para o cálculo como para a comunicação entre eles.
O fosso é o software, não a pastilha
A vantagem duradoura da Nvidia nunca foi os seus chips serem os únicos rápidos. Foi o CUDA ter dezanove anos, todos os enquadramentos o terem como alvo e os núcleos, perfiladores e contornos acumulados valerem mais do que qualquer geração de hardware. Os aceleradores chineses existem há anos; ficaram no laboratório porque portar um treino a sério para eles custava mais meses-engenheiro do que os chips poupavam.

O argumento da DeepSeek aponta exactamente para aí. Descreve o TileLang como oferecendo “um modelo de programação mais simples” do que a alternativa, e enquadra a ambição maior como estabelecer “uma linguagem de alto nível universal, fácil de programar e ainda assim capaz de atingir todo o potencial de desempenho do hardware” — o passo fundacional, nas suas palavras, para “uma nova geração de ecossistemas de software de GPU independentes e autocontrolados”.
É uma frase tão política quanto técnica, e deve ser lida como ambas. É também uma afirmação sobre ergonomia que nenhuma parte independente testou ainda.

Porque é a DeepSeek a fazê-lo
A DeepSeek treina à escala da fronteira sob controlos de exportação, o que significa que já pagou o custo de fazer funcionar hardware limitado e tem núcleos escritos para ele. Abri-los transforma um contorno privado em infra-estrutura partilhada e baixa o custo de mudança para todos os outros laboratórios chineses que esperavam que alguém abrisse caminho. A Huawei ganha o que lhe faltava desde o início da linha Ascend: software escrito por quem treina modelos grandes e não por quem vende chips.
Nada disto foi medido de forma independente, e o lançamento não trouxe números de desempenho.
O que observar
Se algum laboratório fora da DeepSeek publicar um treino em Ascend com estas bibliotecas, e se a configuração de 128 chips do supernó aparecer nos preços públicos de alguma nuvem chinesa. A adopção por quem não tem razões para lisonjear nenhuma das empresas é a única medida que resolverá isto.