DeepSeek publicerade den 30 september sex öppna programvarumoduler för Huaweis Ascend-acceleratorer och tillkännagav dem via sitt WeChat-konto. Paketet innehåller en version av TileLang, bolagets högnivåspråk för chipprogrammering, anpassad för att köra på Ascend 950 — och DeepSeek är tydligt med att det placerar språket mot Nvidias CUDA.

De övriga fem är de delar en träningsstack faktiskt behöver: DeepGEMM för matrismultiplikation, FlashMLA för attention, TileKernel, DeepSelect och DeepEP. Reuters rapporterade att de två bolagen också arbetat tillsammans på en “supernod” byggd av 128 Ascend 950-chipp, optimerad både för beräkning och för kommunikationen mellan dem.

Vallgraven är mjukvaran, inte kretsen

Nvidias uthålliga försprång har aldrig varit att dess chipp är de enda snabba. Det har varit att CUDA är nitton år gammalt, att varje ramverk riktar sig mot det, och att de samlade kärnorna, profilerarna och kringgåendena är värda mer än någon enskild hårdvarugeneration. Kinesiska acceleratorer har funnits i åratal; skälet att de stannade i labbet var att porta en seriös träningskörning till dem kostade fler ingenjörsmånader än chippen sparade.

Rader av servrar med kablar i en datorhall
De två bolagen byggde också en supernod med 128 chipp. Illustrativ bild. Brett Sayles · pexels · Pexels License

DeepSeeks argument siktar precis dit. Bolaget beskriver TileLang som en “enklare programmeringsmodell” än alternativet, och ramar in den större ambitionen som att etablera “ett högnivåspråk som är universellt, lätt att programmera och ändå kan nå hårdvarans fulla prestandapotential” — det grundläggande steget, enligt bolaget, mot “en ny generation av oberoende, självkontrollerade ekosystem för GPU-programvara”.

Det är en lika politisk som teknisk mening och bör läsas som båda. Det är dessutom ett påstående om ergonomi som ingen oberoende part ännu prövat.

En kiselskiva hanteras i ett renrum
Inga oberoende prestandasiffror följde med släppet. Illustrativ bild. Jess Loiterton · pexels · Pexels License

Varför det är DeepSeek som gör det

DeepSeek tränar i frontskala under exportkontroller, vilket innebär att bolaget redan betalat priset för att få begränsad hårdvara att fungera och har kärnor skrivna för den. Att öppna dem förvandlar en privat lösning till delad infrastruktur och sänker bytekostnaden för varje annat kinesiskt labb som väntat på att någon skulle gå först. Huawei får det bolaget behövt sedan Ascend-serien startade: programvara skriven av människor som tränar stora modeller i stället för av människor som säljer chipp.

Inget av detta har mätts oberoende, och inga genomströmningssiffror följde med släppet.

Vad att bevaka

Om något labb utanför DeepSeek publicerar en träningskörning på Ascend med dessa bibliotek, och om supernodens konfiguration med 128 chipp dyker upp i någon kinesisk molntjänsts offentliga prislista. Att någon utan skäl att smickra något av bolagen börjar använda det är den enda mätning som avgör saken.