DeepSeek publiserte 30. september seks åpne programvaremoduler for Huaweis Ascend-akseleratorer og kunngjorde dem via WeChat-kontoen sin. Pakken inneholder en versjon av TileLang, selskapets høynivåspråk for brikkeprogrammering, tilpasset for å kjøre på Ascend 950 — og DeepSeek sier rett ut at det plasserer språket mot Nvidias CUDA.

De fem andre er delene en treningsstabel faktisk trenger: DeepGEMM for matrisemultiplikasjon, FlashMLA for oppmerksomhet, TileKernel, DeepSelect og DeepEP. Reuters meldte at de to selskapene også har samarbeidet om en “supernode” bygget av 128 Ascend 950-brikker, optimalisert både for beregning og for kommunikasjonen mellom dem.

Vollgraven er programvaren, ikke brikken

Nvidias varige fortrinn har aldri vært at brikkene er de eneste raske. Det har vært at CUDA er nitten år gammelt, at alle rammeverk sikter mot det, og at de oppsamlede kjernene, profilverktøyene og omveiene er verdt mer enn noen enkelt maskinvaregenerasjon. Kinesiske akseleratorer har funnes i årevis; grunnen til at de ble i laboratoriet, var at å flytte en seriøs treningskjøring til dem kostet flere ingeniørmåneder enn brikkene sparte.

Rader med servere og kabler i en datahall
De to selskapene bygget også en supernode med 128 brikker. Illustrasjonsfoto. Brett Sayles · pexels · Pexels License

DeepSeeks argument sikter nettopp dit. Selskapet beskriver TileLang som en “enklere programmeringsmodell” enn alternativet, og rammer den større ambisjonen inn som å etablere “et høynivåspråk som er universelt, lett å programmere og likevel i stand til å nå maskinvarens fulle ytelsespotensial” — det grunnleggende steget, med selskapets ord, mot “en ny generasjon uavhengige, selvkontrollerte økosystemer for GPU-programvare”.

Det er en like politisk som teknisk setning, og bør leses som begge deler. Det er også en påstand om ergonomi som ingen uavhengig part har prøvd ennå.

En silisiumskive håndteres i et renrom
Ingen uavhengige ytelsestall fulgte med slippet. Illustrasjonsfoto. Jess Loiterton · pexels · Pexels License

Hvorfor det er DeepSeek som gjør det

DeepSeek trener i frontskala under eksportkontroll, noe som betyr at selskapet allerede har betalt prisen for å få begrenset maskinvare til å virke og har kjerner skrevet for den. Å åpne dem gjør en privat omvei til delt infrastruktur og senker byttekostnaden for hvert annet kinesisk laboratorium som ventet på at noen skulle gå først. Huawei får det selskapet har manglet siden Ascend-serien startet: programvare skrevet av folk som trener store modeller, ikke av folk som selger brikker.

Ingenting av dette er målt uavhengig, og ingen ytelsestall fulgte med slippet.

Hva å følge med på

Om et laboratorium utenfor DeepSeek publiserer en treningskjøring på Ascend med disse bibliotekene, og om supernodens konfigurasjon med 128 brikker dukker opp i en kinesisk skytjenestes offentlige priser. At noen uten grunn til å smigre noen av selskapene tar det i bruk, er den eneste målingen som avgjør dette.