Vad som släpptes

Alibabas DAMO Academy publicerade på torsdagen en allmän medicinsk bildmodell vid namn RADAR i Science och lade samtidigt ut kod och vikter på GitHub och Hugging Face under Apache 2.0-licens.

RADAR tolkar kontrastförstärkta datortomografier av buken. Den täcker 18 organ och rapporterar om 146 skilda kliniska fynd, däribland cancer. DAMO beskriver den som den första generalistmodellen på expertnivå för medicinsk bildtolkning — bolagets egen karaktäristik, inte en oberoende bedömning.

De redovisade resultaten

Över nästan 40 000 verkliga undersökningar redovisar forskarna ett genomsnittligt AUC på 0,913 över de 146 fynden. AUC mäter hur väl ett test skiljer positiva fall från negativa; 1,0 vore perfekt särskiljning.

Två kliniker diskuterar resultat på ett sjukhuskontor
Illustration: i granskningsstudien översteg modellens träffsäkerhet 23 av 26 radiologer. Los Muertos Crew · pexels · Pexels License

I en granskningsstudie mot 26 radiologer från flera sjukhus översteg modellens genomsnittliga träffsäkerhet 23 av dem. Forskarna redovisar också att när radiologerna fick modellens uppslag steg deras sensitivitet med omkring 10 procent och granskningstiden sjönk med mer än 30 procent.

Träningsmängden var 424 911 kontrastförstärkta buktomografier och mer än 15 miljoner anatomimärkta bild-textpar.

Vad siffrorna visar och inte visar

Det är uppgifter från det team som byggt modellen, i en granskad artikel. Kollegial granskning är ett verkligt filter, men inte detsamma som extern replikering på en annan population, och en granskningsstudie är inte en klinisk prövning. Radiologimodeller har en lång historia av att prestera sämre på apparater, protokoll och patientgrupper de inte tränats på.

En sjukhuskorridor med medicinsk utrustning
Illustration: kod och vikter publiceras under Apache 2.0-licens. RDNE Stock project · pexels · Pexels License

Det assisterande resultatet — snabbare granskningar med högre sensitivitet — är rimligen mer intressant än den direkta jämförelsen, eftersom det beskriver hur en sådan modell faktiskt skulle användas. En radiolog som granskar med ett uppslag är ett annat kliniskt upplägg än en modell som granskar ensam, och det är det myndigheter är mer benägna att godkänna.

Vad som skiljer det här släppet

Största delen av den medicinska bildtolkningens AI-modeller är smala: en modell per organ eller per sjukdom. RADAR är byggd som en generalist över hela buken, vilket är svårare att träna och lättare att missbedöma, eftersom ett medelvärde över 146 fynd döljer hur den presterar på de ovanligaste av dem.

Varför licensen spelar roll

Apache 2.0 med publicerade vikter innebär att vilket sjukhus, nationellt vårdsystem eller konkurrerande laboratorium som helst kan ladda ned RADAR, köra den på sina egna bilder och pröva påståendena utan att be Alibaba om något. Det är den mest konsekvensrika delen av släppet: oberoende verifiering blir möjlig i stället för utlovad, och en kapabel diagnostisk modell hamnar hos vårdsystem som inte hade kunnat beställa en.

Nästa steg är extern utvärdering på populationer utanför träningsfördelningen. Tills den finns är det starkaste påståendet att en modell redovisade dessa resultat på de data författarna använde.