Qué se ha publicado
La Academia DAMO de Alibaba publicó el jueves en Science un modelo de imagen médica de propósito general llamado RADAR y liberó al mismo tiempo el código y los pesos en GitHub y Hugging Face con licencia Apache 2.0.
RADAR interpreta tomografías computarizadas de abdomen con contraste. Cubre 18 órganos e informa sobre 146 hallazgos clínicos distintos, entre ellos cánceres. DAMO lo describe como el primer modelo generalista de nivel experto para imagen médica: es la caracterización de la propia empresa, no una evaluación independiente.
Los resultados declarados
En casi 40.000 exploraciones reales, los investigadores declaran un área bajo la curva media de 0,913 sobre los 146 hallazgos. El AUC mide lo bien que una prueba separa los casos positivos de los negativos; 1,0 sería una discriminación perfecta.

En un estudio de lectura frente a 26 radiólogos de varios hospitales, la precisión media del modelo superó a la de 23 de ellos. Los investigadores también informan de que, cuando los radiólogos recibían las indicaciones del modelo, su sensibilidad subía en torno a un 10% y el tiempo de lectura bajaba más de un 30%.
El conjunto de entrenamiento fueron 424.911 exploraciones de TAC abdominal con contraste y más de 15 millones de pares imagen-texto con anotación anatómica.
Qué establecen y qué no estas cifras
Son cifras aportadas por el equipo que construyó el modelo, en un artículo con revisión por pares. La revisión por pares es un filtro relevante, pero no equivale a una replicación externa en otra población, y un estudio de lectura no es un ensayo clínico. Los modelos de radiología tienen un largo historial de rendir peor con equipos, protocolos y poblaciones de pacientes con los que no se entrenaron.

El resultado asistencial —lecturas más rápidas con mayor sensibilidad— es discutiblemente más interesante que la comparación directa, porque describe la forma en que realmente se usaría un modelo así. Un radiólogo que lee con una indicación es un arreglo clínico distinto de un modelo que lee solo, y es el que los reguladores están más dispuestos a autorizar.
Por qué importa la licencia
Apache 2.0 con pesos publicados significa que cualquier hospital, sistema sanitario nacional o laboratorio competidor puede descargar RADAR, ejecutarlo sobre sus propias imágenes y comprobar las afirmaciones sin pedir nada a Alibaba. Esa es la parte de más consecuencia: convierte la verificación independiente en algo posible y no solo prometido, y pone un modelo diagnóstico capaz en manos de sistemas sanitarios que no podrían encargar uno.
Lo siguiente es la evaluación externa en poblaciones fuera de la distribución de entrenamiento. Hasta que exista, lo máximo que puede afirmarse es que un modelo obtuvo estos resultados con los datos que usaron sus autores.