Hva som er lovet

Biohub, forskningsstiftelsen som støttes av Mark Zuckerberg og Priscilla Chan, meldte 7. oktober at initiativet for virtuell biologi har nådd 1,8 milliarder dollar i forpliktelser, regnet som penger, data, beregning og måleteknologi snarere enn kontanter alene.

USAs energidepartement bidrar med mer enn 500 millioner dollar over fem år til laboratoriemåling, modellering og beregning, gjennom sitt Genesis-oppdrag. Helseinstituttene NIH tilfører ikke nye penger, men samordner datasett og arkiver bygget med mer enn 500 millioner dollar i tidligere føderale investeringer, som Biohub skal standardisere for KI-trening.

Biohubs egen grunnforpliktelse fra april er 500 millioner dollar: rundt 400 millioner til ny måle- og ingeniørteknologi og 100 millioner til forskning utenfor egen organisasjon. Google DeepMind, Meta og legemiddelselskapet Isomorphic Labs bidrar til sammen med 300 millioner.

Målet er en celle man kan kjøre

Målet initiativet stadig vender tilbake til, er en modell som forutsier hvordan en celle svarer på et inngrep — et legemiddel, en genredigering, en miljøendring — i langt flere celletyper og tilstander enn noen har målt.

Et oransje stativ med korkede prøverør på en laboratoriebenk
Biohub legger rundt 400 millioner dollar i ny måleteknologi. Illustrasjonsbilde. Jess Loiterton · pexels · Pexels License

Alex Rives, Biohubs vitenskapssjef, kaller det en av de viktigste utfordringene for vitenskapens neste epoke. Max Jaderberg, president i Isomorphic Labs, beskrev selskapets deltakelse som et bidrag til å bygge et stort multimodalt datagrunnlag. Darío Gil, energidepartementets understatssekretær for vitenskap, kalte ordningen en ny standard for åpen vitenskap.

Hvorfor pengene går til måling

Det interessante med denne bruken er hvor den peker. Rundt 400 millioner dollar av Biohubs egen forpliktelse finansierer instrumenter — teknologi som utvider hva biologer kan måle, i større skala, raskere og mer nøyaktig — ikke modelltrening.

Det er en konkret påstand om hvor flaskehalsen sitter. Språkmodellene hadde nettet; proteinstrukturprediksjon hadde Protein Data Bank. En modell for cellerespons mangler et tilsvarende korpus, fordi de fleste inngrep i de fleste celletyper aldri er gjennomført. Stemmer diagnosen, følger beregningen etter dataene i stedet for å gå foran.

Nvidia bidrar med akselerert beregning og kompetanse, uten oppgitt tall. Som partnere nevnes også Renaissance Philanthropy, Allen Institute, Broad Institute, Gladstone Institutes, Human Cell Atlas, Human Protein Atlas og Wellcome Sanger Institute.

Rader av datamaskinskap i et forskningsanlegg
Energidepartementet bidrar med beregning gjennom Genesis-oppdraget. Illustrasjonsbilde. Brett Sayles · pexels · Pexels License

Spørsmålet om tilgang

Biohub beskriver resultatet som åpent for forskersamfunnet, med felles standarder, felles identifikatorer og ett inngangspunkt. Verken lisens eller detaljerte tilgangsvilkår oppgis.

The Decoder melder, med henvisning til Reuters, om et vilkår kunngjøringen ikke nevner: kommersielle finansiører ville få ett års enerett til dataene de har betalt for før de blir offentlige, mens offentlig finansiert arbeid ikke bærer en slik begrensning. Samme melding plasserer det første datasettet omtrent ett år fram i tid.

Hva man skal følge

Tre ting vil vise om dette er en dataallmenning eller et konsortium. Om lisensen, når den publiseres, tillater kommersiell gjenbruk. Om eneretten på ett år gjelder per datasett eller per finansiør. Og om de standardiserte NIH-arkivene kommer i en form et laboratorium utenfor partnerlisten faktisk kan trene på, som er forskjellen mellom åpne data og data som bare er tilgjengelige.