Ce qui a été engagé

Biohub, l’organisme de recherche à but non lucratif soutenu par Mark Zuckerberg et Priscilla Chan, a annoncé le 7 octobre que son Initiative de biologie virtuelle atteint 1,8 milliard de dollars d’engagements, en comptant l’argent, les données, le calcul et les technologies de mesure, et non le seul numéraire.

Le département américain de l’Énergie apporte plus de 500 millions sur cinq ans pour la mesure en laboratoire, la modélisation et le calcul, via sa mission Genesis. Les Instituts nationaux de la santé n’ajoutent pas d’argent neuf mais coordonnent des jeux de données et des dépôts bâtis avec plus de 500 millions d’investissements fédéraux antérieurs, que Biohub normalisera pour l’entraînement d’IA.

L’engagement fondateur de Biohub, pris en avril, est de 500 millions : environ 400 millions pour de nouvelles technologies de mesure et d’ingénierie, et 100 millions pour de la recherche hors de ses murs. Google DeepMind, Meta et la société de découverte de médicaments Isomorphic Labs apportent ensemble 300 millions.

L’objectif est une cellule que l’on peut exécuter

La cible sur laquelle l’initiative revient sans cesse est un modèle qui prédit la réaction d’une cellule à une intervention — un médicament, une édition génétique, un changement d’environnement — pour bien plus de types cellulaires et de conditions que ce qui a été mesuré.

Un portoir orange de tubes d'échantillons bouchés sur une paillasse
Biohub consacre environ 400 millions à de nouvelles technologies de mesure. Image d'illustration. Jess Loiterton · pexels · Pexels License

Alex Rives, directeur scientifique de Biohub, y voit l’un des défis les plus importants de la prochaine ère de la science. Max Jaderberg, président d’Isomorphic Labs, a présenté la participation de son entreprise comme une contribution à une vaste base de données multimodale. Darío Gil, sous-secrétaire à la science du département de l’Énergie, a décrit le montage comme une nouvelle norme pour la science ouverte.

Pourquoi l’argent va à la mesure

Ce qui est intéressant dans cette dépense, c’est sa direction. Environ 400 millions de l’engagement propre de Biohub financent des instruments — des technologies qui élargissent ce que les biologistes peuvent mesurer, à plus grande échelle, plus vite et plus précisément — et non l’entraînement de modèles.

C’est une affirmation précise sur l’emplacement du goulot d’étranglement. Les modèles de langage avaient le web ; la prédiction de structure des protéines avait la Protein Data Bank. Un modèle de réponse cellulaire n’a pas de corpus équivalent, parce que la plupart des interventions sur la plupart des types cellulaires n’ont jamais été réalisées. Si le diagnostic est juste, le calcul suit les données au lieu de les précéder.

Nvidia apporte du calcul accéléré et de l’expertise, sans chiffre associé. Sont aussi cités comme partenaires Renaissance Philanthropy, l’Allen Institute, le Broad Institute, les Gladstone Institutes, le Human Cell Atlas, le Human Protein Atlas et le Wellcome Sanger Institute.

Rangées de baies informatiques dans un centre de recherche
Le département de l'Énergie apporte du calcul via sa mission Genesis. Image d'illustration. Brett Sayles · pexels · Pexels License

La question de l’accès

Biohub décrit le résultat comme ouvert à la communauté de recherche, avec des normes partagées, des identifiants communs et un point d’accès unique. Ni licence ni conditions d’accès détaillées ne sont indiquées.

The Decoder, citant Reuters, rapporte une condition que l’annonce ne mentionne pas : les financeurs commerciaux disposeraient d’un an d’accès exclusif aux données qu’ils ont payées avant leur publication, tandis que les travaux financés sur fonds publics ne portent pas cette restriction. Le même rapport situe le premier jeu de données à environ un an.

Ce qu’il faut suivre

Trois points diront s’il s’agit d’un commun de données ou d’un consortium. Si la licence, une fois publiée, autorise la réutilisation commerciale. Si l’exclusivité d’un an s’applique par jeu de données ou par financeur. Et si les dépôts normalisés du NIH arrivent sous une forme sur laquelle un laboratoire extérieur à la liste des partenaires peut réellement entraîner un modèle, ce qui sépare les données ouvertes des données simplement disponibles.