O que foi comprometido
A Biohub, a organização de investigação sem fins lucrativos apoiada por Mark Zuckerberg e Priscilla Chan, anunciou a 7 de outubro que a sua Iniciativa de Biologia Virtual atingiu 1,8 mil milhões de dólares em compromissos, contando dinheiro, dados, computação e tecnologia de medição e não apenas numerário.
O Departamento de Energia dos Estados Unidos entra com mais de 500 milhões ao longo de cinco anos para medição laboratorial, modelação e computação, através da sua Missão Génesis. Os Institutos Nacionais de Saúde não acrescentam dinheiro novo, mas coordenam conjuntos de dados e repositórios construídos com mais de 500 milhões de investimento federal anterior, que a Biohub vai normalizar para treino de IA.
O compromisso fundador da Biohub, assumido em abril, é de 500 milhões: cerca de 400 milhões para nova tecnologia de medição e engenharia e 100 milhões para investigação fora das suas paredes. A Google DeepMind, a Meta e a empresa de descoberta de fármacos Isomorphic Labs contribuem em conjunto com 300 milhões.
O objetivo é uma célula que se possa executar
O alvo a que a iniciativa regressa é um modelo que preveja como uma célula responde a uma intervenção — um fármaco, uma edição genética, uma mudança de ambiente — em muito mais tipos celulares e condições do que alguém mediu.

Alex Rives, diretor de ciência da Biohub, chama-lhe um dos desafios mais importantes da próxima era da ciência. Max Jaderberg, presidente da Isomorphic Labs, apresentou a participação da empresa como um contributo para uma grande base de dados multimodal. Darío Gil, subsecretário para a ciência do Departamento de Energia, descreveu o acordo como um novo padrão para a ciência aberta.
Porque o dinheiro vai para a medição
O interessante nesta despesa é a direção que toma. Cerca de 400 milhões do compromisso da própria Biohub financiam instrumentos — tecnologias que alargam o que os biólogos conseguem medir, com mais escala, velocidade e precisão — e não treino de modelos.
Isso é uma afirmação concreta sobre onde está o estrangulamento. Os modelos de linguagem tinham a web; a previsão de estrutura de proteínas tinha o Protein Data Bank. Um modelo de resposta celular não tem corpus equivalente, porque a maioria das intervenções na maioria dos tipos celulares nunca foi realizada. Se o diagnóstico estiver certo, a computação segue os dados em vez de os anteceder.
A Nvidia contribui com computação acelerada e conhecimento, sem valor associado. São também nomeados como parceiros a Renaissance Philanthropy, o Allen Institute, o Broad Institute, os Gladstone Institutes, o Human Cell Atlas, o Human Protein Atlas e o Wellcome Sanger Institute.

A questão do acesso
A Biohub descreve o resultado como aberto à comunidade científica, com normas partilhadas, identificadores comuns e um único ponto de acesso. Não indica licença nem condições de acesso detalhadas.
O The Decoder, citando a Reuters, relata uma condição que o anúncio não menciona: os financiadores comerciais teriam um ano de acesso exclusivo aos dados que pagaram antes de se tornarem públicos, enquanto o trabalho financiado por fundos públicos não leva essa restrição. O mesmo relato coloca o primeiro conjunto de dados a cerca de um ano de distância.
O que vigiar
Três coisas mostrarão se isto é um bem comum de dados ou um consórcio. Se a licença, quando publicada, permite reutilização comercial. Se a exclusividade de um ano se aplica por conjunto de dados ou por financiador. E se os repositórios normalizados dos NIH chegam numa forma em que um laboratório fora da lista de parceiros possa de facto treinar, que é a diferença entre dados abertos e dados apenas disponíveis.