Um repositório, não um artigo

A OpenAI publicou a 6 de outubro um catálogo de resultados matemáticos produzidos por aquilo que chama de modelo de fronteira interno, e colocou tudo num repositório do GitHub em vez de o submeter a revistas. O catálogo tem 722 manuscritos organizados em 372 famílias de resultados, em que cada família agrupa um resultado principal com argumentos complementares, consequências ou provas alternativas.

A empresa afirma que o trabalho surgiu do desenvolvimento do modelo e não de um programa de investigação próprio. “Como parte do desenvolvimento do modelo, avaliamos os nossos modelos em problemas de investigação abertos”, diz o ficheiro de apresentação do repositório. “Ampliámos estas avaliações depois de o desempenho nas nossas avaliações matemáticas existentes ter saturado.”

O que os números dizem sobre a computação

A OpenAI revelou mais sobre o método do que é habitual. Ao longo da avaliação foram propostos ao modelo aproximadamente 4.000 problemas. O resultado publicado médio consumiu o equivalente a cerca de três horas de computação de raciocínio do ChatGPT Pro. Agregar a saída em famílias e manuscritos, exigindo aquilo que a OpenAI chama um nível adequado de significância, produziu o número de 722.

Dois itens foram tratados de outra forma. O trabalho sobre uma região livre de zeros da função zeta de Riemann e uma prova da conjetura de Hodge para variedades abelianas com multiplicação complexa ficaram fora do procedimento fixo, e a OpenAI diz que a redação do resultado sobre a função zeta — relativo à região onde a parte real de s excede 11/12 — foi editada por uma pessoa para melhorar a legibilidade.

Uma pequena pilha de folhas de papel branco em branco sobre um tecido de linho
Muitos manuscritos têm formalizações em Lean; a OpenAI diz que não todos. Imagem ilustrativa. https://kaboompics.com/ · pexels · Pexels License

As ressalvas estão no repositório, não no anúncio

A coleção inclui resultados em diferentes fases de verificação. Muitos manuscritos trazem formalizações em Lean, uma linguagem que permite a um computador verificar uma prova, mas não todos. A OpenAI afirma sem rodeios que “alguns dos resultados não formalizados podem ter problemas” e diz que corrigirá rapidamente os que encontrar, acrescentando formalizações ao repositório à medida que as obtiver.

Esse enquadramento importa porque é a própria empresa, e não um revisor, que decide o que é suficientemente significativo para ser publicado. A OpenAI diz ter consultado o Grupo Consultivo independente sobre Matemática e Inteligência Artificial do Institute for Advanced Study sobre boas práticas, e ter-se apoiado nos seus conselhos e recomendações públicas para decidir como divulgar os resultados.

Dez resumos de raciocínio

A par dos manuscritos, a OpenAI divulgou resumos abreviados do raciocínio do modelo para dez resultados, entre eles o expoente de irracionalidade de pi, as conjeturas de Mahler simétrica e geral, limites quase polinomiais para progressões aritméticas, a conjetura de finitude direta de Kaplansky em característica dois e o sistema relativista de Vlasov-Maxwell em três dimensões. Publicou também instruções de citação por manuscrito e disse que preservará o histórico de versões, registando correções como novas versões.

Uma secretária com um manual de matemática, compasso, régua, calculadora e contas feitas à mão
A empresa diz que cada resultado publicado usou cerca de três horas de computação do ChatGPT Pro. Imagem ilustrativa. MART PRODUCTION · pexels · Pexels License

O que acompanhar

O modelo que produziu tudo isto não está disponível. A OpenAI diz estar “a trabalhar para lançar de forma responsável o modelo que produziu estes resultados” e que vai financiar uma série de workshops, conferências e programas especiais sobre a compreensão de grandes resultados produzidos por IA, com detalhes a anunciar.

O teste prático é agora a biblioteca Lean. As provas formalizadas podem ser verificadas por uma máquina; os manuscritos não formalizados têm de ser lidos por matemáticos, e 722 são muita leitura. A velocidade a que o catálogo de formalizações se encher — e quantos resultados não formalizados sobreviverem ao contacto com a disciplina — dirá mais do que a contagem do título.