Ett kodförråd, inte en artikel

OpenAI publicerade den 6 oktober en katalog med matematiska resultat framtagna av vad företaget kallar en intern frontmodell, och lade alltihop i ett GitHub-förråd i stället för att skicka in det till tidskrifter. Katalogen rymmer 722 manuskript ordnade i 372 resultatfamiljer, där en familj samlar ett huvudresultat med följdargument, konsekvenser eller alternativa bevis.

Företaget uppger att arbetet kom ur modellutvecklingen och inte ur ett eget forskningsprogram. “Som en del av modellutvecklingen utvärderar vi våra modeller på öppna forskningsproblem”, står det i förrådets introduktionsfil. “Vi utökade dessa utvärderingar efter att prestandan på våra befintliga matematiska utvärderingar mättats.”

Vad siffrorna säger om beräkningen

OpenAI redovisade mer om metoden än vanligt. Under utvärderingen ställdes omkring 4 000 problem till modellen. Det genomsnittliga publicerade resultatet krävde motsvarande ungefär tre timmars resonemangsberäkning i ChatGPT Pro. Att samla utdata i familjer och manuskript, och kräva vad OpenAI kallar en lämplig nivå av betydelse, gav talet 722.

Två poster behandlades annorlunda. Arbetet med en nollfri region för Riemanns zetafunktion och ett bevis för Hodges förmodan för abelska varieteter med komplex multiplikation föll utanför det fasta förfarandet, och OpenAI uppger att texten om zetaresultatet — som gäller området där realdelen av s överstiger 11/12 — redigerades av en människa för läsbarhetens skull.

En liten trave tomma vita pappersark på ett linnetyg
Många manuskript har Lean-formaliseringar; OpenAI uppger att inte alla har det. Illustrativ bild. https://kaboompics.com/ · pexels · Pexels License

Förbehållen står i förrådet, inte i blogginlägget

Samlingen innehåller resultat i olika verifieringsstadier. Många manuskript har formaliseringar i Lean, ett språk som låter en dator kontrollera ett bevis, men inte alla. OpenAI skriver rakt ut att “några av de oformaliserade resultaten kan ha problem” och säger att de rättas snabbt när de hittas, med formaliseringar som läggs till i förrådet löpande.

Den inramningen spelar roll, eftersom det är företaget självt och inte en granskare som avgör vad som är tillräckligt betydelsefullt för att publiceras. OpenAI uppger att man rådgjort med den oberoende rådgivande gruppen för matematik och artificiell intelligens vid Institute for Advanced Study om god praxis, och att man byggt på gruppens råd och offentliga rekommendationer när man bestämde hur resultaten skulle släppas.

Tio resonemangssammanfattningar

Vid sidan av manuskripten släppte OpenAI förkortade sammanfattningar av modellens resonemang för tio resultat, bland dem irrationalitetsexponenten för pi, de symmetriska och allmänna Mahler-förmodandena, kvasipolynomiella gränser för aritmetiska följder, Kaplanskys förmodan om direkt ändlighet i karakteristik två och det tredimensionella relativistiska Vlasov-Maxwell-systemet. Företaget publicerade också citeringsanvisningar per manuskript och sade att släpphistoriken bevaras, med rättelser registrerade som nya versioner.

Ett skrivbord med matematikbok, passare, linjal, miniräknare och handskrivna uträkningar
Företaget uppger att varje publicerat resultat krävde cirka tre timmars ChatGPT Pro-beräkning. Illustrativ bild. MART PRODUCTION · pexels · Pexels License

Vad som är värt att följa

Modellen som tog fram allt detta är inte tillgänglig. OpenAI säger att man “arbetar för att på ett ansvarsfullt sätt släppa modellen som tog fram dessa resultat” och att man kommer att finansiera en rad workshoppar, konferenser och särskilda program om att förstå stora resultat framtagna av AI, med detaljer senare.

Det praktiska provet är nu Lean-biblioteket. Formaliserade bevis kan kontrolleras maskinellt av vem som helst; oformaliserade manuskript måste läsas av matematiker, och 722 är mycket läsning. Hur fort formaliseringskatalogen fylls — och hur många oformaliserade resultat som klarar kontakten med fältet — säger mer än antalet i rubriken.