Ett preprint publicerat på arXiv den 2 september hävdar det första AI-systemet som slår den högst rankade mänskliga deltagaren på en problemuppsättning från Internationella informatikolympiaden.

Siffrorna

Vid IOI 2026 uppger författarna att deras tävlingsspecifika system fick 535,4 poäng av 600, mot en guldgräns på 361,12 och ett högsta mänskligt resultat på 498,27.

Mot 2025 års problemuppsättning gick den mindre av två modeller — Nemotron-3-Nano-CC, 30 miljarder parametrar med 3 miljarder aktiva — från 130 poäng till 468 när författarna tillämpade en inferensstrategi de kallar GenCorrect. Guldgränsen det året var 438,3. Den större Nemotron-3-Ultra-CC, 550 miljarder med 55 miljarder aktiva, fick 502.

En whiteboard täckt av matematiska ekvationer.
GenCorrect appliceras vid inferens och inte under träning, och står för merparten av den mindre modellens förbättring. cottonbro studio · pexels · Pexels License

Hur det byggdes

Pipelinen kombinerar kurerade problem, syntetiska resonemangsspår, övervakad finjustering och förstärkningsinlärning över en uppsättning på 22 000 kurerade problem. GenCorrect appliceras vid inferens och inte under träningen, och det är därifrån merparten av Nano-modellens förbättring kommer: 130 till 468 är inte en bättre modell, det är ett bättre sätt att använda samma.

Reservationerna arbetet självt bär

Det här är ett preprint. Det är inte peer-granskat och resultaten har inte reproducerats oberoende.

IOI 2026-siffran kommer från vad författarna beskriver som ett tävlingsspecifikt system snarare än en generell modell, vilket gör jämförelsen med en mänsklig deltagare mindre direkt än rubriken antyder. En tävlande skriver ett prov under fasta villkor; ett system trimmat för det provet är ett annat slags deltagare.

En person som skriver på en laptop vid ett skrivbord sent på kvällen.
Arbetet är ett preprint: inte peer-granskat och inte oberoende reproducerat. Faye Tsui · pexels · Pexels License

Vad det faktiskt säger

Att en modell med 30 miljarder parametrar och 3 miljarder aktiva kan pressas förbi en guldgräns enbart med inferensteknik är det mer hållbara resultatet, och det som minst beror på hur den mänskliga jämförelsen ramas in.

Att hålla ögonen på

Om IOI självt kommenterar. Tävlingsprogrammering har hittills hanterat AI-deltagare informellt, och ett påstående om att ha slagit den bästa människan är den sortens sak som tvingar fram en regel.