Ett preprint publicerat på arXiv den 2 september hävdar det första AI-systemet som slår den högst rankade mänskliga deltagaren på en problemuppsättning från Internationella informatikolympiaden.
Siffrorna
Vid IOI 2026 uppger författarna att deras tävlingsspecifika system fick 535,4 poäng av 600, mot en guldgräns på 361,12 och ett högsta mänskligt resultat på 498,27.
Mot 2025 års problemuppsättning gick den mindre av två modeller — Nemotron-3-Nano-CC, 30 miljarder parametrar med 3 miljarder aktiva — från 130 poäng till 468 när författarna tillämpade en inferensstrategi de kallar GenCorrect. Guldgränsen det året var 438,3. Den större Nemotron-3-Ultra-CC, 550 miljarder med 55 miljarder aktiva, fick 502.

Hur det byggdes
Pipelinen kombinerar kurerade problem, syntetiska resonemangsspår, övervakad finjustering och förstärkningsinlärning över en uppsättning på 22 000 kurerade problem. GenCorrect appliceras vid inferens och inte under träningen, och det är därifrån merparten av Nano-modellens förbättring kommer: 130 till 468 är inte en bättre modell, det är ett bättre sätt att använda samma.
Reservationerna arbetet självt bär
Det här är ett preprint. Det är inte peer-granskat och resultaten har inte reproducerats oberoende.
IOI 2026-siffran kommer från vad författarna beskriver som ett tävlingsspecifikt system snarare än en generell modell, vilket gör jämförelsen med en mänsklig deltagare mindre direkt än rubriken antyder. En tävlande skriver ett prov under fasta villkor; ett system trimmat för det provet är ett annat slags deltagare.

Vad det faktiskt säger
Att en modell med 30 miljarder parametrar och 3 miljarder aktiva kan pressas förbi en guldgräns enbart med inferensteknik är det mer hållbara resultatet, och det som minst beror på hur den mänskliga jämförelsen ramas in.
Att hålla ögonen på
Om IOI självt kommenterar. Tävlingsprogrammering har hittills hanterat AI-deltagare informellt, och ett påstående om att ha slagit den bästa människan är den sortens sak som tvingar fram en regel.