Nemotron-3-Ultra-CC slo beste menneske i IOI 2026 med 535,4 av 600 poeng
Scoret 535,4 av 600 under IOI 2026 og passerte for første gang den beste menneskelige deltakeren på et IOI-oppgavesett.
Forskjellen mellom å nå gullgrensen og å slå det beste mennesket er hele poenget i artikkelen Aleksander Ficek, Sean Narenthiran, Mehrzad Samadi, Somshubra Majumdar og Boris Ginsburg la ut på arXiv 2. september 2026. Gullgrensen i IOI 2026 lå på 361,12 poeng. Beste menneskelige deltaker fikk 498,27. Systemet deres, bygget rundt Nemotron-3-Ultra-CC, endte på 535,4, og ble evaluert prospektivt under selve konkurransen med samme tidsbegrensning, samme internettilgang og samme innsendingsregler som deltakerne.
Oppskriften er ikke én stor modell, men en kjede. 22 000 kuraterte oppgaver ligger i bunnen. Nemotron-3-Nano-CC på 30B-A3B ble trent med både supervised fine-tuning og forsterkningslæring, mens Ultra-CC på 550B-A55B fikk fine-tuning alene. Oppå det ligger GenCorrect, en test-time-strategi som genererer flere ulike løsninger, evaluerer dem og forbedrer dem i runder.
Nano-tallene viser hvor mye hvert ledd bidrar med. På IOI 2025 gikk den lille modellen fra 130 poeng før post-training til 291 etter, og videre til 468 med GenCorrect. Gullgrensen der var 438,3. En modell på 30B med 3B aktive parametere kom altså over gullgrensen fordi den fikk lov til å prøve, måle og rette seg selv.
For deg som bygger med kodeagenter er den siste observasjonen viktigst. Mønsteret i GenCorrect, altså å generere flere kandidater, kjøre dem mot tester og så velge og forfine, er nøyaktig den løkka du selv kan legge rundt en mindre modell uten å bytte til en større. Artikkelen kvantifiserer gevinsten på et hardt målt oppgavesett, og spranget fra 291 til 468 er større enn det de fleste modellbyttene gir.
Forbeholdet er at hverken vekter eller kode er nevnt i sammendraget, og at konkurranseoppsettet er spesialbygget for IOI. Resultatet sier hva som er mulig med et spesialisert system under konkurransevilkår, ikke hva du får ut av en generell modell på din egen kodebase.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.