Hopp til hovedinnhold
Tilbake
Forskning 3 min · Kilde: Prime Intellect

Fable 5 tetter 81,7 prosent av gapet til nanoGPT-menneskerekorden

KI Takeaway KI-generert · kan inneholde feil

Måler 18 frontier-modeller mot menneskerekorden på nanoGPT-speedrunen, der Fable 5 tetter 81,7 prosent av gapet, men bruker 8,7 døgn agenttid på det.

Prime Intellect har lagt ut resultatene fra 153 autonome kjøringer på nanoGPT-speedrunen, en optimaliseringsoppgave der målet er å nå et gitt treningsresultat på færrest mulig treningssteg. Baselinen ligger på 3 290 steg, menneskerekorden på 2 600. Fable 5, kjørt gjennom kodeagenten claude-code, endte på 2 726 steg. Det er 81,7 prosent av veien fra baseline til rekord. Opus 5 kom til 2 920 steg (53,6 prosent), Kimi K3 til 2 930 (52,2 prosent) og GPT-5.6 Sol til 3 042 (35,9 prosent).

Tabellen er lettere å feiltolke enn den ser ut. Kjøringene har svært ulik lengde: Fable 5 fikk 8,7 døgn agenttid, mens Opus 5-kjøringen ble avsluttet etter 2,9. Prime Intellect har derfor lagt inn en bryter som kutter alle kjøringene ved samme budsjett. Ved 24 agenttimer står Fable 5 på 3 010 steg og Opus 5 på 3 045. Avstanden er 35 steg, ikke 194. Forspranget på 28 prosentpoeng i totaltabellen er i stor grad et spørsmål om hvem som fikk jobbe lengst.

Elie Bakouch, som skrev Prime Intellects forskningsnotat «Measuring Autonomous AI Research», er tydelig på hva agentene ikke fikk til:

«Ingen av kjøringene produserte en fundamentalt ny metode. Ingrediensene som vant, ligner alle på noe som allerede finnes i litteraturen.» — Elie Bakouch, Prime Intellect

Notatet oppgir at hvert forsøk kjørte på åtte H200-kort, og at agentene denne gangen ikke fikk tilgang til internett i det hele tatt. Begrunnelsen er en observasjon fra tidligere runder: med nettilgang låste agentene seg til eksisterende pull requests i speedrun-repoet i stedet for å prøve egne ideer.

Spredningen nedover i tabellen er stor. Sonnet 5 tetter 26,8 prosent av gapet, DeepSeek V4 Pro 12,3 prosent, og GLM 5.3 satte ingen gyldig rekord i det hele tatt. Det er samme oppgave, samme kodebase, og i flere tilfeller samme kodeagent. Forskjellen ligger i hvilke eksperimenter modellen velger, hvor nøye den gjennomfører dem, og om den klarer å lese støyete resultater riktig.

For deg som setter en kodeagent til å jobbe alene over tid, er budsjettbryteren den mest brukbare delen av datasettet. En agent som får åtte døgn finner som regel noe. Spørsmålet er hva time nummer 200 gir deg sammenlignet med time nummer 24, og der flater kurvene ut for alle modellene i feltet. Prime Intellect har publisert 41 fullstendige agentspor med verktøykall, subagenter og notatblokker, så det er mulig å lese hvordan en kjøring faktisk brukte tiden sin i stedet for å gjette.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter