Hopp til hovedinnhold
Tilbake
Modell 2 min · Kilde: ARC Prize

Opus 5 topper ARC-AGI-3 med 30,2 prosent, mot 97,5 på ARC-AGI-1

KI Takeaway KI-generert · kan inneholde feil

Topper ARC-AGI-3 med 30,2 prosent, et sprang som samtidig blottlegger avstanden ned fra 97,5 prosent på ARC-AGI-1.

ARC Prize rangerer Claude Opus 5 som den best presterende modellen på ARC-AGI-3 per 24. juli 2026, med 30,2 prosent på resonneringsnivået «High». Modellen løste fem miljøer i Public Demo-settet som ingen modell hadde klart før. Settet består av 25 miljøer.

ARC-AGI-3 måler noe annet enn de statiske rutenettoppgavene folk forbinder med ARC. Agenten slippes inn i et ukjent spill uten instruksjoner, må finne ut hva målet er underveis, bygge en modell av hvordan miljøet oppfører seg, og lære mens den spiller. ARC Prize beskriver det som å måle intelligens over tid: planleggingshorisont, hvor godt minnet komprimeres, og evnen til å oppdatere antakelser når ny informasjon dukker opp.

«Et resultat på 100 prosent betyr at KI-agenter slår hvert spill like effektivt som mennesker.» — ARC Prize

På de eldre settene er bildet et annet. Med maksimal resonneringsinnsats treffer Opus 5 97,5 prosent på ARC-AGI-1 og 90,4 prosent på den semi-private delen av ARC-AGI-2. ARC Prize kaller det konkurransedyktig med tidligere ledere, men til noe høyere kostnad. ARC-AGI-3 ble bare kjørt på «High», fordi testvinduet var for kort til å rekke maksnivået.

Nøkkeltall
97,5 %
ARC-AGI-1, maksimal resonneringsinnsats
90,4 %
ARC-AGI-2 semi-private, maksimal resonneringsinnsats
30,2 %
ARC-AGI-3, kjørt på «High»

For deg som bygger agenter er avstanden mellom 97,5 og 30,2 mer interessant enn rekorden i seg selv. Oppgavene der modellen svarer én gang på et ferdig formulert problem nærmer seg metning. Oppgavene der den må handle over tid i et miljø den aldri har sett, uten fasit underveis, er den ikke i nærheten av å løse. Det er den andre kategorien som ligner mest på en agent som skal rydde i en kodebase eller drive en flertrinnsprosess helt til ende.

Rekorden er derfor like mye et mål på hvor mye av agentproblemet som fortsatt står ubesvart.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter