Hopp til hovedinnhold
Tilbake
Llm 3 min · Kilde: The Decoder

Epoch og Artificial Analysis er uenige om GPT-6 Astra, men ARC-AGI-3 flytter Chollets anslag

KI Takeaway KI-generert · kan inneholde feil

Ikke stol på én sammenstilt totalscore for GPT-6 Astra: Epoch AI setter modellen først, Artificial Analysis måler null framgang mot forgjengeren.

Epoch AI og Artificial Analysis ruller begge dusinvis av enkelttester sammen til én totalscore, og de lander på stikk motsatt konklusjon, skriver The Decoder. Epoch AI kombinerer over 50 benchmarks og plasserer GPT-6 Astra alene på topp med 169 poeng foran 267 modeller. Artificial Analysis, som måler kunnskap, koding og tekstforståelse, gir modellen 61 poeng, nøyaktig likt med forgjengeren GPT-5.6 Sol og bak Claude Fable 5.1 på 66.

Prisbildet spriker på samme måte, avhengig av hvem du sammenligner med. OpenAI tar to og en halv ganger så mye per enhet prosessert tekst som for Sol, slik at en oppgave havner rundt 75 prosent høyere. Måler du mot Anthropic i stedet, snur det: på kodeoppgaver treffer Astra samme score som Claude Fable 5 hos Artificial Analysis, til under halve prisen per oppgave, fordi modellen bruker en tredjedel av regnestegene til Sol og en femtedel av Opus 5. Hallusinasjonsraten på AA-Omniscience faller fra 92 til 51 prosent, mens modellen mister rundt 80 Elo-poeng på GDPval-AA v2 og svekkes på lang kontekst.

Det klareste hoppet kommer på ARC-AGI-3, testen som slipper en modell inn i ukjente spillverdener uten å forklare regler eller mål. Astra tar 62,7 prosent på ARC Prize sitt eget kjøreoppsett, til en testkostnad på rundt 26 000 dollar. Tallet på 99,9 prosent OpenAI selv har oppgitt, kom under andre betingelser, med selskapets eget oppsett som holder på resonneringskjeder mellom forespørsler. ARC Prize målte de kjøringene til 3,66 ganger raskere og 49 prosent færre tokens over 167 spillpar begge oppsett løste, og mener bare det lavere tallet gir en rettferdig sammenligning mellom leverandører.

Nøkkeltall
62,7 %
GPT-6 Astra på ARC-AGI-3, målt på ARC Prize sitt eget oppsett
30,16 %
Claude Opus 5 på samme test
7,78 %
GPT-5.6 Sol, forgjengeren til Astra

Forholdet mellom tenketid og regning er snudd på hodet. På standardoppsettet faller kostnaden fra 49 791 dollar uten resonnering til 26 098 dollar på maks, mens scoren stiger fra 35,2 til 62,7 prosent, fordi Astra løser spillene i færre trekk og dermed færre modellkall. Én verdi bryter mønsteret: nivået «low» lander på 17,5 prosent, dårligere enn å kjøre helt uten resonnering.

Mest interessant er ikke scoren, men effektiviteten. ARC Prize lot rundt 500 testpersoner spille før lanseringen og noterte medianen for antall trekk blant dem som løste hvert nivå. På kjøringen med OpenAIs eget oppsett klarte Astra 96 prosent av nivåene på færre trekk enn den medianen, i snitt på litt over halvparten. Underveis fant modellen opp sin egen algebralignende stenografi for objekter, koordinater og planer.

«Svært effektiv, fortløpende symbolsk verdensmodellering for hvert spill og hvert nivå» — François Chollet, medgrunnlegger av ARC Prize

Chollet er tydelig på at dette ikke er bevis på generell kunstig intelligens. «Alt vi vet om systemet så langt, er benchmarkscorene», skriver han, og påpeker at ARC-AGI-3 tester riktige egenskaper i liten skala, på tidsskalaer langt kortere enn virkelige oppgaver. Da testen kom for rundt et halvt år siden, anslo han at metning lå «omtrent et år» unna. Astra kom omtrent dobbelt så fort. Spurt om AGI-anslaget hans for 2030 fortsatt holdt, svarte han «Før, fordi framgangen skjer raskere enn jeg forventet». ARC-AGI-4 er planlagt i første kvartal 2027.

For deg som velger modell er poenget at Astras fortrinn er smalt og kostnadsdrevet: matte, kunnskap og utforskende oppgaver, ikke koding, der Epoch så langt bare har registrert én score for modellen.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter