Artificial Analysis dobler skjulte testsett til 40 prosent i Intelligence Index v4.2
Sjekk hvilken indeksversjon et benchmark-tall stammer fra: Artificial Analysis flyttet 4. september 40 prosent av vekten over på private testsett.
Artificial Analysis oppdaterte 4. september 2026 Intelligence Index til versjon 4.2, åtte måneder etter at versjon 4 kom i januar. Andelen av indeksvekten som ligger i skjulte, tilbakeholdte testsett er doblet fra v4.1 og utgjør nå 40 prosent, ifølge selskapets egen changelog. Begrunnelsen er at private testsett reduserer laboratorienes mulighet til å tilpasse modellene til fasiten.
To evalueringer kommer inn. AA-Briefcase er Artificial Analysis' egen test av agentisk kunnskapsarbeid over flerukers prosjekter med mange sammenkoblede oppgaver og tusenvis av kildefiler, vurdert både mot rubrikk og parvis. GDP.pdf, laget av Surge AI, ber modellen resonnere over 100 PDF-dokumenter fordelt på 4 592 sider med tabeller, figurer, fotnoter og unntak, og krever at alle 1 275 ekspertskrevne delkriterier er innfridd før en oppgave telles som løst. Ut går GPQA Diamond, som selskapet regner som mettet.
Anthropics Claude Fable 5.1 leder indeksen, foran OpenAIs GPT-6 Astra, som ligger fire poeng over GPT-5.6 Sol. Meta er tredje høyest rangerte lab, fulgt av SpaceXAI, Moonshot/Kimi, Z.AI og Google. På GDP.pdf løser ingen modell mer enn en tredjedel av oppgavene fullt ut.
Rekkefølgen snur altså avhengig av hvilken deltest du ser på, og det er hele poenget med oppdateringen. For deg som velger modell etter offentlige tall betyr det to ting: et v4.2-tall kan ikke sammenlignes direkte med et v4.1-tall, og totalindeksen skjuler at Fable 5.1 og Astra bytter plass på lange dokumenter. Artificial Analysis oppgir samtidig at Astra bruker færre output-tokens enn nesten alle andre modeller nær intelligensfronten, og at Anthropic, OpenAI, Meta og Z.AI nå deler Pareto-fronten for kost per oppgave.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.