Hopp til hovedinnhold
Tilbake
Modell 3 min · Kilde: The Decoder

Opus 5 topper uavhengige tester, men hallusinasjonsraten er oppe i 50 prosent

KI Takeaway KI-generert · kan inneholde feil

Plasserer uavhengige evalueringer Claude Opus 5 øverst på Artificial Analysis' Intelligence Index med 61 poeng, samtidig som hallusinasjonsraten stiger til 50 prosent.

Anthropics eget lanseringsnotat lovet nær Fable 5-ytelse til lavere pris, målt med Anthropics egne kjøringer. Nå har tre uavhengige evalueringsmiljøer levert sine tall, gjengitt av The Decoder, og bildet er mer sammensatt. Artificial Analysis gir Opus 5 61 poeng på Intelligence Index, som slår sammen ni tester for kunnskapsarbeid, koding, vitenskapelig resonnering og faktanøyaktighet. Fable 5 lander på 60, GPT-5.6 Sol på 59, Kimi K3 på 57 og Opus 4.8 på 56. Artificial Analysis opplyser selv at de testet modellen sammen med Anthropic før den ble offentlig.

Epoch AI kommer til et annet svar med sin Capability Index: 159 til Opus 5 mot 161 til Fable 5. Ser du kun på programvareutvikling gjennom SWE-ECI, står de likt på 161, begge foran GPT-5.6 Terra og Opus 4.8. GPT-5.6 Sol leder begge kategoriene hos Epoch. Avstanden mellom toppmodellene avhenger altså av hvilken indeks du spør, ikke av at én modell har trukket fra.

Faktanøyaktighet er den tydelige svakheten. På AA-Omniscience, som måler hvor treffsikre modellens kunnskapspåstander er, forbedrer Opus 5 seg sju poeng fra Opus 4.8, men ligger fortsatt bak Fable 5. Det henger sammen med at modellen svarer oftere når den er usikker: hallusinasjonsraten går opp 14 poeng, til 50 prosent.

Det mest brukbare funnet for deg som setter effort-nivå selv er at «high» slår «max». Vals.ai kjørte Opus 5 gjennom alle fem resonneringsnivåer på Vibe Code Bench, og scoren klatrer fra 76,7 prosent på «low» til 82 på «medium» og 89,8 på «high», før den faller til 88,3 på «xhigh» og 88,4 på «max». Vals.ai forklarer fallet med at de høyeste nivåene produserer mer sammensatte løsninger som oftere inneholder feil, mens «high» gir enklere løsninger som treffer kravet. Terminal-Bench 2.1 viser samme mønster av en annen grunn: på «max» bruker modellen over 36 minutter og 103 gjennomkjøringer per oppgave, rundt 50 prosent lengre enn Opus 4.8, og rekker dermed færre forsøk innenfor tidsgrensen. Anthropic har selv satt «high» som standard i både API-et og Claude Code.

Prisbildet forklarer hvorfor nivåvalget betyr noe i praksis. En gjennomsnittlig Intelligence Index-oppgave koster 2,03 dollar med Opus 5 mot 2,75 med Fable 5 med fallback, men fortsatt mer enn 1,80 med Opus 4.8 og 1,53 med Sonnet 5. På kontoroppgave-benchmarken AA-Briefcase faller kostnaden per oppgave 20 prosent, fra 22,30 dollar for Fable 5 til 17,79 for Opus 5 på «max», mens «xhigh» koster 14,26 og «high» bare 10,41. Begge de billigere nivåene slår fortsatt Fable 5 på Elo-rangeringen. Token-prisen er uendret på 5 og 25 dollar per million, med cache-treff på 0,50.

Hva bør du gjøre?

  1. Sett effort til high som standard i stedet for max. Vals.ai måler 89,8 mot 88,4 prosent på Vibe Code Bench, og high koster under to tredjedeler per oppgave på AA-Briefcase.
  2. Legg inn kildekontroll hvis agenten din svarer på kunnskapsspørsmål. Raten på 50 prosent gjelder påstander modellen leverer selv om den er usikker.
  3. Regn på cache før du sammenligner pris. Cache-treff koster 0,50 dollar per million tokens mot 5 for ferske input, så en agent med stabil systemprompt får en annen regning enn benchmark-tallene antyder.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter