Hopp til hovedinnhold

Onsdag 7. oktober

 Tilbake Modeller 3 min 00.24

Grok 4.5: åtte ganger billigere enn Fable 5, 17 poeng svakere på DeepSWE

torsdag 9. juli · KI-generert · Kilde: The Decoder

Innholdet er KI-generert og kan inneholde feil. Sjekk originalkilden.

Underbyr Grok 4.5 hele frontier-feltet på pris, med et ytelsestap som er mindre enn prisforskjellen skulle tilsi.

På Terminal Bench 2.1 skiller ett prosentpoeng Grok 4.5 fra Anthropics Fable 5. På pris skiller det åtte ganger. xAI slapp Grok 4.5 denne uken, trent på titusenvis av Nvidia GB300-GPU-er og rettet mot koding, agent-oppgaver og kunnskapsarbeid, melder The Decoder.

Benchmark-bildet er blandet, og det er verdt å se på hvor gapene faktisk ligger. På Terminal Bench 2.1, som tester sammensatte kommandolinje-oppgaver, får Grok 4.5 83,3 % mot GPT-5.5s 83,4 % og Fable 5s 84,3 %. Men på DeepSWE 1.1, som måler evnen til å løse ekte GitHub-issues, faller Grok 4.5 til 53 % mot GPT-5.5s 67 % og Fable 5s 70 %. På SWE Bench Pro er avstanden 64,7 % mot 80,4 %. Modellen holder følge når oppgaven er avgrenset, og faller av når den må navigere en ekte kodebase over mange steg.

Prisen er der historien snur. Grok 4.5 koster 2 dollar per million input-tokens og 6 dollar per million output-tokens. Fable 5 tar 10 og 50. xAI oppgir i tillegg at Grok 4.5 bruker 4,2 ganger færre tokens enn Opus 4.8 på SWE Bench Pro, og leverer 80 tokens i sekundet. Det tallet kommer fra leverandøren selv og er ikke uavhengig etterprøvd.

Nøkkeltall
6 dollar
Grok 4.5, per million output-tokens
25 dollar
Opus 4.8, samme måleenhet
30 dollar
GPT-5.5 og GPT-5.6
50 dollar
Fable 5, dyrest i feltet

Motargumentet mot pris-vinkelen er verdt å ta på alvor. En billig modell som trenger tre forsøk på en oppgave en dyr modell løser på ett, er ikke billig. Nettopp DeepSWE-gapet på 17 poeng er der flerstegsarbeid lever, og det er der en agent brenner tokens på å prøve igjen. Regnestykket avhenger derfor av oppgavetypen din, ikke av prislisten alene.

Prisstrategien gjentar mønsteret fra kinesiske leverandører som Zhipu og DeepSeek: kom nær nok på ytelse, vinn på pris. Grok 4.5 er tilgjengelig gjennom Grok Build, Cursor og xAI-konsollet, men ikke i EU ennå. xAI sikter mot midten av juli, noe som i praksis betyr at norske utviklere må vente eller rute utenom.

For deg som bygger, flytter dette terskelen for hva som er verdt å automatisere. Oppgaver du har latt være å kjøre gjennom en modell fordi regningen ikke forsvarte det, kan se annerledes ut på 6 dollar per million tokens. Oppgaver som krever at agenten holder tråden gjennom en hel kodebase, gjør det fortsatt ikke.

Pulsen · norske KI-nyheter for deg som bygger. Sakene er KI-generert fra originalkilden, som alltid lenkes.