Hopp til hovedinnhold
Tilbake
Anthropic 3 min · Kilde: Anthropic

Anthropic slipper Sonnet 5.5: 70,6 % på Terminal-Bench til halv Opus-pris

KI Takeaway KI-generert · kan inneholde feil

Bytt til Sonnet 5.5 for rutinekoding og agentløkker der Opus 5.5 er overkill, siden den koster det samme som Sonnet 5, svarer over 30 % raskere og ligger nær Opus på kodetestene.

Sonnet 5 klarte 10,3 % på Terminal-Bench 4.0, en test av agentisk koding i terminalen. Etterfølgeren Claude Sonnet 5.5, som Anthropic lanserte 28. september, klarer 70,6 %. Det er fire poeng over Opus 5.5, men sammenligningen er skjev: Opus-tallet på 66,4 % er modellens beste innstilling (Xhigh), ifølge fotnotene på Anthropics lanseringsside. Modellen er tilgjengelig nå som claude-sonnet-5-5 på Claude Platform, Amazon Web Services, Google Cloud og Microsoft Azure.

Prisen er den samme som for Sonnet 5: $2 per million input-tokens, $10 per million output-tokens og $0,20 for cache-lesing. Opus 5.5 koster det dobbelte på input og output. Anthropic hevder Sonnet 5.5 bruker færre tokens per oppgave og derfor blir opptil 30 % billigere per oppgave enn forgjengeren. På flere benchmarks slår den Sonnet 5s beste resultat allerede på Low- eller Medium-effort, for omtrent en tidel av kostnaden.

På de andre kodetestene ligger Sonnet 5.5 like under Opus. CursorBench 4.0, bygget på oppgaver fra ekte Cursor-økter, gir 55,5 % mot 57,8 %, og FrontierCode 1.1 gir 52,1 % mot 54,4 %. Anthropic er selv tydelig på hvor grensen går:

«Opus 5.5 er fortsatt klart sterkere på komplekst, åpent arbeid som krever vedvarende dømmekraft.» — Anthropic, lanseringssiden for Sonnet 5.5

En detalj i fotnotene sier noe om hvordan modellen oppfører seg i Claude Code. På Max-effort scoret Sonnet 5.5 lavere på FrontierCode (46,2 %) enn på Xhigh. Årsaken var at den oftere startet code-review-skillen i Claude Code, som fordeler gjennomgangen på mange subagenter, og i to tilfeller som Cognition undersøkte førte det til timeout eller endringer utenfor oppgaven. Mer effort er altså ikke alltid bedre.

En av de mest konkrete innvendingene i Hacker News-tråden om lanseringen (330 poeng) bygger på Anthropics egne kostnadskurver, der Opus ofte vinner på høye innstillinger.

«Hvorfor skulle du bruke Sonnet 5.5 på xhigh hvis du får bedre resultater (høyere score, lavere kostnad) med Opus 5.5 på high?» — wkcheng, Hacker News

Anthropic gir langt på vei samme svar: Sonnet 5.5 utfyller Opus best på lave effort-innstillinger. Standard effort er Medium i Claude Code og appene, og High på Claude Platform.

To endringer kan treffe deg som bygger på API-et. Kjører du Sonnet med thinking av, må du over på den nye innstillingen between_tools før du bytter modell, ifølge Anthropics migreringsguide. Sonnet 5.5 er også første Sonnet med cyber-safeguards: sikkerhetsoppgaver med høyere risiko faller synlig tilbake til Sonnet 5, mens vanlig feilsøking i egen kode skal gå som før. I tillegg er thinking nå knyttet til kontoen som skapte den, noe som påvirker deg hvis du bytter konto midt i en Claude Code-økt.

Bakgrunn

Sonnet 5 kom for om lag tre måneder siden og ble solgt inn som en billig måte å kjøre agenter på, skriver TechCrunch. Uka før denne lanseringen oppdaterte OpenAI mellomklassemodellen Sol og budsjettmodellen Luna. Anthropic lover Claude Haiku 5.5 «i løpet av de kommende ukene», uten fast dato.

For deg som kjører mange parallelle agenter eller lange kodeløkker, er Sonnet 5.5 nå det naturlige standardvalget, med Opus som reserve for de vanskelige oppgavene.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter