Hopp til hovedinnhold
Tilbake
Forskning 3 min · Kilde: Terminal-Bench-Science

Terminal-Bench-Science: Claude Opus 5 løser 30 prosent av forskningsoppgavene

KI Takeaway KI-generert · kan inneholde feil

Måler KI-agenter mot 70 oppgaver hentet fra forskeres eget arbeid, og den sterkeste løser 30 prosent.

920 forslag ble sendt inn, 464 ble godkjent for implementering og 386 endte som pull requests. Bare 70 av dem kom med i Terminal-Bench-Science 0.1, benchmarken forskere ved Stanford University har bygget sammen med teamet bak Terminal-Bench. Oppgavene spenner over livsvitenskap, fysiske fag, geofag, matematikk og ingeniørfag, og hver modell kjørte tre uavhengige forsøk per oppgave.

Claude Opus 5 med Claude Code kom høyest, med 30,0 prosent løsningsrate. GPT-5.6 Sol med Codex fulgte på 22,4 prosent og Claude Fable 5 med Claude Code på 21,4 prosent. Claude Opus 4.8 landet på 10,5 prosent, mens GPT-5.6 Terra, Kimi K3 og Grok 4.6 alle løste under ti prosent. GLM 5.3 var den sterkeste åpne modellen med 8,1 prosent, og GPT-5.6 Luna kom sist på 3,3 prosent.

Det interessante er hvem som har definert oppgavene.

«Forskere, ikke modellutviklere eller dataleverandører, setter listen for vitenskapelig evne i KI.» — Terminal-Bench-Science 0.1-annonseringen, skrevet av Steven Dillmann

Oppgavene kommer inn gjennom en åpen prosess på GitHub. Et forslag diskuteres først, så bygges det som en pull request, og deretter går det gjennom domenefaglig vurdering, en teknisk gjennomgang av oppgavekonstruksjon og verifisering, og til slutt en siste kvalitetssjekk. Kravet er at oppgaven skal være objektivt verifiserbar og faktisk vanskelig for dagens fremste agenter. Nettopp den siste betingelsen forklarer hvorfor bare 70 av 386 pull requests slapp gjennom.

Nøkkeltall
30,0 %
Claude Opus 5 med Claude Code, høyest av alle
22,4 %
GPT-5.6 Sol med Codex
21,4 %
Claude Fable 5 med Claude Code
8,1 %
GLM 5.3, sterkeste åpne modell

Kostnadsbildet er en egen historie. Å kjøre hele evalueringen på 70 oppgaver kostet 7 000 dollar for Claude Opus 5. GPT-5.6 Sol traff samme nivå som Claude Fable 5 til under en tredjedel av prisen, 4 200 dollar mot 14 200. På tokenforbruk snur bildet: Claude Fable 5 matcher GPT-5.6 Sol med rundt en fjerdedel færre tokens, 6,4 milliarder mot 8,4. Bare Kimi K3 og Claude Opus 5 ligger på begge Pareto-frontene.

Terminal-Bench-Science skiller like godt mellom systemer som Terminal-Bench 3.0, men presser løsningsratene mer enn ti prosentpoeng ned for hver eneste modell som er kjørt på begge. Det er tilsiktet, for oppgavene ble kalibrert under gjennomgangen til å være vanskelige for de nyeste modellene. Neste utgivelse har frist for pull requests 5. oktober 2026.

For deg som bygger agenter sier tretti prosent mer enn en toppscore ville gjort. Det er målet på avstanden mellom en agent som fikser en feilrapport, og en agent som skal kjøre et forsøk fra ende til annen.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter