Livenerf tester Claude Opus 5.5 på 78 spørsmål daglig for å fange nerfing
Mål om Claude Opus 5.5 blir svakere etter lansering med Livenerf, som kjører 78 låste spørsmål daglig i 30 dager gjennom headless Claude Code.
78 spørsmål fra GPQA Diamond, MMLU-Pro, konkurransematematikk og AIME 2025–26 går én gang i døgnet gjennom Claude Opus 5.5 i Livenerf, et offentlig GitHub-prosjekt fra utvikleren ninjahawk. Anthropic lanserte Opus 5.5 22. september, og første dag i måleserien var 24. september. Per 29. september var 6 av 30 dager samlet inn, og første mulige konklusjon kommer rundt 24. oktober, ifølge README-en.
Utvalget er smalt med vilje. Av 2 336 kandidatspørsmål svarte Opus 5.5 riktig på rundt 93 % i første forsøk, og 97 % av spørsmålene var enten alltid rette eller alltid feil. Bare spørsmål modellen noen ganger klarer kan vise en nedgang, så de 78 ble panelet. Oppsettet fanger en endring på rundt 7,5 prosentpoeng per tidagersvindu. Hvert kall er hermetisk: fast systemprompt, ingen verktøy, MCP-servere, hooks eller CLAUDE.md, og Claude Code er låst til versjon 2.1.280. En kontrollarm med claude-opus-5 kjører GPQA-spørsmålene hver dag, slik at en plattformendring ikke forveksles med en svakere modell.
Valideringen viser også grensene. Lavere effort slo tydeligere ut i tokens enn i treffsikkerhet: effort low ga 62 % færre output-tokens og 8,3 ± 4,5 poeng lavere score. Et bytte til Opus 5 kunne derimot ikke skilles fra Opus 5.5 med 99 % sikkerhet.
«If a model quietly starts thinking less, this is where it shows up first, often before accuracy moves at all.» — ninjahawk, i Livenerf-README-en
Prosjektet fikk 230 poeng på Hacker News 29. september. Én kommentar spådde at Anthropic snart vil optimalisere mot testen, men panelspørsmålene holdes private og bare hashene publiseres. En annen spurte om API-et også rammes. Livenerf måler bare Opus 5.5 slik modellen serveres gjennom Claude Code på abonnement, ikke det rå API-et, og prosjektet har ennå ikke valgt lisens.
Hva bør du gjøre?
- Lås Claude Code-versjonen med DISABLE_AUTOUPDATER=1 i dine egne evals, siden en ny CLI-versjon ser ut akkurat som en endret modell.
- Logg output-tokens per kall i agentene dine, siden lavere effort ifølge Livenerf viser seg der før treffsikkerheten faller.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.