Real-SWE: Fable 5.1 løser 38,8 prosent av ekte bedriftsoppgaver
Måler åtte kombinasjoner av modell og kodeverktøy på lisensierte, private bedriftskodebaser, der det beste resultatet er 38,8 prosent løste oppgaver.
En avgiftsregel for fakturaer, en migrering av kundeidentiteter og måling av API-tokens: slike oppgaver fyller vanlige bedrifters kodebaser, men ligger sjelden på det åpne nettet. Specific Labs har lisensiert private produksjonskodebaser fra ekte selskaper og bygget benchmarken Real-SWE av oppgaver ingeniørene deres faktisk jobber med. Verken koden eller løsningene er offentlig tilgjengelig, så modellene har neppe sett dem under trening.
Øverst ligger Fable 5.1 i Claude Code med 38,8 prosent, foran GPT-6 Astra i Codex CLI med 33,8 og Gemini 3.8 Flash i Gemini CLI med 31,2. GLM 5.3, også kjørt i Claude Code, får 28,8, mens Grok 4.6 og Muse Spark 1.3 deler femteplassen med 23,8. Kimi K3 i Kimi Code får 18,8, og GPT-5.6 Sol i Codex CLI havner sist med 16,2 prosent. Tallene er pass@1 i snitt over åtte uavhengige kjøringer per oppgave, som gir 640 vurderte kjøringer fordelt på ti oppgaver.
Spredningen mellom oppgavene er stor. Seks av ti oppgaver har under 15 prosent løsningsrate, og ingen av de åtte oppsettene klarte oppgaven «Analytics stream reducer» en eneste gang. Referanseløsningene endrer i median 11 filer, mot 6 i FrontierCode og DeepSWE, mens instruksjonene er på 1742 tegn i median. Oppgaven sier hva som skal endres, og agenten må selv finne ut hvordan forretningslogikken og tjenestene rundt henger sammen.
«Vi har funnet ut at dagens modeller er svakere til å forstå selskapers kodemønstre, og at de ofte overser krav eller lar være å verifisere antakelsene sine.» — Specific Labs, i presentasjonen av Real-SWE
Feilbildet går igjen i tallene: oversette krav er den vanligste grunnen til at kjøringene feiler. Mer tid hjalp heller ikke. Av kjøringene som varte under 10 minutter feilet 71,4 prosent, mot 73,4 prosent av de lengre. Estimert kostnad per kjøring spenner fra 2,50 dollar for Gemini 3.8 Flash til 6,96 dollar for Fable 5.1, så Gemini 3.8 Flash lander 7,6 poeng bak toppen til drøyt en tredjedel av prisen.
Metoden har en innebygd svakhet. Kodebasene er private, så ingen utenfor Specific Labs kan etterprøve resultatene, og selskapet deler bare et utvalg av oppgavene på forespørsel. I Hacker News-tråden om benchmarken tar flere opp nettopp dette, og én peker på at «private» ikke nødvendigvis betyr ukjent for modellene.
«Min intuisjon er at mange av de bedre og større private kodebasene, i hvert fall med tanke på Claude Code og Codex, i realiteten ikke er private lenger.» — lmeyerov, som driver botsbench.com, på Hacker News
For deg som bygger med kodeagenter viser Real-SWE at selv det beste oppsettet løser færre enn to av fem oppgaver fra ekte bedriftskode, og at modellene oftest snubler i forretningsregler de ikke får servert.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.