Cognitions SWE-2 er ett poeng fra Fable 5.1 og 64 prosent billigere
Gir Devin-brukerne SWE-2, Cognitions nye kodemodell som scorer 50,0 prosent på FrontierCode 1.1 Main, under ett poeng bak Fable 5.1, til 64 prosent lavere kostnad.
Cognition lanserte SWE-2 10. september og kaller den selskapets mest avanserte kodemodell hittil. Den er tilgjengelig i Devin Desktop og Devin CLI fra lanseringsdagen, mens Devin Web og Fusion får den etter hvert. Modellen er etterstrent fra Kimi K3, en modell på 2,8 billioner parametere som allerede hadde fått omfattende RL-trening for agentisk koding, og Cognition skriver at selskapet for første gang har skalert RL til modeller med flere billioner parametere.
Det nye i oppskriften er at alle innsatsnivåene trenes i én og samme RL-kjøring. Hvert nivå får en lineær kostnadsstraff justert etter hellingen på grunnmodellens Pareto-kurve, slik at treningen skal flytte hele kurven for pris mot ytelse og samtidig bevare formen. Cognition har i tillegg tredoblet antallet RL-miljøer siden SWE-1.7.
Effekten merkes mest i hvor mye agenten roter rundt. Brukere klaget på at SWE-1.7 overutforsket enkle oppgaver. På FrontierCode 1.1 Main scorer SWE-2 på middels innsats høyere enn SWE-1.7, med 58 prosent færre runder og 81 prosent lavere kostnad i snitt. Første reelle kodeendring kommer etter en median på 18 steg, mot 48 for forgjengeren.
«Sterkere ingeniørskjønn lar agenten skrive mer komplette løsninger med færre omveier og overflødige lesninger» — Cognition-teamet
Tallene har to forbehold. Alle er Cognitions egne målinger, og på Terminal-Bench 4 faller SWE-2 langt bak med 27,3 prosent, mot 55,8 for Fable 5.1 og 57,9 for GPT-6 Astra. Cognition kjørte også sin test for propaganda og sensur med 145 politisk sensitive spørsmål om Kina, og der besto SWE-2 98,0 prosent av forsøkene.
For deg som bygger med kodeagenter viser SWE-2 at en åpen grunnmodell med målrettet RL nå kommer innen få poeng fra GPT-6 Astra, til en firedel av kostnaden, ifølge Cognition.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.