Cursors agentsverm: 411 dollar i arbeidermodeller mot 9 373 for GPT-5.5 alene
Sett frontmodellen til å planlegge og en billig modell til å skrive: Cursor-svermen kom i mål for 1 339 dollar der GPT-5.5 alene brukte 10 565.
9 373 dollar mot 411 dollar. Det er hva arbeiderleddet kostet i to av kjøringene da Cursor lot en sverm av KI-agenter bygge SQLite på nytt i Rust, ifølge The Decoder. I den første kjørte GPT-5.5 alene og gjorde alt selv. I den andre planla Opus 4.8 mens Composer 2.5 skrev koden. Begge oppsettene nådde til slutt 100 prosent på testsuiten.
Oppgaven var strengt avgrenset. Agentene fikk de 835 sidene med SQLite-dokumentasjon og ingenting annet: ingen kildekode, ingen testsuite, ingen SQLite-binærfil og ingen internettilgang. Fasiten var sqllogictest, en suite med millioner av SQL-spørringer og kjente svar, som svermen ikke visste eksisterte. Fire oppsett ble prøvd, altså GPT-5.5 alene, Grok 4.5 alene, Opus 4.8 som planlegger med Composer 2.5 som arbeider, og Fable 5 som planlegger med samme arbeider.
Delingen mellom planlegger og arbeider er det Cursor peker på som selve fiksen, og begrunnelsen er kontekst, ikke intelligens. En enslig agent må holde både sluttmålet og den konkrete deloppgaven i hodet mens den vandrer gjennom hele oppgavetreet, og det er der lange kjøringer sklir ut. I svermen skriver planleggerne ingen kode, og arbeiderne planlegger ingenting.
Sammenligningen med den gamle svermen er brutal. Den gamle produserte 68 000 commits på to timer, rundt sytti ganger så mange som den nye, og det meste var bortkastet arbeid. Den samlet over 70 000 flettekonflikter mot under 1 000 i den nye kjøringen. Den mest omstridte fila i den gamle kjøringen registrerte 7 771 konflikter fra 1 173 agenter, mot 47 i den nye. Cursor kaller feilmønsteret «split-brain design»: to planleggere bygger samme idé på hvert sitt sted, på hver sin måte, uten å vite om hverandre.
Utslaget vises i kodemengden. I Fable 5-oppsettet trengte den gamle svermen 64 305 linjer motorkode, den nye 9 908. I Opus-oppsettet skrev den gamle 19 013 linjer og landet på 97 prosent, mens den nye nådde 100 prosent på 4 645 linjer. Da svermen kom opp i 1 000 commits i sekundet, bygde Cursor sitt eget versjonskontrollsystem, fordi Git ikke var laget for den takten.
Prisforskjellen kommer nesten utelukkende fra prising, ikke fra kvalitet. Composer 2.5 ligger på nivå med Opus 4.7 og GPT-5.5 i benchmarks, men koster 0,50 dollar per million input-tokens og 2,50 per million output, og modellen bygger på Kimi K2.5 ifølge Cursor-grunnlegger Michael Truell. Arbeiderne sto for minst 69 prosent av tokenene i hver kjøring og som regel over 90 prosent. Planleggertokenene er få, men dyre: i Opus-oppsettet sto planleggeren for to tredeler av regningen.
Tallene kommer fra Cursors eget forsøk, og avstanden til produksjon er stor. En studie fra slutten av 2025 fant at 68 prosent av agentene i produksjon rakk maks ti steg før et menneske grep inn, og for 47 prosent var grensen under fem steg. Poenget for deg som setter opp agenter er likevel konkret: det er planleggingen og de tidlige designvalgene som trenger den dyre modellen, ikke hvert enkelt filredigeringssteg.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.