Hopp til hovedinnhold
Tilbake
Claude-code 3 min · Kilde: Armature

Claude Code, Codex og Cursor velger samme verktøy i 42 prosent av testene

KI Takeaway KI-generert · kan inneholde feil

Regn med at kodeagenten din velger tredjepartstjeneste ut fra hvilket språk repoet er skrevet i, ikke bare ut fra hva du ber om.

«Armature sells growth services to dev tools», står det i ansvarsfraskrivelsen øverst i studien selskapet publiserte 3. september. Den bør du ta med deg inn i tallene, for Armature selger hjelp til leverandører som vil bli plukket av kodeagenter. Studien er likevel den største av sitt slag så langt: 16 893 agent-sesjoner der Claude Code, Codex og Cursor faktisk implementerte tredjepartstjenester i 75 repoer, ikke bare anbefalte dem. 5 292 sesjoner fordelt på 51 kodebaser og 18 sektorer er godkjent og publisert, med hele sporene åpne.

Hovedfunnet er uenigheten. De tre agentene lander på samme verktøy i bare 42 prosent av kategoriene. På stemmeagenter velger Claude Code Twilio, Codex velger OpenAI Realtime API og Cursor velger Vapi, på samme type oppgave. Claude Code bygger i tillegg løsningen selv nesten dobbelt så ofte som de to andre, 19 prosent mot 10.

Forskjellen ligger i hvor de henter kunnskapen fra. Codex søker på nettet i 94 prosent av sesjonene, og i ni av ti søk bruker den operatorer som site: for å låse seg til ett domene. Cursor bygger avgjørelsen på nettsøk i to av tre sesjoner. Claude Code stoler mest på det den allerede kan og søker bare i rundt 30 prosent av tilfellene, men leser tre ganger så mange sider som Codex når den først søker. I ferske kategorier som sandkasser, der forhåndskunnskapen er tynnere, går den opp mot 80 prosent.

Konteksten i repoet veier tyngre enn formuleringen din. Samme forespørsel om e-postutsending ga fire ulike vinnere i fire språk: Resend på TypeScript (55 av 89 kjøringer), SendGrid på Python (22 av 24), Postmark på Go (20 av 24) og Azure Communication Services på Java (22 av 23). Vercel vant på TypeScript-repoer, og i alle tilfellene der Next.js var i bruk, men ble aldri anbefalt på Python, der Render dominerte.

Å bli nevnt er ikke å bli valgt. PayPal ble nevnt 139 ganger og valgt null ganger; Stripe tok 124 av de samme sesjonene. Adyen fikk 175 nevnelser og tre valg. LangChain er det mest omtalte rammeverket med 194 nevnelser og ble valgt fire ganger. Supabase er den mest omtalte databasen med 242 nevnelser, men tapte gjennomgående mot Neon, ifølge Armature fordi de bundlede BaaS-funksjonene leste som støy for en agent som bare lette etter en database. Mailgun tapte mot Postmark når agenten leste «1-day retention» på gratisplanen.

Hvorfor dette betyr noe utover kuriosa, ligger i volumet Armature viser til:

«over 30% of deployments were initiated by coding agents, up 1000% from six months ago» — Vercel i april, sitert i Armature-studien

Metoden har forbehold du bør kjenne. Repoene er syntetiske, med falske firmanavn og git-historikker, men ekte lockfiler sjekket mot pakkeregistre. Både den simulerte brukeren i loopen og dommeren som vurderte sesjonene er Gemini 3.7 Flash, så en modell avgjør hva som teller som gyldig valg.

Hva bør du gjøre?

  1. Be agenten liste alternativene og hvorfor de faller bort, før den installerer noe. Studien viser at agenten sjelden nevner at valget er språkbetinget.
  2. Kjør dyre valg gjennom to agenter. Er databasen eller betalingsleverandøren vond å bytte senere, koster en ekstra sesjon i en annen agent lite mot 42 prosent enighet.
  3. Selger du et utviklerverktøy, les gratisplanen din som en agent ville gjort. «1-day retention» og en bundlet funksjonsliste diskvalifiserte reelle produkter i disse kjøringene.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter