Samme modell, ni kodeagenter: kostnaden per oppgave spriker 17 ganger
Sammenlign kostnad per oppgave før du velger kodeagent: samme modell gir 17 ganger forskjell.
Rammeverket Exo bruker 1,05 dollar i median per oppgave. Claude Code bruker 18,34. Begge kjørte den samme modellen, Kimi K3, på den samme maskinen, med de samme oppgavene. Forskjellen ligger i laget rundt modellen, ikke i modellen.
Tallene kommer fra Runtas evaluering av ni kodeagent-rammeverk i tolv konfigurasjoner, 360 kjøringer totalt. Hver kjøring starter fra en fersk gjenoppretting av det samme sjekkpunktet, med identisk vCPU, minne, disk og minnetilstand, slik at ingen får fordel av en varm cache.
På treffrate leder Codex v0.148.0 med 66,7 prosent, foran Claude Code v2.1.237 og DSH Creator på 63,3. Pi ligger på 60,0 prosent til 2,43 dollar per oppgave, og Runta kaller den det balanserte valget. Exo er billigst, men løser bare 53,3 prosent av oppgavene.
Cache-treff forklarer en del av spriket. Codex og Kimi Code ligger på 88,0 prosent cache-treff per løste oppgave, Claude Code på 67,8. Runta advarer likevel mot å lese cache-raten som en kostnadsmåler.
«Cache hit rate is not cost. A cached 300-turn failure can still burn more than a short cache miss.» — Runtas evalueringsrapport
Tid følger samme mønster: DSH Minimal bruker 5 minutter og 41 sekunder i median per løste oppgave, Claude Code 9 minutter og 38.
Runta selger selv kjøretiden rammeverkene ble testet på, og tilbyr 100 dollar i kreditt til den som vil kjøre sitt eget oppsett gjennom den. Evalueringen dekker dessuten bare terminalbaserte programvareoppgaver, noe Runta presiserer.
Hva bør du gjøre?
- Mål kostnad per løste oppgave, ikke per kjøring. Runta flagger selv at OpenCodes tall på 0,0615 dollar utelater feilede forsøk. Tar du dem med, ender det på 3,24 dollar per oppgave.
- Sjekk cache-treffraten i din egen agent før du bytter rammeverk. Ligger den under 70 prosent, er det der pengene forsvinner.
- Les tallene som et leverandør-benchmark: Runta måler på sin egen kjøretid, med Kimi K3 som eneste modell.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.