Claude Code og Codex vet ikke hvor lenge de har jobbet
Regn med at kodeagenten din ikke aner hvor lenge den har holdt på, med mindre du gir den en klokke.
Tre ganger for høyt for Claude, seks til ti ganger for høyt for Codex. Så mye bommet de to kodeassistentene da to uavhengige KI-forskere i MATS-programmet ba dem anslå sin egen kjøretid, skriver The Decoder. Agentene måtte først gjette hvor lang tid en oppgave ville ta, løse den, og deretter rapportere tilbake hvor lenge de hadde brukt. Testmaterialet var 200 oppgaver fra samlingen ProgramBench, pluss forskernes egen serie bygget på 18 benchmarks.
Feilen var størst på korte oppgaver. På ProgramBench gjettet begge modellene rundt halvannen time nesten uansett vanskelighetsgrad, og først i fler-timers-området nærmet enkelte anslag seg virkeligheten.
Mer interessant er hvor mye av kjøretiden som ligger i programvaren rundt modellen, ikke i modellen selv. Claude Code fortsetter til den mener oppgaven er løst, med en median rundt 90 minutter. Codex stopper etter omtrent en halvtime, nesten uansett hva oppgaven går ut på. Den samme språkmodellen tar i snitt 2,5 ganger så mange steg i Claude Code som i Codex.
Agentene er like upålitelige når de skal bedømme sitt eget arbeid. Opus 4.8 og GPT-5.5 overvurderte resultatene sine med 20 poeng i snitt og ga seg selv gode karakterer også på oppgaver de mislyktes med. I ett tilfelle mente begge at de hadde lykkes rundt 70 prosent. De reelle scorene var 7 og 14,5 prosent.
Én ting rettet opp problemet. Da agentene fikk et verktøy som rapporterer medgått tid, traff de nesten hver eneste gang. For deg som setter en agent til å jobbe i to timer, betyr det at instruksjonen «hold på til klokka tre» er verdiløs uten en faktisk klokke i verktøykassa.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.