Unreal Agent måler 16 til 39 prosent lavere kostnad enn Codex med asynkrone verktøykall
Flytter ventingen på verktøykall ut av modellen, og Unreal Labs måler 16 til 39 prosent lavere kostnad enn Codex på fire benchmarker uten lavere løsningsrate.
Unreal Agent og Codex løste like mange oppgaver på Terminal-Bench 4.0, 57,9 prosent, men Unreal-kjøringen kostet 1428 dollar mot 2350 for Codex. Tallene står i en bloggpost Unreal Labs publiserte 22. september, der selskapet deler agent-rammeverket sitt og måler det med GPT-6 Astra på xhigh mot Codex og Pi.
Grepet er at verktøykall håndteres helt asynkront. Når agenten starter et kall, skriver Unreal Agent straks en hendelse i loggen om at kallet er i gang, og lar det kjøre videre i bakgrunnen. Først når verktøyet er ferdig, legges resultatet inn i øktloggen og modellen kalles igjen. Modellen slipper å håndtere venting, polling og heartbeats, og du kan styre agenten underveis.
Besparelsen varierer mye mellom testene. På SWE-Atlas Codebase QnA kostet Unreal Agent 936 dollar mot 1303 for Codex, og på DeepSWE 1.1 var tallene 1367 mot 1633. Det tilsvarer 28 og 16 prosent lavere kostnad. Unreal Labs forklarer gevinsten med færre modellturer og færre input-tokens: på Terminal-Bench brukte agenten 28 turer og 1,73 millioner input-tokens per forsøk, mot 44 turer og 2,83 millioner for Pi.
Alle tallene er selskapets egne. Toppresultatet på 39 prosent er også det svakeste, fordi Codex-tallet på Terminal-Bench er leaderboard-baselinen og ikke en kjøring Unreal Labs har gjort selv.
«Det er marginale forskjeller i løsningsrate, som vi tilskriver variasjon i benchmarkene» — Unreal Labs, i bloggposten
Unreal Agent finnes som Go-bibliotek, som en runner på linje med claude -p og codex exec, og som benchmark-runner for Harbor.
Hva bør du gjøre?
- Kjør en av Harbor-oppgavene med din egen modell før du stoler på prosenttallene, siden besparelsen bare er målt med GPT-6 Astra.
- Sammenlign antall modellturer og input-tokens mot ditt eget oppsett, fordi det er der Unreal Labs finner besparelsen, ikke i billigere tokens.
- Test om inferensleverandøren din godtar to resultater for samme verktøykall, ett foreløpig og ett endelig: Unreal Labs fikk avvisninger hos enkelte leverandører utenom OpenAI.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.