Google-forskere hindrer selvforbedrende agenter i å pugge testene, med 30 % færre tokens
Hold av et testsett agenten aldri optimaliseres mot, viser RRSI, ellers belønner selvforbedringen pugging i stedet for bedre agenter.
Med Claude Opus 4.8 fryst som modell løfter RRSI andelen løste oppgaver på JobBench fra 36,0 til 40,7 prosent, uten at søket noen gang har sett en eneste JobBench-oppgave. Metoden kommer fra Google Cloud AI Research sammen med UNC-Chapel Hill, Stanford og Washington University in St. Louis, og artikkelen ble lagt ut på arXiv 21. september, skriver The Decoder.
En agents evner styres i stor grad av kjørerammen rundt modellen: prompter, kontrollflyt, verktøy og minne. Nyere metoder lar en språkmodell skrive om denne rammen igjen og igjen basert på resultater fra et fast sett testoppgaver, en praktisk form for rekursiv selvforbedring. Problemet er at rammen lærer testsettet utenat. Gevinstene på treningsoppgavene krymper eller forsvinner på nye benchmarks, og to av de fire tidligere metodene forskerne sammenlignet med endte under utgangspunktet på usette oppgaver.
RRSI begrenser søket i stedet for rammen. Hver kandidat får et redigeringsbudsjett som krymper over tid, så sene runder bare tillater én sporbar endring, og forslagsmodellen ser hele historikken slik at den ikke prøver forkastede ideer på nytt. Før noe blir målt, avviser en kritiker forslag som hardkoder oppgavenavn, fasitsvar eller annen benchmark-spesifikk logikk. En gevinst må være større enn målestøyen, ekstra tokens må betales med målbar forbedring, og komponenter som slutter å bidra, blir fjernet.
Rammene ser også ut til å overføres mellom modeller. En kode-ramme optimalisert med Gemini 3.5 Flash løftet den langt svakere Gemini 3.1 Flash Lite fra 11,2 til 14,6 poeng uten endringer. Forfatterne understreker at studien bare dekker fryste modeller, ikke oppsett der vektene endres.
Koden ligger på GitHub under Apache 2.0. Hver kandidat utvikles i sin egen git worktree, og standardoppsettet bruker Claude Opus 4.8 på Vertex AI, men README-en sier at enhver LiteLLM-modellstreng fungerer.
Lærdommen gjelder også deg som justerer system-prompter mot egne evals: forbedringer du bare har målt på settet du justerte mot, sier lite om hvordan agenten klarer seg på nye oppgaver.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.