Dream-RSI lar kodeagenter teste søkestrategier i gamle logger og kutter 42 prosent av kallene
Gjenbruker ferdige søketrær som simulator, slik at en kodeagent kan prøve tusenvis av nye søkestrategier uten å kjøre modellen eller evaluatoren på nytt.
«En agent må drømme for å forbedre seg selv rekursivt. Historikken er verdenen den drømmer i», skriver forskerne fra Google, Google DeepMind, University of Maryland og University of Virginia på prosjektsiden for Dream-RSI. I praksis lagres hvert fullførte søkeløp som et tre av beslutninger med faktiske kjøreresultater, og en ny søkestrategi spilles av mot det treet i stedet for å kjøres live.
Metoden angriper utforskningen i agentløkker som foreslår kode, evaluerer og prøver igjen: hvor agenten skal forgrene seg, hva som kjøres parallelt og når en retning kuttes. Den delen er som regel håndskrevet og fastlåst, og å forbedre den underveis er dyrt fordi du må se en hel kjøring til ende for å vite om strategien var god. I Dream-RSI skriver en egen agent flere versjoner av strategikoden, scorer hver av dem ved avspilling og sender vinneren ut i neste live-runde. Siden den gjeldende strategien selv er en av kandidatene, kan vinneren aldri score dårligere enn den i avspillingen. Kodeagenten og modellen endres ikke.
På Lasso-oppgaven falt snittlig kjøretid over seks datasett fra 3 587 til 2 931 millisekunder med Gemini 3.1 Pro, med 317 agentkall mot 550 for den faste strategien. SimpleTES trengte 51 200 kall, 162 ganger flere. På GPU-kjerner rapporterer teamet 2,43 ganger færre generasjoner på VGG16 og 2,09 ganger høyere score på ConvDiv. Gevinsten er ikke jevn: på Gisette-datasettet var Dream-RSI med Gemini 3.1 Pro tregere enn den faste strategien, og i matematikkoppgavene ble den bedre på én, lik på én og litt svakere på én.
Det mest overførbare funnet gjelder prompting. Å koke tidligere kjøringer ned til tekstlige hint i prompten ga konsekvent dårligere resultater enn å la være, med samme budsjett.
«Sterke semantiske føringer om hvor det skal søkes, snevrer inn søkerommet og kveler variert utforskning» — forskerne bak Dream-RSI
Koden er ikke ute ennå: GitHub-repoet oppgir at full kodebase, reproduksjonsskript og de oppdagede programmene fortsatt er under arbeid. For deg som bygger egne agentløkker er poenget at en logg over hvert forsøk og resultatet allerede er en simulator du kan teste nye strategier mot, uten å betale for kjøringene på nytt.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.