Cambridge-metode lar evaluatoren vokse i takt med agenten
Lar evaluatoren utvikle seg sammen med den selvforbedrende agenten, slik at testen slutter å være et tak.
1,78 til 1,86 ganger høyere aksept hos et panel av dommeragenter er det forskere ved University of Cambridge måler når evaluatoren får utvikle seg i takt med agenten den bedømmer. Bakgrunnen er et kjent tak: en selvforbedrende agent redigerer sin egen kode, tester varianter og beholder endringene som scorer bedre, men signalet kommer fra en fast benchmark eller testsuite. Når agenten har lært alt den testen kan skille mellom, stopper framgangen. Arbeidet er gjort sammen med NVIDIA, Flower Labs, MBZUAI og Inria.
«A self-improving agent can only get as good as the test that scores it» — Alex Iacob, doktorgradsstipendiat ved Machine Learning Systems Lab, University of Cambridge
Rammeverket heter Red Queen Gödel Machine, etter hypotesen fra evolusjonsbiologien om at arter må fortsette å utvikle seg bare for å holde stillingen. Søket deles i epoker. Innenfor en epoke holdes evaluatoren fast slik at framgang kan måles, og ved sjekkpunkter kan en sterkere evaluator ta over hvis den treffer bedre på betrodde fasit-eksempler. Scorene fra den gamle evaluatoren forkastes, og neste epoke måles mot en hardere standard.
Forskerne prøvde rammeverket på å skrive og vurdere vitenskapelige artikler, og på å skrive og karaktersette bevis på olympiade-nivå i matematikk. Medutviklede gradere treffer 9 prosent bedre mot fasit enn utgangspunktet, rapporterer de i preprinten.
Kostnadssiden er like interessant for de som bygger selv. I ett forsøk kjørte forskerne NVIDIAs Nemotron 3 Ultra sammen med ChatGPT-5.5 i stedet for å la den dyre modellen gjøre alt. På vurderingsoppgaven nærmet hybridoppsettet seg det ChatGPT klarte alene, med rundt 13 ganger lavere kostnad i søke-tokener.
«This is a narrow result, and we should be careful not to overstate it» — Nic Lane, professor ved University of Cambridge
Preprinten ble lagt ut på arXiv 24. juni 2026 med identifikatoren 2606.26294, og Cambridge omtalte arbeidet 21. juli. Metoden skal ifølge forskerne slippes som åpen kildekode. For deg som bygger agentløkker er poenget at evalueringen er en del av systemet du optimerer, ikke en nøytral målestokk du setter opp én gang.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.