IBM målte 16 prosentpoeng bedre agent med kuratert minne til 5 prosent mer tokens
Målte 16,1 prosentpoeng bedre oppgaveløsning for gpt-oss-120b med kuratert henting av egne retningslinjer, til bare 5 prosent flere tokens.
Tallet kommer fra IBM Research, som testet agent-minne på åtte modeller og publiserte resultatene på Hugging Face 18. august 2026. Metoden heter ALTK-Evolve og gjør noe enklere enn navnet antyder: agenten kjører oppgaver, systemet destillerer gjenbrukbare retningslinjer ut av både vellykkede og mislykkede kjøringer, og disse legges tilbake i konteksten ved inferens. Ingen vekter oppdateres, og ingen mennesker annoterer noe.
«Agent-minne er ikke en funksjon du slår på. Det er en dose du kalibrerer til modellen.» — IBM Research, i studien på Hugging Face
IBM så tre mønstre over kapasitetsspekteret. Sterke modeller med takhøyde vil ha hele settet av retningslinjer: DeepSeek-V3.2 gikk opp 9,5 prosentpoeng på oppgaveløsning med sitt fulle selvutvunne sett. Svakere modeller drukner i et stort sett og gjør det best med en stram kjerne pluss noen få oppgaverelevante retningslinjer hentet per oppgave. Modeller som allerede er mettet flytter seg ikke i det hele tatt. GLM-5 landet der, med null endring på begge måltall.
Kostnadssiden er den praktisk viktigste. Å injisere hele settet på hvert ReAct-steg blåser opp input: DeepSeek-V3.2 gikk fra 148 000 til 263 000 tokens per oppgave, en økning på 78 prosent. Kuratert henting for gpt-oss-120b kostet derimot bare 5 prosent mer, fra 110 000 til 116 000 tokens, og ga altså den største kvalitetsgevinsten i hele studien. Bedre og billigere samtidig.
IBM peker på prompt-caching som den egentlige effektivitetsspaken: den statiske delen av retningslinjesettet er identisk mellom steg og kan caches. Det forutsetter at du holder prefikset stabilt, altså at cache-bevisst prompt-design er noe du faktisk konstruerer for.
Testene kjørte på AppWorld, 585 flerstegsoppgaver fordelt på ni simulerte apper. Forbeholdet IBM selv tar er at det er én benchmark, og at «mettet» beskriver det de observerte, ikke en påvist årsak.
For deg som bygger agenter betyr funnet at «mer minne» ikke er en oppgradering du kan anta. Effekten spriker fra 16,1 prosentpoeng til null avhengig av hvilken modell du kjører, og den billigste konfigurasjonen var den beste for den svakeste modellen i testen.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.