Lemmalog stryker agentens konklusjoner når faktaene faller
Bytter gjenfinning mot utledning: Lemmalog holder et Datalog-minne som selv invaliderer konklusjonene når faktumet de hvilte på faller bort.
2700 tokens per spørsmål mot 104 000 for full samtalehistorikk. Det er forskjellen Jordy Zomer måler når han kjører sitt eget minnesystem Lemmalog mot LongMemEval, skriver han på pwning.systems. Konteksten som sendes til modellen som skal svare, er rundt 38 ganger mindre.
Zomer jobber med sårbarhetsforskning og begynte å se på minne fordi agentene mistet tråden i lange undersøkelser: modellen kunne foreslå en tilnærming som allerede var utelukket, eller resonnere videre fra en observasjon som ikke lenger var gyldig. Vanlige minnesystemer henter fram de mest relevante observasjonene, men vet ikke at en av dem ble motbevist to timer senere.
Løsningen ble en Datalog-motor. Språkmodellen tar den uklare delen, altså å gjøre debugger-utskrifter og kildekode om til strukturerte fakta, mens Lemmalog utleder konsekvensene deterministisk. Motoren sporer hvordan hvert avledede faktum kom til, så den kan både forklare hvorfor noe er sant og fjerne alt som hvilte på et faktum du trekker tilbake. Fakta kan også få gyldighetsintervaller, så du kan spørre både hva som gjelder nå og hva du trodde tidligere.
«Jeg ville egentlig ikke gi språkmodellen et bedre minne. Jeg ville at den skulle slutte å glemme hvorfor vi trodde på ting.» — Jordy Zomer, utvikler av Lemmalog
Zomer kjørte hver benchmark tre ganger i MemEval-oppsettet. På LongMemEval lander Lemmalog på 0,463 i F1, bak PropMem på 0,550, men over dobbelt så høyt som hans egen fullkontekst-kjøring med GPT-4.1 på 0,197. LoCoMo, med 1986 spørsmål, gir 0,533. Svakheten ligger i utpakkingen: faktaene ble som regel aldri hentet ut.
Prosjektet har en MCP-server, så agenten kan bruke Lemmalog direkte, og kildekoden er publisert på GitHub. For deg som lar en agent jobbe i timevis på samme problem, er poenget ikke et større kontekstvindu, men at et faktum du motbeviser river med seg konklusjonene som hang i det.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.