Hopp til hovedinnhold
Tilbake
Forskning 2 min · Kilde: pwning.systems

Lemmalog stryker agentens konklusjoner når faktaene faller

KI Takeaway KI-generert · kan inneholde feil

Bytter gjenfinning mot utledning: Lemmalog holder et Datalog-minne som selv invaliderer konklusjonene når faktumet de hvilte på faller bort.

2700 tokens per spørsmål mot 104 000 for full samtalehistorikk. Det er forskjellen Jordy Zomer måler når han kjører sitt eget minnesystem Lemmalog mot LongMemEval, skriver han på pwning.systems. Konteksten som sendes til modellen som skal svare, er rundt 38 ganger mindre.

Zomer jobber med sårbarhetsforskning og begynte å se på minne fordi agentene mistet tråden i lange undersøkelser: modellen kunne foreslå en tilnærming som allerede var utelukket, eller resonnere videre fra en observasjon som ikke lenger var gyldig. Vanlige minnesystemer henter fram de mest relevante observasjonene, men vet ikke at en av dem ble motbevist to timer senere.

Løsningen ble en Datalog-motor. Språkmodellen tar den uklare delen, altså å gjøre debugger-utskrifter og kildekode om til strukturerte fakta, mens Lemmalog utleder konsekvensene deterministisk. Motoren sporer hvordan hvert avledede faktum kom til, så den kan både forklare hvorfor noe er sant og fjerne alt som hvilte på et faktum du trekker tilbake. Fakta kan også få gyldighetsintervaller, så du kan spørre både hva som gjelder nå og hva du trodde tidligere.

«Jeg ville egentlig ikke gi språkmodellen et bedre minne. Jeg ville at den skulle slutte å glemme hvorfor vi trodde på ting.» — Jordy Zomer, utvikler av Lemmalog

Zomer kjørte hver benchmark tre ganger i MemEval-oppsettet. På LongMemEval lander Lemmalog på 0,463 i F1, bak PropMem på 0,550, men over dobbelt så høyt som hans egen fullkontekst-kjøring med GPT-4.1 på 0,197. LoCoMo, med 1986 spørsmål, gir 0,533. Svakheten ligger i utpakkingen: faktaene ble som regel aldri hentet ut.

Nøkkeltall
0,579
F1 på kunnskapsoppdatering, mot 0,528 for PropMem
0,707
F1 på LoCoMos felle-spørsmål, mot 0,509 for full kontekst
0,211
F1 på spørsmål over flere økter, mot 0,582 for PropMem
2700
tokens per spørsmål, mot 104 000 for full samtalehistorikk

Prosjektet har en MCP-server, så agenten kan bruke Lemmalog direkte, og kildekoden er publisert på GitHub. For deg som lar en agent jobbe i timevis på samme problem, er poenget ikke et større kontekstvindu, men at et faktum du motbeviser river med seg konklusjonene som hang i det.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter