Hopp til hovedinnhold

Onsdag 7. oktober

 Tilbake LLM 2 min 12.14

Zero-Mem kutter LLM-kall i agentminnet, 57,6 prosent raskere

onsdag 5. august · KI-generert · Kilde: Hacker News - Newest: ""AI" "LLM" "Claude""

Innholdet er KI-generert og kan inneholde feil. Sjekk originalkilden.

Fjerner Zero-Mem alle LLM-kall fra agentens minneoperasjoner og måler 57,6 prosent lavere tidsbruk enn den raskeste baselinen.

Bygger du en agent som skal huske noe over tid, betaler du som regel tokens for selve huskingen. De vanlige minnesystemene kaller en modell for å oppsummere samtaler, skrive minnenotater og velge ut hva som skal hentes frem igjen. Kostnaden løper hver gang agenten brukes, og oppsummeringene har en bieffekt: detaljer som ble utelatt eller slått sammen, er borte for godt.

Zero-Mem, et arbeid lagt ut på arXiv 31. juli, spør om strukturert minnetilgang trenger generering i det hele tatt. Svaret forfatterne lander på er nei. Ingen steg utenfor det avsluttende spørsmålssvaret kaller en LLM eller bruker LLM-tokens, verken inn eller ut. Encoder-beregning føres separat i regnskapet, så det er ikke gratis, men det er ikke modellkall.

I stedet beholder systemet de originale interaksjonssporene som kilde og organiserer dem på to måter samtidig: en entitet- og kontekstgraf som viser sammenhenger på tvers av samtaler, og et tidshierarki som bevarer nærhet i samtalen og tilstanden i økten. For hvert spørsmål vektes de to synene mot hverandre, det hentes fra begge, og strukturen følges videre for å finne støttende relasjoner eller omkringliggende kontekst. En deterministisk kalibrering kaster først motstridende bevis.

«Bare den avsluttende leseren for spørsmålssvar kaller en LLM.» Forfatterne, i sammendraget

Målingen er gjort med samme lesermodell og samme kontekstbudsjett som sammenligningsgrunnlaget, noe som gjør 57,6-tallet mer troverdig enn en ren gjennomstrømningssammenligning. Ablasjonsstudier støtter at begge synene bidrar.

Forbeholdet er at dette er en preprint. Artikkelen er ikke fagfellevurdert, koden slippes først etter fagfellevurdering, og alle tallene er forfatternes egne på benchmarks de har valgt. For deg som bygger agenter er poenget likevel arkitektonisk: hvis minnehenting kan gjøres med indeksering og traversering fremfor generering, flytter kostnadskurven for langtkjørende agenter seg fra tokens til CPU.

Pulsen · norske KI-nyheter for deg som bygger. Sakene er KI-generert fra originalkilden, som alltid lenkes.