Google TurboQuant: KV-cache-kompresjon kutter minnebruk 6x uten retrening
fredag 1. mai · KI-generert · Kilde: AI Pressa
Innholdet er KI-generert og kan inneholde feil. Sjekk originalkilden.
Google komprimerer KV-cachen 6x med to grep: PolarQuant og QJL. Ingen retrening, men fortsatt forskningskode. ICLR-papiret kommer denne måneden.
Hva betyr dette i praksis
For deg som kjører lokale modeller, er KV-cachen ofte det som spiser minnet på lange kontekster. TurboQuant peker på en vei der du kan kjøre lengre kontekst på samme rigg uten kvalitetstap. Inntil koden er ute, er det verdt å følge med på llama.cpp og vLLM — det er der teknikker som dette først blir praktiske. Caveat fra Merrill Lynch er reell: store labs bruker effektivitetsgevinster på å skalere videre, ikke på å gi deg gratis VRAM tilbake.