Hopp til hovedinnhold

Onsdag 7. oktober

 Tilbake Google 1 min 14.16

Google TurboQuant: KV-cache-kompresjon kutter minnebruk 6x uten retrening

fredag 1. mai · KI-generert · Kilde: AI Pressa

Innholdet er KI-generert og kan inneholde feil. Sjekk originalkilden.

Google komprimerer KV-cachen 6x med to grep: PolarQuant og QJL. Ingen retrening, men fortsatt forskningskode. ICLR-papiret kommer denne måneden.

Hva betyr dette i praksis

For deg som kjører lokale modeller, er KV-cachen ofte det som spiser minnet på lange kontekster. TurboQuant peker på en vei der du kan kjøre lengre kontekst på samme rigg uten kvalitetstap. Inntil koden er ute, er det verdt å følge med på llama.cpp og vLLM — det er der teknikker som dette først blir praktiske. Caveat fra Merrill Lynch er reell: store labs bruker effektivitetsgevinster på å skalere videre, ikke på å gi deg gratis VRAM tilbake.

Pulsen · norske KI-nyheter for deg som bygger. Sakene er KI-generert fra originalkilden, som alltid lenkes.