Hopp til hovedinnhold
Tilbake
Verktøy 2 min · Kilde: Mooncake (GitHub)

Mooncake v0.3.12 flytter KV-cachen ut på nettverks-SSD

KI Takeaway KI-generert · kan inneholde feil

Åpner Mooncake Store for NVMe-over-Fabrics, slik at KV-cachen kan ligge på nettverkstilkoblede SSD-er i stedet for bare i GPU- og vertsminne.

Når du serverer en LLM med lang kontekst, er det KV-cachen som spiser minnet. Hver aktive samtale holder på en cache som vokser med kontekstlengden, og når minnet tar slutt må serveren enten kaste cachen og regne på nytt, eller avvise forespørselen. Mooncake, serveringsplattformen Moonshot AI bygde for Kimi og la ut som åpen kildekode, angriper dette ved å gjøre cachen til et eget lagringslag på tvers av noder. Med versjon 0.3.12, publisert på GitHub 23. juli, blir NVMe-over-Fabrics et fullverdig nivå i det laget.

Arbeidet er delt i fire pull requests. Først kom metadata og kontrollplan på master-siden, så en SPDK-basert worker pool for asynkron I/O mot NoF-segmenter, deretter ruting av NoF-replikaer gjennom de vanlige put- og get-kallene i klienten. Siste del la til deployment-verktøy, Python-bindinger, SPDK-målopprettelse og e2e-tester. Rekkefølgen er poenget: en replika på nettverks-SSD velges, skrives, leses og trekkes tilbake gjennom samme klientflyt som en replika i RAM, ikke gjennom et eget sidespor du må kalle spesielt.

Releasen rydder også i det lokale SSD-sporet. Standalone-tjenesten MooncakeStoreService kunne ikke bruke lokal SSD-offload i det hele tatt fordi konfigparsingen manglet feltene. Nå leses enable_ssd_offload og ssd_offload_path både fra JSON-fil og fra miljøvariablene MOONCAKE_OFFLOAD_ENABLED og MOONCAKE_OFFLOAD_FILE_STORAGE_PATH. Promotering fra L2 til L1 ved cache-treff har fått Prometheus-metrikker under prefikset master_promotion_, pluss en max_per_heartbeat-knapp som tidligere var hardkodet.

Release-notatet inneholder ingen publiserte ytelsestall for NoF-stien. Til gjengjeld følger det med et nytt modulært KVCache-lagringsbenchmark, så tallene må du foreløpig produsere selv. Prosjektet ligger på rundt 6 000 stjerner på GitHub, og forrige funksjonsrelease, 0.3.11, kom 21. mai. En rettelsesrelease, 0.3.12.post1, fulgte 25. juli.

Hva bør du gjøre?

  1. Kjører du vLLM, SGLang eller LMDeploy mot Mooncake Store: verifiser at standalone-tjenesten din faktisk hadde SSD-offload aktivert, siden konfigfeltene ble ignorert før 0.3.12.
  2. Skal du teste NoF, bruk deployment-skriptene og registreringsverktøyene fra siste NoF-patch i stedet for å sette opp SPDK-målet for hånd.
  3. Skru på master_promotion_-metrikkene før du justerer max_per_heartbeat, ellers ser du ikke hvor promoteringene faller fra.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter