Åpen kjøremotor strømmer Kimi K3 sine 2,8 billioner parametere fra NVMe
Kjør en modell på 2,78 billioner parametere på en bærbar med 64 GB RAM, hvis du godtar en halv token i sekundet.
En modellcontainer på 982 GiB mot en maskin med 64 GB minne. Det regnestykket går opp i WASTE, en innebyggbar inferensmotor skrevet i C uten tredjeparts kjøretidsavhengigheter, som kjører hele Kimi K3 på en MacBook Pro M5 Pro med 0,49 til 0,54 tokens i sekundet. Prosjektet understreker at dette ikke er en destillert, beskåret eller redusert variant.
Trikset ligger i hva en mixture of experts faktisk bruker. Omtrent 4 prosent av vektene aktiveres per token, så nesten hele modellen står stille i ethvert øyeblikk. WASTE holder stammen residente i minnet, 27,28 GB, strømmer de valgte ekspertene rett fra disk og bruker resten av RAM som en avgrenset ekspert-cache. Ekspertene lagres som residual vektorkvantisering på 3,00 bit per vekt, og hvert ekspertoppslag er justert til å koste nøyaktig én lesing.
«Det interessante er ikke hastigheten, det er at hele greia er innenfor rekkevidde på én forbrukermaskin» — WASTE-dokumentasjonen
Motoren er validert lag for lag mot en PyTorch-referanse, og de endelige logitene stemmer til 3,6e-06. Lagringshastigheten er derimot ikke en detalj: hvert token leser 17,0 GB med eksperter. På intern SSD gir det 12,78 GB/s og modellen strømmer; over et USB-kabinett faller det til 0,94 GB/s og det samme tokenet tar tretten sekunder.
Vinduet der dette virker er smalt, og prosjektet dokumenterer det åpent. På testmaskinen er 46 GB budsjett toppen av kurven, 52 GB gir resultater som ikke lar seg reprodusere, og 58 GB er tjue ganger tregere fordi operativsystemet begynner å sidebytte ut cachen motoren trodde den styrte.
Hva bør du gjøre?
- Begynn med Kimi-Linear-48B. Samme motor og samme format kjører den fra en container på 19 GiB med 1,87 GiB gulv, på 10,7 tokens i sekundet. Det er den fornuftige måten å prøve WASTE på før du binder opp en terabyte.
- Regn på disken før K3. Containeren er 982 GiB, og konverteringen krever ytterligere 1,42 TB midlertidig plass som frigjøres etterpå. Containeren må ligge på intern NVMe.
- Ikke stol på et 32 GB-oppsett. Motoren nekter å starte under 29,05 GB ved 4K kontekst, men prosjektet er tydelig på at 64 GB er det reelle kravet.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.