Unsloth kjører Kimi K3 lokalt, men minste kvantisering krever 595 GB disk
Gir Kimi K3 lokale Dynamic GGUF-er i Unsloth 0.1.51-beta, men minste kvantisering legger beslag på 595 GB diskplass.
595 GB er terskelen for å kjøre Moonshot AIs Kimi K3 på egen maskin med den mest aggressive kvantiseringen Unsloth tilbyr. Vil du ha tapsfri inferens, snakker vi 1,56 TB. Unsloth skriver det rett ut i egne utgivelsesnotater:
«Kimi K3 er en svært stor modell, så planlegg maskinvaren tilsvarende.» — Unsloth, utgivelsesnotater for 0.1.51-beta
Modellen bak tallene er en MoE-modell på 2,8 billioner parametere med 104 milliarder aktive, innebygd synsstøtte og et kontekstvindu på én million tokens. Den er ren tenkemodell, og Unsloth støtter lav, høy og maksimal resonneringsinnsats. Runtimen oppdager oppsett med flere GPU-er automatisk og kan flytte modellag ut i systemminnet, en forutsetning for at de laveste kvantiseringene lar seg kjøre i det hele tatt.
For de fleste er tallene over grensen for hva som står under skrivebordet, og da er resten av utgivelsen mer interessant enn K3. Unsloth kjører nå flere samtaler parallelt med fire llama-server-slots som standard, der verktøy, opplastinger og agenter holdes isolert mellom chattene. En ny Deep Research-modus lager plan, søker på nett, organiserer kildene og skriver en rapport med henvisninger, og den sjekker utkastet for udekkede påstander og selvmotsigelser før den skriver. AMD-støtten er utvidet til RDNA2, Radeon, Ryzen og Strix Halo, Intel Arc kommer inn via XPU, og DoRA ligger nå ved siden av LoRA og full finjustering.
Detaljen som treffer denne lesergruppen hardest er unsloth start --as-subagent, som lar Codex, Claude Code og Pi delegere deloppgaver til en lokal Unsloth-modell. Det gir en billig måte å flytte rutinearbeid vekk fra betalt API uten å bytte agentverktøy.
Hva bør du gjøre?
- Sjekk diskplass før du laster ned noe: selv UD-IQ1_S på 595 GB sprenger de fleste SSD-er med prosjektfiler på.
- Har du ikke maskinvaren til K3, oppgrader likevel for parallell chat og DoRA, som fungerer på modellene du allerede kjører.
- Kjører du Claude Code eller Codex, test
unsloth start --as-subagentmot en liten lokal modell og mål hvor mye API-bruk det faktisk flytter.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.