Kevin Lewis kjører hele KI-stacken sin lokalt på en M4 Pro Mac mini
Kjører en komplett lokal KI-stack på en Mac mini med 48 GB, delt mellom telefon, laptop og agent-backend over Tailscale.
Mac mini-en står på skrivebordet og er alltid på. Det er hele infrastrukturen Kevin Lewis beskriver i bloggposten han publiserte 1. september: en M4 Pro med 48 GB minne som betjener både agent-backenden hans, kodeassistenten og de kjappe spørsmålene han stiller fra telefonen. Oppsettet tok rundt 30 minutter.
Stacken er kort. oMLX er inferensserveren og lytter på port 8000. Qwen3.6-35B-A3B i 4-bit er hovedmodellen for alt som krever resonnering, og Gemma-4-E4B ligger ved siden av for enkle samtaler og formatering. Tailscale binder Mac mini-en, iPhonen og MacBooken sammen i et privat nett der ingenting er eksponert mot åpent internett. Hermes kjører som agent-backend på maskinen, med Telegram på telefonen og skrivebordsklienten på laptopen som to skall mot samme samtalehistorikk og ferdighetssett.
Begrunnelsen er den mest siterbare delen:
«Skyens APIer er leid grunn. De kan endre prisene, treffe bruksgrensene dine, eller bytte ut modellen som serveres bak kulissene når de vil.» — Kevin Lewis
Han skriver at han jevnlig maksimerte to abonnementer til 200 dollar i måneden og opplevde at kvaliteten varierte uten varsel. I tillegg trekker han fram datakontroll og det han kaller KI-suverenitet: en skymodell som blir regulert bort, tar arbeidsflyten din med seg.
Den delen som faktisk endrer hva du kan kjøre, er lesningen av modellnavnet. I Qwen3.6-35B-A3B betyr 35B totale parametere fordelt på 256 eksperter, mens A3B betyr at bare rundt 3 milliarder er aktive per token. I 4-bit legger modellen beslag på omtrent 20 GB på hans 48 GB-maskin, og etterlater 28 GB til kontekstvinduer og operativsystem. Gemma-4-E4B tar 2,4 GB. Til sammenligning trenger en tett 27B-modell i 4-bit rundt 14 GB, som er alt en MacBook Air med 16 GB har når du trekker fra macOS sine 6 til 8 GB. Da svelger den til SSD og blir smertefull. MoE-modellen på 35B ville derimot passet på samme maskin, fordi minnetrykket per token ligner en tett 6B-modell.
Kvalitetstapet er lite: 4-bits-kvantiseringen koster ifølge Lewis 1 til 2 poeng på de fleste benchmarker mot 16-bits utgangspunktet. Han peker også på at oMLX skriver KV-cachen til SSD, slik at en kodeagent som går tilbake til tidligere kontekst får den gjenopprettet på millisekunder i stedet for å regne den ut på nytt.
«Poenget er ikke å erstatte API-baserte modeller. Det er å dekke de 80 prosentene av forespørslene som ikke trenger GPT-5 eller Claude Opus.» — Kevin Lewis
Hva bør du gjøre?
- Sjekk den kvantiserte filstørrelsen, ikke parametertallet, før du laster ned. Trekk fra 6 til 8 GB for macOS og sett av 8 til 16 GB til kontekst hvis du planlegger lange samtaler.
- Se etter aktive parametere i modellnavnet. Et A3B-suffiks betyr at en 35B-modell oppfører seg som en langt mindre modell under inferens, selv om alle vektene ligger i unified memory.
- Legg inferensserveren bak Tailscale i stedet for å åpne en port. Da når telefonen og laptopen samme endepunkt uten at noe ligger ute.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.