TurboFieldfare kjører Gemma 4 26B i 2 GB RAM på 8 GB MacBook Air
Kjører TurboFieldfare Gemma 4 26B i rundt 2 GB RAM på en 8 GB MacBook Air ved å strømme ekspertvektene fra SSD i stedet for å laste hele modellen inn i minnet.
14,3 gigabyte modellvekter i to gigabyte RAM. TurboFieldfare er en kjøretid skrevet i Swift og Metal som holder den delte kjernen på 1,35 GB og KV-cachen i minnet, og henter bare de ekspertene hvert enkelt token faktisk trenger fra disk. Utvikleren måler 5,1 til 6,3 token i sekundet på en 8 GB M2 MacBook Air og 31 til 35 på en 24 GB M5 Pro.
Prosjektet er skrevet for én bestemt modell, ikke som et lag oppå MLX eller llama.cpp, og prisen for den spesialiseringen er tydelig i tallene. Samme modell på MLX gir 75 token i sekundet, men bruker 14 GB RAM.
«Vil du spare rundt 12 GB RAM til andre oppgaver og klarer deg med 35 token i sekundet, kan motoren min passe. Trenger du maksimal hastighet og fleksibilitet, bruk MLX» — gitpusher42, utvikleren bak TurboFieldfare
Nøkkelen er hvor mye av ekspertutvalget som gjenbrukes mellom token. Ruten endrer seg nesten hvert token, men rundt 40 prosent av ekspertene går igjen på neste token og 57 prosent innen to token, oppgir utvikleren. Med 16 ekspertplasser gir det omtrent 67 prosent cachetreff og kutter I/O fra 166 til 88 millisekunder per token på M2-maskinen.
Byttet fra mmap til pread var like avgjørende. En kald ekspert på 3,36 MB tok 10 millisekunder med mmap og 2,8 med pread, og i utviklerens egen simulering ga det 0,50 mot 4 token i sekundet. Innvendingen i Hacker News-tråden, som fikk 589 poeng, er at llama.cpp med mmap allerede kan kjøre en 26B-modell under 2 GB. Forskjellen ligger i at TurboFieldfare synkroniserer SSD-lesingene med GPU-arbeidet i stedet for å la operativsystemet hente sider reaktivt.
Spriket mellom M2 og M5 skyldes ikke bare kjøretiden. Utvikleren måler 83 millisekunder lesetid per token på M2 mot 12 på M5 Pro, og kommentatorer peker på at M5 har både raskere SSD, 50 prosent høyere minnebåndbredde og mer ledig RAM til sidebuffer. Kjør du med bare et par gigabyte fritt totalt, faller hastigheten trolig videre.
Hva bør du gjøre?
- Sjekk at maskinen kvalifiserer før du bygger. Kjøretiden krever Apple Silicon, macOS 26, Metal 4 og Swift 6.2, den er arm64 bare, og den er ubrukelig på Windows fordi den bygger på Metal og Apples delte minnearkitektur.
- Sett av rundt 15 GB lagringsplass. Installereren strømmer byte-områder fra Hugging Face og pakker dem om til sitt eget format underveis, så du slipper en ekstra full kopi av kildesjekkpunktet på disk.
- Hold den innebygde serveren på loopback. Den snakker OpenAI-kompatibel Chat Completions på 127.0.0.1:8080 uten autentisering og uten TLS, og utvikleren har ikke testet kjøringer lenger enn 30 minutter på en viftefri Air.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.