slotstream lar en 48 GB-Mac kjøre en 104 GB-modell via SSD-streaming
Strømmer en 104 GB stor MoE-modell fra SSD slik at en Mac med 48 GB minne kjører den på rundt 12 tokens i sekundet.
Vektene til Qwen3.8-Flash-Next veier 103,8 GB fordelt på 24 filer. Maskinen slotstream er målt på, en M5 Pro, har 48 GB. Prosjektet lukker gapet ved å la nesten hele modellen ligge på disken og bare hente inn det hver token faktisk bruker. Det er én Swift-binær uten Python, og den svarer på Ollama- og OpenAI-protokollen på port 11434, så verktøyene du allerede har peker rett inn i den.
Mekanikken er verdt å forstå før du laster ned 100 GB. Modellen er en mixture of experts med 512 eksperter per lag, og bare 10 av dem er aktive per token. Den tette stammen på 3,8 GB blir liggende i minnet hele tiden, mens 68 GB rutede eksperter og en n-gram-tabell på 32 GB leses med pread inn i et felles sett cache-slots som alle de 48 lagene deler. Varme lag låner slots fra kalde.
Den åpenbare snarveien virker ikke, og prosjektets README forklarer hvorfor:
«MLX kan ikke materialisere en del av en minnemappet tensor: et top-10-oppslag evaluerer alle 512 ekspertene i det laget, så en mmap-vei laster rundt 100 GB og dør.» — slotstreams README
Hastigheten følger hvor mye minne du gir den, og tallene kommer fra slotstream doctor --sim-ram N, så du kan reprodusere dem selv:
Grensene er tydelige. Versjon v0 kjører nøyaktig én modell, qwen3.8-flash-next:4bit, og du trenger Apple Silicon, macOS 14 eller nyere og rundt 110 GB ledig disk. Disken biter først: en Mac med 512 GB er det realistiske minimumet. Prompten er den trege aksen, ikke dekodingen. 8000 tokens venter omtrent ett minutt på første token på en 48 GB-maskin og over tre minutter på en 16 GB. I 0.2.0 klarer heller ikke Ollama-CLI-en å koble seg til, fordi forespørslene bærer felter den strenge valideringen avviser. curl, Open WebUI og OpenAI-SDK-ene virker i dag.
Til gjengjeld er det ett løfte prosjektet holder hardt på:
«Cache-størrelsen endrer hastigheten, aldri utdataen.» — slotstreams README
Grådig dekoding gir byte-identisk resultat med 4 GB cache og med 24 GB, og likheten er en stående test i akseptansesuiten. Lisensen er MIT, og vektene ligger under Qwens fellesskapslisens.
Hva bør du gjøre?
- Kjør
slotstream doctorfør du laster ned noe. Den skriver ut planen for maskinen din og om disken har plass til vektene. - Regn på nedlastingen: 103,8 GB over åtte TCP-forbindelser målte 112 MB/s og 16 minutter på en 1 Gbit/s-linje, rundt 2 timer og 20 minutter på 100 Mbps, og ni timer på 25 Mbps.
- Bruk curl, Open WebUI eller OpenAI-SDK-en i stedet for
ollama runinntil rettelsen påmainer ute i en utgivelse.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.