Hopp til hovedinnhold
Tilbake
Lokale-modeller 3 min · Kilde: GitHub

DeepSeek V4.1 Flash strømmes fra SSD på en 16 GB Mac mini

KI Takeaway KI-generert · kan inneholde feil

Strømmer de originale FP4- og FP8-vektene til DeepSeek V4.1 Flash fra SSD på en 16 GB Mac mini M1, uten ekstra kvantisering, til rundt 23 sekunder per token.

475 GiB med modellvekter og 16 GB minne. Det regnestykket skal egentlig ikke gå opp, men GitHub-brukeren atbender har publisert oppskriften og målingene som viser at DeepSeek V4.1 Flash likevel svarer på en Mac mini M1 med 8 CPU-kjerner, 8 GPU-kjerner og intern SSD på 1 TB. Kjøreren bruker det offisielle sjekkpunktet fra DeepSeek, fordelt på 48 safetensors-filer, uten ekstra kvantisering eller en mindre erstatningsmodell.

Trikset er å aldri laste hele modellen. Kjøreren leser safetensors-filene direkte fra disken med avgrensede lesekall og bygger ett transformerlag om gangen. For hvert token og hvert lag hentes bare de seks ekspertene ruteren velger, pluss de hashede radene som trengs fra de to store Engram-tabellene. Et avgrenset utvalg tette vekter holdes i cache mellom tokens, og FP4- og FP8-vektene dekodes underveis med mx.compile. Selve transformermatematikken kommer fra PipeNetworks MLX-port av modellen, mens repoet legger til strømmingen fra SSD og optimaliseringene.

«Dette er et uavhengig eksperiment, ikke DwarfStar eller en offisiell DeepSeek-runtime.» — atbender, i README-en til deepseek-v41-flash-mac-mini

Målingene viser hvor tregt det går. Med de optimaliserte innstillingene kom første token etter 108 sekunder, og hvert nye token tok 22,6 sekunder. Utgangspunktet var 128,3 sekunder og 30,7 sekunder per token. Gjenbruk av allokeringsbuffere, en cache på 4 GiB for tette vekter og kompilert dekoding kuttet tiden per token med rundt 26 prosent. Eksempelet på åtte tokens tar omtrent fire og et halvt minutt, og et fullt svar på 2048 tokens anslås til rundt 13 timer.

Minnet er den reelle grensen. MLX-telleren viste 5,65 GiB aktivt minne med cachen på 4 GiB, men den teller ikke filcachen i macOS eller andre programmer. Swap steg til rundt 1,8 GiB under den kjøringen, og til rundt 3,4 GiB med en cache på 6 GiB, for en liten ekstra gevinst. Forfatteren har heller ikke validert logits i full størrelse mot DeepSeeks produksjonsimplementasjon, og lang kontekst, bilder og verktøykall er ikke testet.

«Det er et tregt eksperiment, ikke et optimalisert serveringssystem.» — atbender, i samme README

Hva bør du gjøre?

  1. Sjekk at du har 550 til 600 GB ledig på en rask intern SSD før du laster ned, siden vektene alene tar rundt 510 GB og eksterne disker ikke er testet.
  2. Start med eksempelet på åtte tokens og flaggene --reuse-allocator, --dense-cache-gib 4 og --compile-dequant, og kjør med caffeinate så maskinen ikke går i dvale.
  3. Senk --dense-cache-gib til 2 eller 0 hvis minnetrykket blir høyt, og kjør aldri flere kopier samtidig på en maskin med 16 GB.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter