Hopp til hovedinnhold
Tilbake
Modell 2 min · Kilde: XDA Developers

To DGX Spark-maskiner matcher nå skyen på DeepSeek V4 Flash

KI Takeaway KI-generert · kan inneholde feil

Koble to DGX Spark-bokser med tensorparallellisme, så kjører DeepSeek V4 Flash i native FP8 på 36 til 41 tokener i sekundet i stedet for 10 til 14 på 2-bits vekter.

Forskjellen ligger ikke i regnekraften, men i hvor mange byte hver maskin må lese per token. XDA Developers kjørte først hele 284-milliarders-modellen på én Lenovo ThinkStation PGX med ds4-motoren, og måtte presse de rutede ekspertene ned til 2 bit for å få vektene inn i 128 GB. To DGX Spark-bokser har 128 GB unified memory hver, koblet med ConnectX-7 på opptil 200 Gbps med RDMA, og deler modellen i to. Hver node strømmer bare sin egen halvdel ut av lokalt minne, så begge 273 GB/s-bussene jobber samtidig i stedet for at den ene venter.

Prefill er der hoppet er størst. XDA måler 1 300 til 1 900 tokener i sekundet mot noen få hundre på ett kort, og med DeepSeeks egen DSpark-sjekkpunkt, som har spekulative dekodingslag bakt inn, topper genereringen på 76 tokener i sekundet på kode. Hele oppsettet står på et skrivebord og trekker aldri over 272 watt.

Skaleringen stopper likevel godt før dobbel ytelse, og grunnen er modellen, ikke maskinvaren. V4 Flash bruker Multi-Head Latent Attention med ett eneste key-value-hode, så KV-cachen replikeres på begge nodene i stedet for å splittes. På en testprompt på 2 048 tokener merkes det knapt. På de 100 000 tokenene folk faktisk kjører agenter med, leser begge maskinene hele cachen på hvert eneste token uten å få noe igjen for boks nummer to.

«Det er ikke et plug-and-play-oppsett. Du må gjøre mye research for å finne ut hva som virker» — XDA Developers

Det viktigste her er kvantiseringen, ikke tokenraten. 2 bit er omtrent så stramt vekter kan presses før modellen begynner å skli, og XDA så det selv i lange kontekster. Med to bokser slipper du kompromisset: du kjører den samme FP8-modellen DeepSeek selv serverer, lokalt, uten at et token forlater rommet.

Hva bør du gjøre?

  1. Bruk DSpark-sjekkpunktet og containerbildet som følger med, ikke stock vLLM. Stock-bygget hopper over oppvarmingen av sparse-MLA-stien på GB10, og da JIT-kompileres kjernene midt i genereringen.
  2. Mål på den kontekstlengden du faktisk bruker. Gevinsten fra node nummer to krymper når KV-cachen vokser, så en benchmark på 2 048 tokener overselger oppsettet kraftig for agentbruk.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter