Hopp til hovedinnhold
Tilbake
Modell 2 min · Kilde: Hacker News

quantprobe kjører 110B-modell på 16 GB RAM, men bare 0,19 tokens i sekundet

KI Takeaway KI-generert · kan inneholde feil

Måler hvor store modeller en 2016-PC faktisk klarer, og lander på 19,3 tokens i sekundet for en 30B-modell mot 0,19 for en 110B strømmet fra SATA-disk.

Maskinen bak prosjektet quantprobe er en Intel i5-7600K fra 2017 med GTX 1060 på 6 GB, 16 GB DDR4 og en SATA-SSD. Utvikleren Federico Ts har brukt den til å måle hvor bitene bør ligge når en modell ikke får plass i VRAM, og hevder at plasseringen betyr mer enn antall bit. Alle tallene i prosjektet er målt på denne ene maskinen og publisert med logger, så les dem som ett grundig datapunkt, ikke som en uavhengig benchmark.

Show HN-tittelen lover GLM-4.5-Air på 110 milliarder parametere på 16 GB RAM, og det stemmer bokstavelig. Hastigheten er 0,19 tokens i sekundet strømmet fra SATA-disken, altså rundt ett ord hvert femte sekund. Det er demo, ikke arbeidsflyt. Den brukbare målingen i samme oppsett er Qwen3-30B-A3B på 19,3 tokens i sekundet med hybrid plassering, der ekspertlagene serveres fra CPU mens resten ligger på kortet.

Det metodisk interessante er at prediksjonene ble skrevet ned før målingene. Utvikleren forhåndsregistrerte 0,2 til 0,3 tokens i sekundet for 110B-strømmingen og fikk 0,19, og anslo cirka 19 for 30B-hybriden og fikk 19,30 med et standardavvik på 0,88. Et kontrolleksperiment på Gemma 4 12B viser poenget skarpest: to GGUF-filer med identisk størrelse ligger 2,25 perpleksitetspoeng fra hverandre, 12,27 mot 10,02, fordi bitene er fordelt ulikt over lagene.

Prosjektet leverer en kalkulator og en probe som kvantiserer ett FFN-bånd om gangen for å finne det skjøre laget, pluss ferdige llama.cpp-oppskrifter. Verktøyet krever llama.cpp for alt annet enn planlegging.

Nøkkeltall
19,3 tok/s
Qwen3-30B-A3B med hybrid plassering på 2016-maskinen
0,19 tok/s
GLM-4.5-Air på 110B strømmet fra SATA-disk
1,5 tok/s
forventet 110B-hastighet med NVMe i stedet for SATA, ifølge prosjektets egen modell

Hva bør du gjøre?

  1. Kjør «quantprobe plan» mot en GGUF-fil før du laster ned en modell. Den anslår hastighet og minnetilpasning uten at llama.cpp er installert.
  2. Sjekk om XMP står på i BIOS. Å gå fra 2133 til 3000 MT/s ga 52 prosent på tett dekoding og 32 prosent på MoE i disse målingene.
  3. Får du en MoE-modell til å gå tregere med GPU enn uten, prøv å servere ekspertlagene fra CPU med «-ot "exps=CPU"».

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter