Qwen3.8 27B i 4 bit matcher fullmodellen: 17 gigabyte mot 55
Kutt Qwen3.8 27B til 4 bit uten målbart tap, men hold deg unna 1 bit.
Full BF16-utgave av Qwen3.8 27B veier 55 gigabyte. Unsloths Q4_K_M veier 17, får plass på et RTX 4090-kort med 24 gigabyte og har fortsatt rom til rundt 64 000 tokens kontekst. Piotr Migdał hos Quesma kjørte begge gjennom kunnskapstesten GPQA Diamond, instruksjonstesten IFBench og den agentiske kodetesten Terminal-Bench 2.1, og fant ingen forskjell han kunne måle.
Regningen forklarer hvorfor slike tall sjelden finnes. Migdał brukte rundt 3000 dollar på leide GPU-er hos Modal, med kort som L40S, H100 og H200, og en llama.cpp-bygg fra 16. august 2026 fordi eldre bygg ikke kjørte modellen. Han replikerte først Qwens offisielle tall for fullmodellen og brukte dem som referanse. Selv 2-bits UD-Q2_K_XL på under 11 gigabyte holdt stand på IFBench, men falt merkbart på Terminal-Bench og skrev rundt en fjerdedel flere tokens på oppgavene den løste.
Under det stuper det. Den beste 1-bits modellen havner rundt gjettenivå på GPQA Diamond, og lengre resonnering gjør det verre, fordi modellen oftere tenker seg tom for tokens og returnerer et tomt svar. Unsloth oppgir at UD-IQ1_S på 6,2 gigabyte beholder rundt 72 prosent av topp-1-treffsikkerheten. De siste 28 prosentene er tydeligvis de som løser oppgaver.
«Kvantisering bør omfavnes, ikke fryktes» — Piotr Migdał, Quesma
Hva bør du gjøre?
- Velg den største modellen som får plass i GPU-minnet sammen med konteksten du faktisk trenger, ikke den minste som så vidt kjører.
- Regn KV-cachen som egen post: Migdał kjørte F16-cache uansett kvantisering, rundt 2,3 gigabyte per 32 000 tokens.
- Sjekk effort-innstillingen før du skylder på kvantiseringen, for standarden er xhigh og de beste GPQA-resultatene krevde rundt 8000 resonneringstokens.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.