ByteShapes kvanter av Qwen3.8 27B: 13,1 GB gir 99,63 prosent av BF16
Velg ByteShapes IQ4_XS på 13,1 GB når kvaliteten teller mest, og IQ3_S på 11,0 GB når den ikke får plass.
Fire dager etter at Qwen 3.8 27B kom ut 14. august publiserte ByteShape en hurtigrunde de kalte ShapeLearn-Lite: mindre optimaliseringsbudsjett, færre sjekker, kortere venting. Nå er den fulle ShapeLearn-kjøringen ferdig og benchmarket mot Lite-settet og konkurrentene. Fem GGUF-modeller fra 2,56 til 3,84 bits per vekt ligger alle på den målte fronten for kvalitet mot hastighet i samtlige seks GPU-sammenligninger, fra RTX 5060 Ti på 16 GB til RTX Pro 6000 på 96 GB.
Anbefalingen ByteShape selv gir er IQ4_XS på 3,84 bpw: 13,1 GB, 99,63 prosent av BF16-modellens samlede benchmarkscore, og 93,7 tokens i sekundet på RTX 5090. Får den ikke plass sammen med konteksten du trenger, er IQ3_S på 3,23 bpw alternativet. Den tar 11,0 GB, holder 98,72 prosent og er raskere. Minstemodellen på 2,56 bpw faller til 93,04 prosent.
Det mest nyttige i rapporten er forklaringen på hvorfor den forrige rangeringen tok feil. ByteShape målte Lite-modellene mot Unsloths Dynamic v3 med KLD, altså avviket mellom kvantmodellens tokenfordeling og BF16-referansen, og Unsloth så bedre ut. Benchmarkene sa noe annet: Unsloths UD-IQ3_S har rundt 20 prosent lavere KLD enn den minste Lite-modellen, 0,028759 mot 0,035875, men scorer 95,55 prosent av BF16 mot Lite-modellens 97,33.
«Poenget er ikke at KLD er ubrukelig. Det er at en rangering etter troskap ikke er en rangering etter oppgaveytelse.» — ByteShapes rapport om Qwen 3.8 27B
ByteShape har samtidig endret hvordan de regner KLD: bare på svartokens, ikke promptet, og bare på tokens som faktisk kan bli samplet, topp 20 til 60 på hver posisjon. Halen teller ikke lenger med. Sammenligningene inkluderer også AtomicChat, Bartowski, ISTA-DASLab og Prism-MLs Ternary Bonsai 2. Bonsai-modellene er de raskeste og minste punktene på hver eneste GPU, på 1,77 og 2,14 bits per vekt, men ByteShape måler dem til 91,4 og 91,7 prosent av BF16, under ByteShapes egen minstemodell på 93,04. Bonsai krever dessuten en egen build av llama.cpp, siden standardbygget ikke kjører dem.
Spekulativ dekoding økte gjennomstrømningen for alle fem modellene på alle seks GPU-ene, med begge metodene ByteShape testet. DFlash2 nådde 1,34 til 2,10 ganger baseline, MTP 1,28 til 1,66. Forskjellen ligger i hva de koster: MTP-draft-hodet ligger allerede i hver GGUF og legger rundt 250 MB til modellen, mens DFlash2 krever en egen draftmodell som tar 1,1 GB ekstra GPU-minne og llama.cpp b10658 eller nyere. DFlash2 støtter heller ikke bildeinput i llama.cpp, så velger du den, gir du opp multimodaliteten.
Hva bør du gjøre?
- Har du 16 GB VRAM eller mer: start med IQ4_XS og mål om konteksten du trenger får plass ved siden av vektene.
- Slå på MTP først. Draft-hodet ligger i GGUF-en, legger rundt 250 MB til modellen og gir 1,28 til 1,66 ganger farten uten å ofre bildeinput.
- Skal du bruke kvantiseringsmålinger til å velge modell: se på benchmarkscore i tillegg til KLD. ByteShapes eget eksempel viser at de to kan peke i hver sin retning.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.