Simon Willison kjører Qwen3.8-Flash-Next lokalt på 72,5 gigabyte
Last ned Unsloths kvantiserte utgaver hvis du vil kjøre Qwen3.8-Flash-Next selv, for den minste veier 72,5 GB mot modellens 125 milliarder parametere i full presisjon.
125 milliarder parametere på papiret, 72,5 gigabyte på disken. Simon Willison har hentet ned Unsloths kvantiserte utgaver av Alibabas ferske Qwen3.8-Flash-Next og kjørt dem lokalt på en DGX Spark, og forskjellen mellom modellkortet og filen du faktisk laster ned er poenget for alle som vurderer å kjøre den hjemme.
Willison har prøvd to varianter så langt: UD-IQ1_S på 72,5 GB og UD-Q2_K_XL på 78,9 GB. Han sammenligner dem gjennom SVG-tegninger av pelikaner, én omgang fra hver kvantisering.
«Favoritten min så langt var den med xhigh reasoning effort fra UD-Q2_K_XL» — Simon Willison
Modellen er en multimodal mixture-of-experts der bare seks milliarder av de 125 er aktive per token, og Qwen-teamet beskriver den selv som en tidlig forhåndsvisning av arkitekturen i Qwen4. Det er den kombinasjonen som gjør lokal kjøring interessant: minnebehovet følger totalen, mens hastigheten følger de aktive parameterne.
Willison understreker at han fortsatt utforsker modellen. Sammenligningen hviler foreløpig på pelikan-tegninger og ikke på benchmarks, så les den som et førsteinntrykk av åpne vekter du kan laste ned og teste selv.
Hva bør du gjøre?
- Regn på minnet før du laster ned. 72,5 GB er filstørrelsen, ikke arbeidsminnet under kjøring, og kontekstvinduet kommer i tillegg.
- Start på UD-Q2_K_XL hvis du har plass til de 78,9 GB. Willison foretrekker den fremfor den mindre, og forskjellen er bare 6,4 GB.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.