Hopp til hovedinnhold
Tilbake
Modell 3 min · Kilde: Hugging Face

Alibaba slipper Qwen3.8 med åpne vekter: 2,4 billioner parametere totalt

KI Takeaway KI-generert · kan inneholde feil

Last ned Qwen3.8-2.4T-A95B bare hvis du har maskinvaren: Alibaba slipper for første gang en modell i Max-klassen med åpne vekter, 2,4 billioner parametere totalt og 95 milliarder aktive per token.

Modellen lagrer 2,4 billioner parametere, men bruker bare 95 milliarder av dem på hvert eneste token. Den kontrasten definerer Qwen3.8-2.4T-A95B, som Alibabas Qwen-team har lagt ut på Hugging Face, og som teamet selv beskriver som første gang en modell i Qwen-Max-klassen slippes åpent.

Under ligger en sparsom mixture-of-experts med 92 lag og 512 eksperter, der 10 rutede eksperter og én delt ekspert er aktive om gangen. Lagene veksler mellom Gated DeltaNet og Gated Attention i et mønster som gjentas 23 ganger, og modellen er trent med multi-token-prediksjon. Kontekstvinduet er 262 144 tokens nativt og kan utvides til 1 010 000. Tenkedybden styres med parameteren reasoning_effort, mens preserve_thinking tar vare på resonnementet fra tidligere meldinger i samtalen.

Det nedlastbare sjekkpunktet er smalere enn den betalte versjonen. Vektene er tekst-bare, uten bilde- eller videoinngang, og modellkortet oppgir at Qwen3.8-Max hos Qwen Cloud i tillegg gir synsinngang, mulighet for å slå av tenkemodus, innebygde verktøy og 1 million tokens kontekst som standard. Lisensen heter qwen3.8-max og er Qwens egen, ikke Apache eller MIT.

Benchmarktallene på modellkortet gjelder Qwen3.8-Max, ikke det åpne sjekkpunktet, og de er kjørt av Qwen selv. Der scorer Qwen3.8-Max 86,6 på Terminal Bench 2.1, mot 84,6 for Opus 4.8 og 88,8 for GPT-5.6 Sol i max-modus. På SWE-bench Pro snur bildet: 67,7 mot 80,0 for Fable 5 og 69,2 for Opus 4.8. Forrige generasjon, Qwen3.7-Max, lå på 74,5 på Terminal Bench, så spranget innad i Qwen-familien er større enn avstanden opp til toppen.

Det praktiske spørsmålet for deg som kjører lokalt er hvor mye lagring og minne dette faktisk krever. Unsloth har lagt ut GGUF-versjoner der hele BF16-settet er 140 filer på til sammen rundt 4,9 TB. Den hardeste kvantiseringen deres, UD-Q1_0, presser det ned til 397 GB, mens UD-IQ2_XXS lander på 657 GB og UD-IQ4_XS på 1,3 TB. Selv den minste varianten forutsetter altså en maskin med godt over 400 GB samlet RAM og VRAM, og du betaler for komprimeringen i presisjon.

Vektene fungerer med Hugging Face Transformers, vLLM, SGLang og TokenSpeed. Kvantiserte varianter fra andre enn Unsloth ligger allerede ute, blant annet flere NVFP4-versjoner og en MXFP4-versjon fra AMD.

Hva bør du gjøre?

  1. Regn ut lagringsplassen før du starter nedlastingen. Selv den minste kvantiseringen er 397 GB, og BF16-settet kommer som 140 separate filer.
  2. Bruk Qwen3.8-Max via Qwen Cloud hvis du trenger bilder eller å slå av tenkemodus. Det åpne sjekkpunktet dekker ikke de tilfellene.
  3. Les lisensfilen i repoet før kommersiell bruk. Qwen3.8-max-lisensen er Qwens egen, og vilkårene er ikke de samme som i en standard åpen lisens.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter