Hopp til hovedinnhold
Tilbake
Modell 2 min · Kilde: The Decoder

Qwen3.8-Flash-Next aktiverer 6 av 125 milliarder parametere per token

KI Takeaway KI-generert · kan inneholde feil

Aktiverer 6 milliarder parametere per token av 125 milliarder totalt, og slår likevel Alibabas egen Qwen3.7-Plus på de fleste testene.

Alibabas Qwen-team har sluppet Qwen3.8-Flash-Next, en multimodal mixture-of-experts-modell teamet selv kaller en arkitekturforhåndsvisning av Qwen4. The Decoder rapporterer 125 milliarder parametere totalt, men bare seks aktiverte per token. I tillegg kommer 51 milliarder parametere i et nytt n-gram-embeddinglag, som lagrer vanlige ordgrupper som egne oppslag i en slags fraseordbok, og som kan ligge i vanlig system-RAM i stedet for på GPU-en.

Regnestykket er poenget. Qwen3.7-Plus har 397 milliarder parametere med 17 milliarder aktive, nesten tre ganger så mange som Flash-Next, og taper likevel. På agentisk koding scorer Flash-Next 58,7 på DeepSWE 1.1 og 62,5 på SWE-bench Pro, foran både DeepSeek-V4-Flash og Claude Opus 4.6. The Decoder beskriver gapet som enda større på kontoroppgaver: 73,9 mot DeepSeek-V4-Flash sine 45,1 på CoWorkBench, mens Qwen3.7-Plus ligger på 65,1 der. På JobBench scorer Flash-Next 55,7 mot 27,6 for Qwen3.7-Plus. Qwen-teamet oppgir at treningen kostet rundt en niendedel av det Qwen3.7-Plus kostet.

Kontekstvinduet er 262 144 tokens nativt og kan skaleres til én million med YaRN. Vektene ligger på Hugging Face og ModelScope, den tekniske rapporten på GitHub, og produksjonsversjonen kjører som Qwen3.8-Flash gjennom QwenCloud.

Nøkkeltall
0,16 dollar
per million input-tokens for Qwen3.8-Flash
0,47 dollar
per million output-tokens
2,00 dollar
hva flaggskipet Qwen3.8-Max koster per million input-tokens

Prisgapet på rundt tolv ganger mot eget flaggskip er den delen som treffer budsjettet ditt. Claude Opus 4.6 leder fortsatt på Humanity's Last Exam, og benchmarktall er ikke det samme som oppførsel i produksjon.

Hva bør du gjøre?

  1. Kjør modellen mot dine egne agent-løp før du stoler på tabellen. Kontoroppgaver er der gapet er størst, og også der benchmarks ligner minst på virkeligheten.
  2. Trenger du mer enn 262 144 tokens, må YaRN skrus på. Qwens eget modellkort peker på vLLM, SGLang og TokenSpeed som rammeverk med støtte, og advarer om at statisk YaRN kan koste kvalitet på kortere tekster.
  3. Regn på n-gram-laget før du henter vektene. De 51 milliarder parameterne kan ligge i system-RAM, men de skal fortsatt ligge et sted.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter