Qwen3.6-35B-A3B er ute: 3B aktive parametere scorer 81,7 på MMMU og slår Claude Sonnet 4.5
søndag 19. april · KI-generert · Kilde: Daily AI Feed
Alibaba åpner Qwen3.6-35B-A3B under Apache 2.0, og sparse-MoE-designet gir Claude Sonnet 4.5-rivaliserende tall med kun 3 milliarder aktive parametere per token.
Hva skjer når MoE-modeller aktiverer under 10 prosent av parameterne sine per token? Qwen3.6-35B-A3B gir et svar. Alibabas Qwen-team publiserte modellen under Apache 2.0, med 35 milliarder totale parametere og 3 milliarder aktive. MoE-laget har 256 eksperter der bare 8 rutede og 1 delt aktiveres per token, og inferenskostnaden følger de 3 milliarder aktive, ikke de 35 totale.
Tallene på kodingbenchmarks gjør den spesiell. På SWE-bench Verified scorer den 73,4, mot 70,0 for forgjengeren Qwen3.5-35B-A3B og 52,0 for Gemma 4-31B. Terminal-Bench 2.0 gir 51,5 — høyest i sammenligningen, foran både Gemma 4-31B (42,9) og eldre Qwen-varianter. Intern benchmark QwenWebBench går fra 978 til 1397 mellom versjonene, og fremhever frontend-kode som største sprang.
«Parameter-effektivitet betyr mer enn rå modellstørrelse.» — oppsummering fra Qwen-teamet, via DailyAIFeed
På syn holder den følge med dense frontier-modeller. MMMU-scoren er 81,7, over Claude Sonnet 4.5 (79,6) og Gemma 4-31B (80,4). På RealWorldQA scorer den 85,3, mot Sonnet 4.5 sine 70,3. For video er tallet 83,7 på VideoMMMU, også over Sonnet 4.5 (77,6).
Kontekstvinduet er native 262 144 tokens og kan utvides til 1 010 000 tokens med YaRN-skalering. En ny funksjon kalt Thinking Preservation lar agenter beholde tenkespor fra tidligere meldinger fremfor å regenerere dem. Det kutter token-forbruk på lange agent-sesjoner der samme resonnement dukker opp igjen.
Hva bør du gjøre?
- Bygg modellen lokalt med SGLang, vLLM eller Hugging Face Transformers; alle tre er støttet ved lansering.
- For kodingsagenter, test med
enable_thinking: falsenår du vil ha direkte svar, og på når du vil ha resonnement først. - Aktiver
preserve_thinkinghvis agenten din gjør flere turer med beslektet resonnement; det reduserer token-forbruk.
Bakgrunn
Arkitekturen kombinerer Gated DeltaNet som billig lineær oppmerksomhet med tradisjonell Grouped Query Attention (GQA), der 16 Q-hoder deler bare 2 KV-hoder for lavere KV-cache-trykk under inferens. 40 lag totalt, med et mønster på 10 blokker à tre DeltaNet+MoE og én GQA+MoE.