Strata kjører Qwen3.8-Flash-Next med 125B parametere på et 12 GB-skjermkort
Kjør Qwens 125B-modell lokalt på et vanlig gaming-skjermkort ved å la Strata fordele ekspertene mellom GPU, RAM og SSD.
Modeller på størrelse med Qwen3.8-Flash-Next kjører normalt på servere med hundrevis av gigabyte grafikkminne. Det MIT-lisensierte prosjektet Strata får den til å skrive 94 tokens i sekundet på et RTX 5070 med 12 GB VRAM, en Ryzen 5 7600 og 64 GB RAM, ifølge prosjektets README på GitHub. Det gjelder den raskeste varianten, Q2_0. Den beste, IQ3_S, gir 53 tokens i sekundet på samme maskin, og et AMD RX 9070 XT med 16 GB leverer 60 tokens i sekundet med Q2_0.
Trikset er arkitekturen. Ifølge modellkortet fra Qwen-teamet har modellen 125 milliarder parametere, hvorav bare 6 milliarder er aktive per token, fordelt på 512 eksperter der 10 rutede og 1 delt brukes om gangen. Strata legger attention, routere og de mest brukte ekspertene på GPU-en. Alle 24 576 ekspertene på tvers av modellens 48 lag ligger i RAM, der prosessoren regner på resten samtidig med skjermkortet, og en n-gram-tabell på 28,8 GB leses fra SSD-en noen rader om gangen.
«Mer VRAM betyr mer enn en raskere GPU: hver ekstra GB rommer rundt 700 flere eksperter.» — Strata-dokumentasjonen, «How does Strata work?»
I tillegg bruker Strata modellens eget MTP-lag til å gjette opptil tre tokens som den store modellen sjekker i én omgang. Det gir svar 1,6 til 1,8 ganger raskere uten at innholdet endres. Strata eksponerer både et OpenAI-kompatibelt API og Anthropics Messages-API på port 8080, så Claude Code kan bruke modellen via ANTHROPIC_BASE_URL. Det følger også med en MCP-server.
Kravene er likevel høyere enn tittelen antyder: minst 32 GB RAM (64 GB for alle varianter), rundt 80 GB ledig disk og et NVIDIA RTX fra 20-serien og oppover eller et av de støttede AMD Radeon-kortene, med minst 12 GB VRAM. Første oppstart laster 35 til 55 GB inn i RAM, og PC-en kan fryse i ett til tre minutter. Strata svarer på én forespørsel om gangen, og Coder-varianten for 32 GB-maskiner har fjernet halvparten av ekspertene, noe som gir 91 prosent av fullmodellens SWE-bench Verified-score ifølge forfatterne.
Strata er MIT-lisensiert, men modellen følger Qwen Community License 1.0. Den krever egen lisens fra Qwen hvis du driver «Model as a Service» eller en KI-assistent for koding eller kontorarbeid kommersielt.
«Kravet gjelder ikke lisenstakerens interne bruk av programvaren.» — Qwen Community License 1.0
Prosjektet ble opprettet 24. september, har passert 8 800 stjerner og kom i versjon 0.1.38 natt til 3. oktober. GitHub-brukeren Niko1221 står for 420 av bidragene, så tempoet hviler i stor grad på én utvikler.
Hva bør du gjøre?
- Sjekk RAM før skjermkort: med 32 GB passer bare Coder-varianten, mens 64 GB åpner IQ2_XS og IQ3_S.
- Pek Claude Code mot
http://127.0.0.1:8080og test en agentflyt mot en 125B-modell uten API-kostnad. - Sett alltid
--api-keyhvis du åpner Strata for andre maskiner med--host 0.0.0.0, og les lisensen før du gir tredjeparter tilgang.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.