AMD åpner hvert treningssteg i Instella-MoE, men bare for forskning
Slipper en fullt åpen blandet-eksperter-modell der vekter, datablandinger og treningsoppsett fra hvert eneste steg ligger ute, men under en lisens som stopper kommersiell bruk.
2,8 milliarder parametere er alt Instella-MoE-16B-A3B aktiverer per token, av 16 milliarder totalt. AMD la sjekkpunktene ut på Hugging Face 23. juli og beskriver arkitekturen i en egen ROCm-blogg: 27 dekoder-lag, hidden size 2048, og to delte eksperter pluss seks rutede valgt fra 64 tilgjengelige per token.
Det uvanlige her er ikke modellen, men hvor mye AMD gir fra seg rundt den. Selskapet publiserer sjekkpunkter fra alle seks stegene i treningsløpet, fra pretrening på 7,1 billioner tokens via mid-trening og kontekstutvidelse fra 4K til 64K, til SFT, DPO og et avsluttende RL-steg. Alt er trent fra bunnen på AMDs egne Instinct MI300X- og MI325X-akseleratorer med ROCm-stacken og de åpne rammeverkene Primus og Miles.
«Vi slipper alle artefakter for Instella-MoE-modellen, inkludert modellvekter fra hvert treningssteg, treningskonfigurasjoner, datablandinger og kode» — AMD, ROCm-bloggen
To systemgrep bærer ytelsen. FarSkip-Collective overlapper kommunikasjonen som oppstår med ekspert-parallellisme mot selve regningen, og ga 12,7 prosent raskere pretrening. Ved servering med SGLang måler AMD opptil 39,2 prosent lavere tid til første token. Basemodellen snitter 76,7 på AMDs benchmark-oppsett, foran Moonlight-16B-A3B (76,2) og OLMo-3-7B (70,1), men bak Qwen3.5-4B-Base (79,5).
Haken står i AMDs egen lisensseksjon: vektene er lisensiert for akademisk bruk og forskning under en Research RAIL-lisens. «Fullt åpen» gjelder altså innsynet i oppskriften, ikke retten til å bygge produkt på modellen. Til gjengjeld er 2,8 milliarder aktive parametere lite nok til at fellesskapet allerede har lagt ut GGUF- og AWQ-INT4-kvantiseringer av Think-sjekkpunktet.
Hva bør du gjøre?
- Kjør Think-sjekkpunktet lokalt via en av fellesskapets GGUF-bygg hvis du vil teste 64K-konteksten på egen maskin, men les Research RAIL-vilkårene før du bruker resultatet i noe som tjener penger.
- Les datablandingene og treningskonfigurasjonene hvis du selv vurderer å trene en MoE-modell. Sjekkpunktene fra mellomstegene gjør det mulig å se hvor i løpet en evne faktisk dukker opp.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.