MusaCoder-27B løfter Qwen3.6 fra 67 til 93 prosent på KernelBench
Last ned MusaCoder-27B hvis du skriver GPU-kjerner for hånd: Moore Threads finjustering av Qwen3.6-27B går fra 67,2 til 93,2 prosent Pass@8 på KernelBench, målt av dem selv.
67,2 prosent. Det er hva basismodellen Qwen3.6-27B klarer på KernelBench i Moore Threads egen måling. Samme modell, etter selskapets etter-trening, lander på 93,2 prosent Pass@8 og 88,60 i snitt. Tabellen oppgir 87,2 for Claude Opus 4.7 og 85,6 for GLM-5.1 til sammenligning. Alle tallene er selvrapporterte og kjørt gjennom MooreEval, Moore Threads eget verifiseringsoppsett, så de bør leses som en påstand og ikke som en uavhengig måling.
Modellen gjør én ting: den skriver native CUDA- og MUSA-kjerner ut fra en PyTorch-referanseimplementasjon. Modellkortet er tydelig på at den ikke er ment for vanlig applikasjonskode. Belønningssignalet under forsterkningslæringen var faktisk kompilering, kjøring, korrekthetssjekk mot PyTorch-referansen, deteksjon av ulovlig ATen-fallback og målt kjøretid, ikke likhet med en fasitkode.
Vinklingen om at dette er Kinas første fullt selvutviklede kodemodell tåler en presisering. Etter-treningen kjørte i sin helhet på Moore Threads egne MTT S5000-GPU-er, og det er der poenget ligger: en komplett kjede fra kinesisk maskinvare til ferdig modell, uten Nvidia i løkka. Basismodellen er derimot Qwen3.6-27B fra Alibaba, ikke noe Moore Threads har trent fra bunnen av.
Vektene ligger som MooreThreads/MusaCoder-27B på Hugging Face under Apache 2.0, i bf16, med Transformers, vLLM og SGLang som anbefalte kjøremiljøer. Modellkortet advarer selv om at genererte kjerner alltid må kompileres og testes: feil i indeksering, grensehåndtering eller minnelayout gir gale svar eller ulovlige minneoppslag.
Hva bør du gjøre?
- Test mot din egen kjernesamling, ikke mot KernelBench. Tallene er selvrapporterte, og 27B i bf16 krever rundt 54 GB bare til vektene før du regner inn kontekst.
- Kjør genererte kjerner gjennom randomiserte korrekthetstester med flere former og datatyper før de får se produksjonsdata.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.