Cursor åpner megakernelen som ga 41 prosent flere tokens i sekundet
Åpne Cursors MoE-megakernel og se at kommunikasjonen mellom GPU-er, ikke regnekraften, var flaskehalsen i treningen deres.
«Megakerner er døde», slo en av deltakerne fast i Latent Spaces Inference Engineering Masterclass denne uken. Argumentet var at ingen seriøs inferensleverandør kjører en håndfusjonert forward-pass på 67 000 linjer i produksjon, og at NVIDIAs kommende Rubin-arkitektur uansett fjerner mye av oppstartskostnaden som gjorde fusjonering verdt bryet. Samme uke la Cursor ut Mixture-of-Kittens på GitHub under Apache 2.0.
Mixture-of-Kittens, forkortet MoK, er en fullt deterministisk treningskernel for mixture-of-experts-lag, bygget for NVIDIAs NVL72-rack. Cursor skriver at MoE-laget kunne spise over halvparten av den totale treningstiden for kodemodellen Composer, fordi kommunikasjonen mellom GPU-ene ble den begrensende faktoren etter at selve regnestykket var optimalisert. I produksjon over flere NVL72-rack økte MoK gjennomstrømmingen 1,41 ganger. Målt på enkeltlag er den opptil 2,37 ganger raskere enn den raskeste offentlige baselinen for MXFP8-forward, og 1,58 ganger på BF16-backward.
«MoK smelter all MoE-kommunikasjon og beregning inn i én enkelt, fullt deterministisk kernel. Den driver nå Composer-trening på titusenvis av GPU-er» — Cursor, bloggposten om Mixture-of-Kittens
Det mest overførbare funnet handler om retning på dataflyten. Etablerte løsninger som DeepEP dytter tokens ut til mottakeren. Cursor målte begge retningene og fant at det å hente tokens gir opptil 29 prosent høyere NVLink-utnyttelse når ekspertene er ujevnt belastet, og at signaleringen som forteller at overføringen er ferdig faller fra 103 til 18 mikrosekunder når man henter i stedet for å dytte. Kombinasjonen de landet på er henting ved dispatch og dytting ved combine, som fjerner kryss-GPU-signalering helt.
MoK treffer MoE-lag av DeepSeek-V3-typen, arkitekturen bak blant annet GLM, Qwen og Kimi opp til K2.7. Kravene er harde: Blackwell SM100 eller SM103, PyTorch 2.10 og CUDA 13. Dette er ikke kode du kjører hjemme, men debatten om megakerner har nå målbare tall på begge sider, og målingene av push mot pull gjelder ethvert distribuert oppsett der små meldinger og ujevn last møtes.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.