llama.cpp får NextN-dekoding for GLM-5.2: 37 prosent raskere generering
Flettet inn GLM-5.2s eget NextN-hode som utkastmodell i llama.cpp, målt til rundt 1,37 ganger raskere generering.
Spekulativ dekoding har lenge kostet deg en modell for mye: en liten utkastmodell som gjetter tokens, og hovedmodellen som verifiserer gjettene. Multi-token prediction fjerner den ekstra modellen ved å legge gjettehodet inne i selve modellen, og 29. juli ble det tilgjengelig i llama.cpp også for GLM_DSA-arkitekturen, ifølge pull request 25980 som ble flettet den morgenen.
Endringen er 366 linjer over fire filer og gjør nextn-tensorene i GLM-5.2s GGUF-filer brukbare via den eksisterende --spec-type draft-mtp-maskineriet. Innsenderen satindergrewal oppgir at GGUF-er fra fellesskapet allerede bærer disse tensorene og lastes uendret, så du trenger ingen ny nedlasting. Dette er den femte draft-mtp-implementasjonen i llama.cpp-treet, etter Qwen3.5, Step3.5 og Cohere2-MoE.
Målingene er gjort på 744B-A40B i IQ1_S-kvantisering på to RTX PRO 6000 Blackwell med 96 GB hver, altså ikke en hjemmemaskin. Greedy-oppsettet ga aksept 0,66 og en snittlengde på 2,98 aksepterte tokens per runde. I en to timer lang agentisk kodeøkt som nådde 264K kontekst rapporterer innsenderen aksept 0,86 og snittlengde 3,59, uten serverfeil.
Én ting bør du vite før du slår det på: greedy-utdata med MTP er ikke byte-identisk med MTP av. Batchet verifisering evaluerer flere tokens i én forward-pass, og en annen rekkefølge i flyttallssummeringen vipper argmax på tokens som ligger tett. Kvaliteten er den samme, men bit-reproduserbare kjøringer med fast seed er det ikke, og det gjelder rammeverket generelt, ikke denne porten.
Hva bør du gjøre?
- Oppdater llama.cpp til en build fra 29. juli eller senere og start
llama-servermed--spec-type draft-mtpmot GGUF-en du allerede har. - Behold standardverdiene n_max=3 og p_min=0. Aksepten ble målt til 0,83, 0,65 og 0,49 på de tre utkastposisjonene, og innsenderen foreslår ingen egen overstyring for denne modellen.
- Skru av spekulativ dekoding i evals der du sammenligner utdata byte for byte.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.