DFlash 2 gir 21 prosent flere tokens per verifiseringsrunde
Bytt til DFlash 2-drafteren hvis du serverer Qwen3.8-27B eller Muse Glimmer og vil ha rundt en femtedel flere tokens per verifiseringsrunde.
Der klassisk spekulativ dekoding lar en liten utkastmodell gjette ett token av gangen, gjettet den første DFlash-versjonen hele blokken i én parallell runde. Problemet med den snarveien er at hver posisjon blir plausibel for seg selv uten at blokken henger sammen, og en usammenhengende blokk kappes ved verifisering. DFlash 2, som Inco AI la ut denne uken, fikser det uten å gi opp ett-pass-designet.
Løsningen er todelt. En lettvekts stivelger beholder de 16 beste kandidatene per posisjon og skårer hvert nabopar, slik at et greedy-søk kan gå den beste stien gjennom kandidatene. Den koster 2,0 millioner parametere og 0,6 prosent latens, og slår den konkurrerende DSpark-korreksjonen med rundt 40 ganger færre parametere. I tillegg settes en to-taps dynamisk dybdevis konvolusjon inn før og etter hvert oppmerksomhets- og feedforward-lag. Den håndterer avhengighetene inne i blokken, som ellers forfaller mot slutten, og gjør en femlags DFlash nesten like god som en femtenlags for 3 prosent flere parametere.
Til sammen løfter de to grepene snittet for akseptlengde fra 4,92 til 5,97 tokens over GSM8K, MATH-500, HumanEval, MBPP og MT-Bench. Utdataene er beviselig uendret: dette er hastighet, ikke en kvalitetsavveining.
Inco AI slapp samtidig to draftere, én for Qwen3.8-27B og én for Metas Muse Glimmer, der de måler 3,1 til 4,6 ganger gjennomstrømningen av autoregressiv dekoding. DFlash-modellene har passert 3,5 millioner nedlastinger på Hugging Face siden januar og kjører i SGLang, vLLM, TensorRT-LLM og llama.cpp.
Hva bør du gjøre?
- Serverer du Qwen3.8-27B lokalt, pek drafteren mot
incoai/Qwen3.8-27B-DFlash2og mål akseptlengde før og etter. Gevinsten er størst ved lav batchstørrelse. - Bruker du oMLX, sett DFlash til aktivert, blokkstørrelse 5 og verifiseringsmodus
dflashi Model Manager, med kvantisert drafter. - Kjører du allerede DSpark eller modellens egen MTP-sti, mål selv. Inco AI trente baselinjene sine, så tallene er deres egne.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.