ggml 0.25.1 gir DeepSeek V4 42 prosent raskere prefill ved 131 000 tokens
Oppdater llama.cpp hvis du kjører DeepSeek V4 med lang kontekst på en Nvidia-GPU, for ggml 0.25.1 gir opptil 1,4 ganger raskere prefill ved 131 000 tokens.
På en Nvidia DGX Spark prefillet DeepSeek V4 172,75 tokens i sekundet ved 131 072 tokens kontekst før endringen, og 244,46 etter. Tallene kommer fra pull request 29298 i llama.cpp, der utvikleren am17an slår på igjen sparse flash attention for DeepSeek V4-prefill. Endringen ble slått sammen 23. september, og ggml-prosjektet pakket den inn i hotfix-utgivelsen 0.25.1 samme dag.
Bakgrunnen er en regresjon fra forrige uke. Ifølge PR 29298 var det PR 28770, som skrudde på sparse flash attention for Qwen4 20. september, som i praksis slo den av for DeepSeek V4 og GLM via en batch-avhengig betingelse. Fiksen legger en klemme på den betingelsen slik at DeepSeek V4-prefill aktiverer sparse-stien igjen, uten endring for decode. I tillegg er kjernen som skanner sparse-masken gjort raskere: fra 586 til 244 mikrosekunder for den batchede operasjonen ved 49 000 tokens kontekst.
Gevinsten avhenger helt av hvor lang konteksten er. Målingene er gjort med en IQ2_XXS-kvant på 2,06 bit per vekt:
Token-generering står stille på rundt 0,99x i alle målingene, og testmodellen qwen4exp A3B får 1,00x over hele linja. Utgivelsen har også to mindre fikser utenfor CUDA: Metal får de manglende f32 × bf16-kjernene, som retter depthwise convolution med bf16-vekter, og Vulkan får MMQ/MMV-kjerner for kvantiseringstypen IQ4_XS.
Hva bør du gjøre?
- Bygg llama.cpp fra en commit etter 23. september hvis du bruker DeepSeek V4 til lange dokumenter eller store kodebaser, der prefill er flaskehalsen.
- Mål med llama-bench på kontekstlengdene du faktisk bruker, for under 32 000 tokens viser PR-en ingen gevinst.
- Kjører du Vulkan med IQ4_XS-kvanter, eller bf16-modeller på Apple Silicon, er dette også oppdateringen som retter de problemene.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.