Hopp til hovedinnhold
Tilbake
Lokale-modeller 2 min · Kilde: GitHub

ggml 0.25.1 gir DeepSeek V4 42 prosent raskere prefill ved 131 000 tokens

KI Takeaway KI-generert · kan inneholde feil

Oppdater llama.cpp hvis du kjører DeepSeek V4 med lang kontekst på en Nvidia-GPU, for ggml 0.25.1 gir opptil 1,4 ganger raskere prefill ved 131 000 tokens.

På en Nvidia DGX Spark prefillet DeepSeek V4 172,75 tokens i sekundet ved 131 072 tokens kontekst før endringen, og 244,46 etter. Tallene kommer fra pull request 29298 i llama.cpp, der utvikleren am17an slår på igjen sparse flash attention for DeepSeek V4-prefill. Endringen ble slått sammen 23. september, og ggml-prosjektet pakket den inn i hotfix-utgivelsen 0.25.1 samme dag.

Bakgrunnen er en regresjon fra forrige uke. Ifølge PR 29298 var det PR 28770, som skrudde på sparse flash attention for Qwen4 20. september, som i praksis slo den av for DeepSeek V4 og GLM via en batch-avhengig betingelse. Fiksen legger en klemme på den betingelsen slik at DeepSeek V4-prefill aktiverer sparse-stien igjen, uten endring for decode. I tillegg er kjernen som skanner sparse-masken gjort raskere: fra 586 til 244 mikrosekunder for den batchede operasjonen ved 49 000 tokens kontekst.

Gevinsten avhenger helt av hvor lang konteksten er. Målingene er gjort med en IQ2_XXS-kvant på 2,06 bit per vekt:

Nøkkeltall
1,01x
prefill uten forhåndsfylt kontekst
0,99x
prefill ved 32 768 tokens kontekst
1,23x
prefill ved 65 536 tokens kontekst
1,42x
prefill ved 131 072 tokens kontekst

Token-generering står stille på rundt 0,99x i alle målingene, og testmodellen qwen4exp A3B får 1,00x over hele linja. Utgivelsen har også to mindre fikser utenfor CUDA: Metal får de manglende f32 × bf16-kjernene, som retter depthwise convolution med bf16-vekter, og Vulkan får MMQ/MMV-kjerner for kvantiseringstypen IQ4_XS.

Hva bør du gjøre?

  1. Bygg llama.cpp fra en commit etter 23. september hvis du bruker DeepSeek V4 til lange dokumenter eller store kodebaser, der prefill er flaskehalsen.
  2. Mål med llama-bench på kontekstlengdene du faktisk bruker, for under 32 000 tokens viser PR-en ingen gevinst.
  3. Kjører du Vulkan med IQ4_XS-kvanter, eller bf16-modeller på Apple Silicon, er dette også oppdateringen som retter de problemene.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter