llamAmpere presser 99 tokens i sekundet ut av Qwen3.8 27B på ett RTX 3090
Bygg llamAmpere fra kilde hvis du kjører Qwen3.8 27B på et RTX 3090: forken oppgir 1,46 ganger hastigheten til vanlig llama.cpp på samme kort.
1,46 ganger vanlig llama.cpp, og 1,10 ganger tunet vLLM på én strøm ved 32K kontekst. Det er tallene JakeATX oppgir for llamAmpere v0.3.1, en llama.cpp-fork tunet for NVIDIAs Ampere-kort og særlig RTX 3090 og 3090 Ti. Målingen er 99 tokens i sekundet på Qwen3.8 27B på rene agent- og kodefixtures ved temperatur 1, og 93 tokens i sekundet når KV-cachen står på 100K dybde. Kontekstvinduet går opp til 245 760 tokens på ett kort.
Hastigheten kommer ikke fra én enkelt endring. Forken bruker spekulativ dekoding med modellens eget MTP-hode i tre steg og eksakt p/q-verifikasjon, en draft-vokabularliste på 65 536 tokens, og en KV-cache med q8_0 på K og TurboQuants turbo3 på V kjørt gjennom en fusjonert attention-kjerne. Alt dette forutsetter en bestemt GGUF-fil og et sett byggeflagg som er listet opp i repoets QWEN_AMPERE.md.
v0.3.1 utvider til flere vektformater på samme stack. EXL3, trellis-formatet fra Turboderps exllamav3, er lagt inn som GGUF-native typer med en egen SM86-dekodekjerne. Ternary Bonsai 2 27B fra PrismML kjører på 1,75 og 2,125 bits per vekt. Forken laster også Agnes 3.0 Flash med MTP-hodet, noe README-en oppgir at llama.cpp oppstrøms ikke gjør.
Basen er hentet inn på nytt fra llama.cpp master, 772 commits foran v0.3-basen. Alle tallene er utviklerens egne, målt på hans egne fixtures og med hans egen kvantisering av modellen.
Hva bør du gjøre?
- Sjekk kortet først. Dekodekjernene er bygget for SM86, arkitekturen i 3090 og 3090 Ti, så gevinsten følger ikke automatisk med til andre kort.
- Bruk GGUF-en repoet peker på. Både MTP-hodet og vokabularlisten forutsetter den varianten, ikke en vilkårlig kvantisering av Qwen3.8 27B.
- Mål på dine egne prompts. At tallet faller fra 99 til 93 tokens i sekundet ved 100K KV-dybde viser at tempoet henger sammen med hvor mye kontekst du faktisk bruker.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.