NVIDIA sier nye optimaliseringer gjør lokale KI-agenter opptil 1,9 ganger raskere
Måler NVIDIA opptil 1,9 ganger høyere gjennomstrømning for lokale modeller etter oppdateringer i llama.cpp og vLLM, men bare i én av seks testede kombinasjoner.
De fem andre målingene ligger mellom 1,2 og 1,5. NVIDIA la fram tallene i en X-post fredag 4. september, gjengitt av RuntimeWire, og toppresultatet kommer fra Qwen3.6-35B kjørt med llama.cpp på et GeForce RTX 5090. På profesjonell maskinvare er utslaget mindre: RTX PRO 6000 Blackwell Workstation Edition lander på 1,2 ganger med vLLM for både 27B- og 35B-modellen.
Sammenligningsgrunnlaget er NVIDIAs egne Computex-resultater målt mot programvare datert 1. september. Testen er SpeedBench-Coding med 8K kontekst og batchstørrelse 1, altså et mål på relativ forbedring i ett bestemt oppsett. NVIDIA oppga verken absolutte tokens per sekund eller strømforbruk.
Gevinsten kommer fra inferensstacken, ikke fra ny maskinvare. For llama.cpp peker NVIDIA på optimaliserte kjerner, bedre spekulativ dekoding og raskere prompt-prefill. Spekulativ dekoding lar en liten utkastmodell foreslå flere tokens som hovedmodellen verifiserer samlet, noe som kutter antallet sekvensielle genereringssteg. For vLLM er endringen nye XQA-attention-kjerner i FlashInfer.
Det praktiske poenget for deg som kjører agenter lokalt: oppdateringene distribueres gjennom llama.cpp- og vLLM-backendene, men også via LM Studio og Ollama. Du trenger altså ikke kompilere CUDA-kjerner selv for å få dem. Agentiske arbeidslaster kaller modellen om og om igjen mens de leser filer og bruker verktøy, så selv 20 prosent høyere gjennomstrømning slår ut i hele løkka.
Hva bør du gjøre?
- Oppdater Ollama eller LM Studio og mål din egen tokens per sekund før og etter, på din faktiske kontekstlengde og kvantisering.
- Behandle 1,9 som taket i NVIDIAs gunstigste oppsett, ikke som forventet gevinst. Med batchstørrelse over 1 eller lengre kontekst enn 8K er 1,2 et mer nøkternt utgangspunkt.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.