Magnitude tuner kjernene på din egen maskin og hevder 92 % raskere decode enn llama.cpp
Test Magnitude mot ditt eget llama.cpp-oppsett før du bytter, for de nesten doble decode-tallene er utviklernes egne og gjelder én modell på to maskiner.
På en Mac med M4 Pro og 48 GB minne genererer llama.cpp 30 tokens i sekundet med Qwen 3.6 35B A3B i 4-bit. Magnitude gir 57 på samme maskin, ifølge gründerne Anders og Tom, som lanserte prosjektet som Launch HN (YC S25) på Hacker News onsdag. Målingen er gjort med 64k kontekst og uten spekulativ dekoding. På en DGX Spark med CUDA er gevinsten mindre: 49 mot 58 tokens i sekundet i decode.
Grepet er at kjernene ikke leveres ferdig kompilert for en bred klasse maskinvare. Magnitude skriver dem med fleksible parametere og tuner dem på din egen brikke før modellen kjører. Motoren er skrevet i Rust, med egen kjøretid for GPU-kjerner og en egen autotuner, og har håndoptimaliserte kjerner for de mest populære åpne modellfamiliene.
«Inferensmotorer i dag gjør alle et kompromiss på ytelse.» — Anders og Tom, Magnitude, på Hacker News
Gründerne plasserer vLLM og SGLang i leiren for batch-inferens i datasenter, og llama.cpp og Ollama i leiren for bred kompatibilitet. Magnitude er bygget for lange agentøkter som kjører samtidig: motoren reserverer bare minne til vektene ved oppstart, lar minnet vokse med øktene og frigjør det når agentene stopper. Samtidige økter deler prefiks-cache. Per agent skal det gi 27 til 28 prosent mindre minnebruk.
Skepsisen kom raskt i HN-tråden. Brukeren nateb2022 etterlyser mer enn en graf:
«Finnes det noen kilde på benchmarkene eller metodikken utover bildet? Ytelsen til llama.cpp kan variere enormt avhengig av hvordan den er konfigurert.» — nateb2022 på Hacker News
To av de første kommentarene spør også hva forretningsmodellen er. Selve motoren er Apache 2.0-lisensiert.
Bakgrunn
Repoet ble opprettet i juni og har passert 5 500 stjerner på GitHub. CLI-en kom i versjon 0.2.1 onsdag. Magnitude leveres som skrivebordsapp for macOS, Windows og Linux, med magnitude-CLI-en inkludert, og kobler med ett klikk til Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi og Cline. Andre agenter bruker det OpenAI-kompatible API-et. Modellene lastes når en agent ber om dem og tas ut av minnet ved inaktivitet, så første svar etter en pause tar lengre tid.
På veikartet står expert streaming, altså å lagre eksperter i RAM eller på disk og laste dem inn akkurat når de trengs, slik at du kan kjøre modeller som ellers ikke får plass på GPU-en.
Hva bør du gjøre?
- Kjør samme modell i llama.cpp og Magnitude på din egen maskin, med lik kontekstlengde og uten spekulativ dekoding, før du stoler på tallene.
- Sjekk GPU-en først: CUDA-byggene krever Ampere eller nyere, og AMD-kort går via Vulkan fordi Magnitude ikke har noen ROCm-backend.
- Pek agenten mot det OpenAI-kompatible API-et hvis den ikke står på listen over agenter med ettklikksoppsett.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.