CPU-en er tilbake: 50–90 % av agent-latensen skjer utenfor GPU-en
Regn om på CPU-GPU-forholdet: agent-arbeidslaster legger 50–90 % av latensen på CPU-siden, og Intel oppgir at forholdet er på vei fra 1:8 til 1:1.
Red Hat-utviklerne Sawyer Bowerman og Grace Ableidinger skriver at premissene bak «GPU til alt» nå forhandles på nytt. En chatbot-forespørsel er én forward pass. En agent-kjøring er dusinvis av korte modellkall, med verktøydispatch, JSON-parsing, kodekjøring og sandkasser mellom hvert kall. Alt det arbeidet lever på CPU-en, og forskere fra Georgia Tech og Intel finner at det står for 50–90 % av total ende-til-ende-latens.
Tallene for maskinvaren kommer fra Intels kvartalsrapport for Q1 2026. Trening ligger på rundt én CPU per åtte GPU-er, inferens har allerede flyttet seg til 1:4, og agentiske arbeidslaster nærmer seg 1:1. Enkelte kunder oppgir fire CPU-er per GPU. Arm anslår at behovet vokser fra 30 millioner CPU-kjerner per gigawatt til 120 millioner i agent-æraen.
«For forsterkende læring, orkestrering og agenter passer CPU-en langt bedre» — Lip-Bu Tan, konsernsjef i Intel, på Computex 2026
Det praktiske for deg som kjører modeller selv ligger i vLLM. CPU-backenden har nå continuous batching, PagedAttention, prefix caching og tensor-parallellisme på x86 AVX-512, Arm AArch64 og IBM Z, med Apple Silicon som eksperimentell. Det OpenAI-kompatible API-et er identisk på tvers av backends, så et oppsett som starter på CPU kan flyttes til GPU uten at applikasjonslaget endres.
Hva bør du gjøre?
- Mål før du kjøper GPU. Red Hats vllm-cpu-perf-eval er åpen kildekode og kjører tre faser med GuideLLM for reproduserbare baselinjer på din egen maskinvare.
- Sjekk om arbeidslasten faktisk er GPU-bundet. Er den agent-tung med mange verktøykall, ligger flaskehalsen sannsynligvis i orkestreringen, ikke i token-genereringen.
- På Intel-CPU gir IPEX AMX-akselerert BF16 automatisk. VLLM_CPU_KVCACHE_SPACE styrer KV-cache i GB, og VLLM_CPU_OMP_THREADS_BIND styrer tråd-pinning.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.