IBM og Red Hat serverte 3 000 kodeagenter fra 544 H100-GPUer
Kjør frontier-modeller på H100-ene du allerede har: IBM Research og Red Hat serverte 3 000 samtidige kodeagenter fra GLM-5.2 på 544 H100-GPUer uten en eneste preemption.
IBM Research har publisert tallene fra en llm-d-utrulling der GLM-5.2, en mixture-of-experts-modell med rundt 753 milliarder parametere og cirka 39 milliarder aktive, kjører på 544 NVIDIA H100-GPUer. På agent-benchmarkene nådde oppsettet over 6,6 millioner utgående tokens i minuttet på topp. Ifølge IBM Research koster selvhosting av modellen på H100 mellom fem og ti ganger mindre per token enn tilsvarende kommersielle API-priser, med størst besparelse på den inngangstunge trafikken agenter lager.
Agent-trafikk ser nemlig helt annerledes ut enn chatbot-trafikk, og det er der gevinsten ligger. I en tidligere studie av 219 ekte Claude Code-økter bar medianforespørselen rundt 195 000 tokens inn, men produserte bare 317 ut. 96 prosent av forespørslene fra hovedagenten gjenbrukte minst 90 prosent av en tidligere forespørsels input ordrett, og over halvparten av alle forespørsler kom i klynger av parallelle underagenter uten forvarsel.
«Vi ville vise at en selvhostet modell med åpne vekter kan kjøre ekte agent-arbeidslast med konkurransedyktig interaktiv gjennomstrømning, på GPUene de fleste organisasjoner allerede driver» — Carlos Costa, Distinguished Engineer i IBM Research og vedlikeholder av llm-d
llm-d møter dette med prefiks-bevisst ruting som sender forespørselen til serveren som allerede har konteksten i cache. På CyberGym-benchmarken ga byttet fra tilnærmet til presis prefiks-matching 79 prosent høyere gjennomstrømning og 67 prosent lavere tid til første token, og den lokale prefiks-treffraten steg fra 44,46 til 73,18 prosent. Over hele kjøringen ble 85,2 prosent av inngående tokens servert fra cache, slik at bare 14,8 prosent måtte prefilles på nytt. Modellen fordeles over noder med bred ekspertparallellisme og data-parallell attention, og prefill og dekoding er skilt i egne puljer som skalerer hver for seg.
«Å servere tusenvis av samtidige agenter uten preemption gir operatører en troverdig vei fra et benchmark-resultat til en produksjonsutrulling» — Maroon Ayoub, Senior Principal MLE i inferens-teamet hos Red Hat
Hva bør du gjøre?
- Mål prefiks-treffraten i din egen inferens-stack før du kjøper mer GPU. Hoppet fra 44,46 til 73,18 prosent kom fra ruting, ikke fra maskinvare.
- Sjekk om serveren din kan spille KV-cache ut i CPU-minne. IBM målte 2,53 PiB lagrede promptblokker og 2,16 PiB hentet tilbake, med 79,6 ms i snitt per gjenoppretting.
- Test med agent-lignende trafikk, altså lange kontekster og plutselige klynger av underagenter, ikke med chatbot-benchmarks som genererer mye og leser lite.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.