Selvhosting slår frontier-API-ene på pris, men bare hvis GPU-ene faktisk brukes
Slår et rentet B200-rack frontier-API-ene på pris allerede ved 15 prosent utnyttelse, mens et 4xH200-oppsett må gå 89 prosent døgnet rundt i fem år før eierskap lønner seg.
Samme 64 kodeoppgaver, tre helt forskjellige regninger. Det belgiske forskningsmiljøet aistack ved imec kjørte rundt 100 testkjøringer av et utvalg fra SWEBench Pro på fire maskinvareoppsett, og prisen for å løse det samme settet spenner over mer enn to størrelsesordener avhengig av hvilken modell og maskin du velger.
Utnyttelsesgrad, ikke maskinvarepris, avgjør regnestykket. Du dimensjonerer for topplasten midt på dagen og betaler for jernet om natten også. aistack viser til publiserte tall der interne utviklerverktøy ligger på 15 til 22 prosent gjennomsnittlig GPU-utnyttelse, og skriver at selv et godt driftet oppsett sjelden passerer 25 til 35 prosent.
Tallene spriker kraftig mellom modellene. For Qwen3.6 på én H200 er det 35 ganger billigere å leie GPU enn å gå via API. For GLM-5.2 på åtte B200 er besparelsen 23 prosent. For DeepSeek-V4-Flash går regnestykket motsatt vei: leid maskinvare koster mer enn DeepSeeks eget API, fordi opptil 98 prosent av inn-tokenene i kodeagenter er cachet og prises deretter.
«Hva det koster å kjøre akkurat dine arbeidslaster betyr mer enn debatten om åpent mot lukket» — aistack, i rapporten
Kimi K3 kom inn i testen 29. juli og forskyver kvalitetsbildet. Modellen løste 86,4 prosent av oppgavene, 24 prosentpoeng over både GLM-5.2 og Anthropics Opus 4.8, som begge landet på 62,5 prosent. Prisen er tempo og plass: K3 trengte en 8xB300-node til rundt 20 prosent høyere maskinvarekostnad, serverte 16 samtidige økter mot GLM-5.2 sine 24, og brukte 38 minutter i median per oppgave mot 26. aistack tar selv forbehold om at oppgavene kan ha ligget i treningsdataene til K3.
Utviklerfølelsen kollapser tidligere enn maskinvaren skulle tilsi. GLM-5.2 på et 8xB200-rack begynner å slite alt ved åtte samtidige økter og er da tre ganger tregere enn Claude Code. Qwen3.6 på én H200 og DeepSeek-V4-Flash på fire holder 32 økter før de stuper, noe aistack fører tilbake til standardinnstillingene i vLLM og hvordan motoren fordeler kapasitet mellom prefill og decode.
Hva bør du gjøre?
- Mål din egen GPU-utnyttelse før du regner på maskinvare. Ligger du under 15 prosent på et rack i B200-klassen, er leie eller API nesten alltid billigere.
- Regn per løst oppgave, ikke per token. aistack bruker median tid per oppgave fra SWEBench Pro fordi tokens per sekund skjuler at en svakere modell kan bruke ti ganger flere tokens på samme jobb.
- Verifiser modellkvaliteten mot billige APIer før du kjøper jern. Qwen3.6 løste 35,4 prosent og DeepSeek-V4-Flash 39,1 prosent av oppgavene, og det kan du teste mot din egen kodebase først.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.