GLM-5.3-Flash kjørte helt uten Nvidia, til 0,09 dollar per oppgave
Kjørte all trafikk for GLM-5.3-Flash på kinesiske KI-brikker, med kostnad per token på nivå med vanlige Nvidia-GPU-er.
CUDA har vokst i snart 20 år, og så godt som alle KI-rammeverk er finjustert for det. Å bytte til andre brikker betyr å gjøre den jobben på nytt: omprogrammere regneoperasjoner, justere minnetilgang og lete opp flaskehalser. Det er bakteppet for tallene Z.ai nå legger fram for GLM-5.3-Flash.
Før lansering testet Z.ai modellen anonymt som «ox-alpha» på OpenCode og OpenRouter, der den ble ukens mest brukte modell. Hele den trafikken kjørte på kinesiske KI-brikker, ifølge Z.ai. SemiAnalysis rapporterer at oppsettet serverte 100 billioner tokener i døgnet, et kapasitetsnivå som hittil har vært regnet som forbeholdt de fremste laboratoriene. Z.ai oppgir at maskinvareeffektiviteten og kostnaden per token ligger på nivå med vanlige Nvidia-GPU-er.
Løsningen var å bygge sitt eget serveringslag oppå SGLang og dele prosesseringen i trinn som skalerer uavhengig av hverandre. Teamet oppgir at det tredoblet gjennomstrømningen på samme maskinvare sammenlignet med første forsøk. En agent basert på GLM-5.3 hjalp til med optimaliseringen.
Prisbildet er den andre halvdelen. Målinger fra Artificial Analysis plasserer modellen på 57 poeng på Intelligence Index ved maksimal resonneringsinnsats, tre poeng bak den større GLM-5.3 og på linje med GPT-5.6 Terra og Muse Spark 1.2.
Regnestykket har en hake. Artificial Analysis fant at omtrent 90 prosent av utdata-tokenene modellen brukte gikk til resonnering, så token-effektiviteten er svakere enn prisen alene antyder. På agentoppgaver holder den likevel følge med storebroren, med en Elo-score rundt 1770 på GDPval-AA v2, på linje med GLM-5.3 og Grok 4.6 og bak Claude Opus 5.
SemiAnalysis leser dette som nok en test av CUDA-vollgrava, etter resultatene fra OpenAIs nye brikke. For deg som bygger, er poenget at prispresset nedover nå kommer fra en leverandør som ikke er avhengig av Nvidia for å levere det.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.