Hopp til hovedinnhold
Tilbake
Modell 2 min · Kilde: The Decoder

GLM-5.3-Flash kjørte helt uten Nvidia, til 0,09 dollar per oppgave

KI Takeaway KI-generert · kan inneholde feil

Kjørte all trafikk for GLM-5.3-Flash på kinesiske KI-brikker, med kostnad per token på nivå med vanlige Nvidia-GPU-er.

CUDA har vokst i snart 20 år, og så godt som alle KI-rammeverk er finjustert for det. Å bytte til andre brikker betyr å gjøre den jobben på nytt: omprogrammere regneoperasjoner, justere minnetilgang og lete opp flaskehalser. Det er bakteppet for tallene Z.ai nå legger fram for GLM-5.3-Flash.

Før lansering testet Z.ai modellen anonymt som «ox-alpha» på OpenCode og OpenRouter, der den ble ukens mest brukte modell. Hele den trafikken kjørte på kinesiske KI-brikker, ifølge Z.ai. SemiAnalysis rapporterer at oppsettet serverte 100 billioner tokener i døgnet, et kapasitetsnivå som hittil har vært regnet som forbeholdt de fremste laboratoriene. Z.ai oppgir at maskinvareeffektiviteten og kostnaden per token ligger på nivå med vanlige Nvidia-GPU-er.

Løsningen var å bygge sitt eget serveringslag oppå SGLang og dele prosesseringen i trinn som skalerer uavhengig av hverandre. Teamet oppgir at det tredoblet gjennomstrømningen på samme maskinvare sammenlignet med første forsøk. En agent basert på GLM-5.3 hjalp til med optimaliseringen.

Prisbildet er den andre halvdelen. Målinger fra Artificial Analysis plasserer modellen på 57 poeng på Intelligence Index ved maksimal resonneringsinnsats, tre poeng bak den større GLM-5.3 og på linje med GPT-5.6 Terra og Muse Spark 1.2.

Nøkkeltall
0,09 dollar
Kostnad per oppgave på Intelligence Index
0,68 dollar
Samme mål for GLM-5.3, rundt 7,5 ganger dyrere
0,15 dollar
Per million inn-tokener på Z.ais API
0,50 dollar
Per million ut-tokener på Z.ais API

Regnestykket har en hake. Artificial Analysis fant at omtrent 90 prosent av utdata-tokenene modellen brukte gikk til resonnering, så token-effektiviteten er svakere enn prisen alene antyder. På agentoppgaver holder den likevel følge med storebroren, med en Elo-score rundt 1770 på GDPval-AA v2, på linje med GLM-5.3 og Grok 4.6 og bak Claude Opus 5.

SemiAnalysis leser dette som nok en test av CUDA-vollgrava, etter resultatene fra OpenAIs nye brikke. For deg som bygger, er poenget at prispresset nedover nå kommer fra en leverandør som ikke er avhengig av Nvidia for å levere det.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter