Hopp til hovedinnhold
Tilbake
Modell 3 min · Kilde: byteiota

GLM-5.2 tar 62,1 på SWE-bench Pro mot GPT-5.5s 58,6, under MIT-lisens

KI Takeaway KI-generert · kan inneholde feil

Scorer 62,1 på SWE-bench Pro mot GPT-5.5s 58,6, med åpne vekter under MIT-lisens og en kontekst på 1 million tokens.

62,1 mot 58,6. Så stor er avstanden mellom Z.ais nye GLM-5.2 og GPT-5.5 på SWE-bench Pro, benchmarken som måler løsning av ekte GitHub-issues på tvers av språk. Tallene står i Z.ais eget modellkort på Hugging Face, sammen med resten av sammenligningstabellen.

Mønsteret gjentar seg over flere agent-relevante tester. GLM-5.2 ligger foran GPT-5.5 på FrontierSWE med 74,4 mot 72,6, på PostTrainBench med 34,3 mot 28,4, på verktøybruk-testen MCP-Atlas med 76,8 mot 75,3 og på AIME 2026 med 99,2 mot 98,3. Bildet snur på det lengste løpet: Claude Opus 4.8 tar 69,2 på SWE-bench Pro og 26,0 på SWE-Marathon, der GLM-5.2 lander på 13,0. Krever arbeidsflyten din autonome kjøringer over flere dager, holder Opus fortsatt forspranget.

To arkitekturgrep står bak løftet, ifølge Z.ai. IndexShare gjenbruker samme indekserer på tvers av hvert fjerde sparse attention-lag og kutter FLOPs per token med 2,9 ganger ved 1 million tokens kontekst. Laget for speculative decoding er også forbedret, med opptil 20 prosent lengre aksepterte sekvenser. Det er de to som gjør et såpass langt kontekstvindu praktisk brukbart i stedet for bare oppgitt i spesifikasjonen.

«En MIT-lisens for åpen kildekode, uten regionale begrensninger og teknisk tilgang uten landegrenser» — Z.ai, modellkortet for GLM-5.2

Lisensen er den delen som betyr mest for norske byggere. MIT gir deg rett til å kjøre vektene kommersielt, endre dem og distribuere resultatet, uten den typen regionale klausuler flere andre åpne modeller har hatt. Z.ai oppgir støtte for SGLang fra v0.5.13.post1, vLLM fra v0.23.0, Transformers, KTransformers og Unsloth, samt Ascend NPU gjennom vLLM-Ascend, xLLM og SGLang.

Hva det koster å faktisk kjøre den, er verdt å sjekke selv. byteiota oppgir Z.ai-priser på 1,40 dollar per million input-tokens og 4,40 per million output-tokens, mot 5,00 og 30,00 for GPT-5.5, og skriver at Unsloths 2-bits dynamiske GGUF-kvantisering krymper modellen fra 1,51 TB til rundt 239 GB. En Mac Studio med 256 GB delt minne skal da kunne kjøre den helt på GPU. På en vanlig maskin med 24 GB GPU og 256 GB RAM, med ekspertlagene flyttet til CPU, oppgir de 3 til 9 tokens i sekundet. Ingen av disse tallene står i Z.ais egen dokumentasjon.

En tredjepartsmåling er verdt å notere: Semgrep sitt sikkerhetsteam testet GLM-5.2 mot Claude Code på å finne IDOR-sårbarheter og målte 39 prosent F1 mot 32 prosent, til rundt 0,17 dollar per funnet sårbarhet. Modellen er samtidig ren tekst uten synsstøtte, og Artificial Analysis har målt rundt 43 000 output-tokens per lang kodeoppgave, nesten dobbelt så mye som MiniMax-M3.

Bakgrunn

GLM-serien kommer fra Z.ai, tidligere Zhipu AI, og har gått fra å være en kinesisk forskningsmodell til å konkurrere direkte med de lukkede frontmodellene på kodeoppgaver. Forgjengeren GLM-5.1 tok 58,4 på SWE-bench Pro. Sprangene som betyr mest denne gangen er FrontierSWE, fra 30,5 til 74,4, og SWE-Marathon, fra 1,0 til 13,0.

Hva bør du gjøre?

  1. Test den gjennom API-et før du bygger noe rundt den lokalt. Z.ai leverer Anthropic-kompatible endepunkter, så Claude Code og OpenClaw kan peke dit ved å bytte modell-ID.
  2. Regn på output-tokens, ikke på pris per token. Dobbelt så mange tokens per oppgave spiser mye av rabatten på papiret.
  3. Kjør din egen måling på en oppgave du kjenner fasiten på, før du bytter ut en modell i produksjon. Benchmarktallene her kommer fra modellprodusenten selv.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter