Hopp til hovedinnhold
Tilbake
Modell 2 min · Kilde: Z.ai

GLM-5.3 henter 50 prosent bedre koding ut av samme basemodell

KI Takeaway KI-generert · kan inneholde feil

Vent to uker på vektene, men regn med at GLM-5.3 koder 50 prosent bedre enn GLM-5.2 på Z.ais egen benchmark, uten en ny basemodell under.

Samme base, ny ettertrening. Z.ai slapp GLM-5.3 fredag og skriver i lanseringsnotatet at modellen deler basemodell med GLM-5.2, og at hele forbedringen kommer fra ettertrening på flere og mer realistiske oppgavemiljøer. På Terminal-Bench 3.0 går resultatet fra 4,6 til 28,3, og på DeepSWE v1.1 fra 46,2 til 66,9.

«Alt vi gjorde for GLM-5.3, var å skalere ettertreningen.» — Z.ais lanseringsnotat for GLM-5.3

Token-økonomien er den delen som treffer regningen din. På Z.ais interne kodebenchmark når GLM-5.3 34,5 prosent løsningsrate med rundt 75 000 output-tokener per oppgave på høyeste innsatsnivå, mot 23,4 prosent og 96 000 tokener for GLM-5.2. Ett hakk ned bruker den rundt 50 000 tokener på 31,4 prosent, der Claude Opus 4.8 oppgis til 29,5 prosent med 120 000. Tallene er Z.ais egne, målt på en privat benchmark selskapet selv beskriver, så de er ikke uavhengig reprodusert.

Sikkerhetsdelen kom overraskende på laget selv. Z.ai la sårbarhetsdata inn i treningsmiksen og endte med en modell som resonnerer over hele utnyttelseskjeder: 84,5 prosent på CyberGym mot 77,2 for GLM-5.2, og en dobling på ExploitBench fra 24,4 til 54,4. Lukkede modeller ligger fortsatt foran der, med 76,5 prosent for GPT-5.6 Sol. Sammen med sikkerhetsteam i Kina har selskapet kjørt modellene mot ekte kodebaser og rapporterer 2 436 sårbarheter i 269 prosjekter, hvorav 1 097 er av middels til høy alvorlighetsgrad. Funnene spores i et offentlig register hos Z.ai, der 53 så langt er offentliggjort og resten ligger under embargo.

Modellen er tilgjengelig nå gjennom Z.ais API og abonnement, og kan brukes fra kodeagenter som Claude Code og OpenCode. Vektene kommer først om to uker, etter det Z.ai beskriver som sikkerhetsevaluering og herding.

Hva bør du gjøre?

  1. Rett API-kallet før du bytter modell-ID. GLM-5.3 støtter ikke lenger thinking.type: "disabled", så kall som slår av tenking feiler. Sett den til enabled og bruk reasoning_effort med verdien low, high eller max i stedet.
  2. Bruk max for kodeoppgaver, som er Z.ais egen anbefaling, og mål tokenforbruket ditt mot det gamle oppsettet før du konkluderer med at det ble billigere.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter