Hopp til hovedinnhold
Tilbake
Modell 2 min · Kilde: Z.ai

Z.ai utsetter GLM-5.3-vektene etter egne sårbarhetstester

KI Takeaway KI-generert · kan inneholde feil

Vent to uker på GLM-5.3-vektene: Z.ai holder dem tilbake fordi modellen ble uventet god til å finne og utnytte sårbarheter.

«As we scaled post-training, cyber capability developed faster than we expected.» - Z.ai, lanseringsnotatet for GLM-5.3

Kinesiske Z.ai lanserte GLM-5.3 14. august og gjorde den tilgjengelig gjennom API og kodeabonnement, men vektene kommer først to uker senere, når selskapet er ferdig med sikkerhetsevaluering og herding. Modellen deler basismodell med GLM-5.2, og hele forbedringen kommer fra post-trening.

Tallene Z.ai selv oppgir forklarer nølingen. På CyberGym, som tester om modellen kan identifisere og validere sårbarheter ut fra kildekode, scorer GLM-5.3 84,5 prosent mot 77,2 for forgjengeren, foran både GPT-5.6 Sol (83,6) og den sterkeste lukkede konkurrenten i Z.ais egen tabell (83,8). På ExploitBench, som krever dypere resonnement om faktisk utnyttelse, mer enn dobles resultatet fra 24,4 til 54,4 prosent. På ExploitGym løser modellen 105 oppgaver innenfor to timer og 130 innenfor seks, mot 29 og 39 for GLM-5.2.

Effekten er målt utenfor benchmarkene også. Sammen med flere sikkerhetsmiljøer i Kina har Z.ai kjørt modellene mot ekte kodebaser, og etter ekspertgjennomgang, screening og deduplisering står det igjen 2 436 sårbarheter i 269 prosjekter, hvorav 1 097 med middels til høy alvorlighetsgrad. Funnene spenner fra systemkjerner og nettlesermotorer til åpen infrastruktur og nettverksprotokoller, og den eldste feilen hadde ligget uoppdaget i rundt 40 år.

Kodeevnene fulgte samme kurve. På Terminal-Bench 3.0 går GLM-5.3 fra 4,6 til 28,3, og på Z.ais interne kodebenchmark løser den 31,4 prosent av oppgavene på rundt 50 000 output-tokens, mot 29,5 prosent på 120 000 for Claude Opus 4.8.

Z.ai er samtidig tydelig på hvor avstanden til den lukkede fronten består. Den sterkeste lukkede modellen i selskapets egen tabell løser 181 og 247 ExploitGym-oppgaver, mot GLM-5.3 sine 105 og 130. Mønsteret går igjen: jo lenger opp i utnyttelseskjeden en test ligger, jo større er både framgangen og gapet som gjenstår.

For deg som bygger er det utsettelsen som er nyheten. Dette er første gang en lab med åpne vekter skyver på publiseringen med sikkerhetsevaluering som begrunnelse, og blir det normen, faller forutsetningen om at vektene kommer samtidig med API-et.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter