Z.ai slipper GLM-5.3-Flash under MIT med 18 aktive av 320 milliarder parametere
Slipper GLM-5.3-Flash under MIT-lisens med 320 milliarder parametere totalt og 18 milliarder aktive per token.
Vektfilene veier 328 gigabyte fordelt på 62 safetensors-filer i fp8. Regnestykket per token er et ganske annet: drøyt fem prosent av parameterne er i sving om gangen. Z.ai la modellen ut på Hugging Face 25. august, og modellkortet kaller den den første nativt multimodale i GLM-5-serien.
Arkitekturen er ny for serien. Z.ai kombinerer sparsom og lineær attention i en hybrid som skal kutte kostnaden ved lang kontekst uten å miste presisjonen, og legger til Manifold-Constrained Hyper-Connections (mHC) for bedre skaleringseffektivitet. Grunnmodellen er trent fra bunnen på et multimodalt korpus på 30 billioner tokens.
«Den slår GLM-5.2 på benchmarks og reelle arbeidsoppgaver til en tidel av prisen, samtidig som den nærmer seg Claude Opus 4.8 på koding og agent-oppgaver» — GLM-5-teamet, modellkortet på Hugging Face
Tallene bak den påstanden ligger i en graf i modellkortet, ikke i en tabell du kan lese verdier ut av. Fotnotene er mer opplysende. Toolathlon Verified rapporteres som pass@1 snittet over tre uavhengige kjøringer, GDPval-AA v2 er kjørt av Artificial Analysis, og HLE med verktøy er dømt av GPT-5.6-luna med 300 000 tokens kontekstvindu. Det siste betyr noe: en modell som dømmes av en annen modell arver dommerens skjevheter.
Kodetestene er kjørt i ekte agent-oppsett. DeepSWE gikk gjennom mini-swe-agent med 400 000 tokens kontekst og seks timers timeout, Terminal-Bench 2.1 i Claude Code 2.1.207, og NL2Repo under én million tokens kontekst med både regelbasert og modellbasert kontroll mot juks. Multimodaliteten testes på BabyVision med bilder skalert til minst 1 500 piksler på korteste side.
For deg som vil kjøre modellen selv, er de 328 gigabytene det harde tallet. Modellkortet peker på fire veier: SGLang, vLLM, TokenSpeed og KTransformers, med egen oppskrift for hver. Ingen av dem tryller bort at vektene må ligge et sted.
MIT-lisensen er den delen som betyr mest på lengre sikt. Du kan finjustere, distillere og bygge kommersielt på vektene uten bruksbegrensninger, og uten å be noen om lov.
Hva bør du gjøre?
- Regn på minnet før du laster ned. 328 gigabyte fp8-vekter krever enten flere GPU-er med rikelig VRAM eller et oppsett som holder ekspertene i vanlig RAM.
- Test via Z.ais API først. Skal du bare måle om modellen løser dine oppgaver, koster noen API-kall langt mindre enn en nedlasting du kanskje kaster.
- Kjør dine egne oppgaver, ikke benchmarkene. Påstanden om en tidel av prisen gjelder mot GLM-5.2, og din egen pris avhenger av hvor du serverer modellen.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.