GLM-5.3 lar deg ikke slå av resonnering, og gamle kall feiler
Endre thinking.type til enabled før du bytter modell-ID til glm-5.3, ellers feiler kallet.
Samme grunnmodell som GLM-5.2, men et API du ikke kan kalle på samme måte. Z.ai skriver i utviklerdokumentasjonen for GLM-5.3 at hele forbedringen kommer fra post-trening, og at modellen alltid kjører med resonnering på. Å skru det av er ikke lenger støttet, og det er en brytende endring for alle som har en klient stående mot GLM-5.2.
«If your application currently uses thinking.type: "disabled", please change it to enabled and set reasoning_effort to low before updating the model ID to glm-5.3. Otherwise, the request will fail» — Z.ai, i migrasjonsnotisen
Skruen du har igjen heter reasoning_effort og har tre nivåer: low, high og max. Standardverdien er max, og Z.ai anbefaler nettopp max til komplekse oppgaver som koding. Kom du fra et oppsett der du slo av tenkingen for å holde tokenbruken nede på enkle kall, er low det nærmeste du kommer den gamle oppførselen. Kostnaden per kall går opp uansett hva du velger.
Resten av kontrakten er også verdt å lese før du bytter. GLM-5.3 tar bare tekst inn, har et kontekstvindu på 1 million tokens og en maksimal outputlengde på 128 000 tokens. Strømming, function calling, kontekst-caching og strukturert output står oppført som støttet.
Tre protokoller er tilgjengelige: OpenAI Chat Completion, OpenAI Response og Anthropic Message, hver på sin egen base-URL. Her ligger en felle for gjengangere. Har du tidligere abonnert på en GLM Coding Plan, inkludert et abonnement som har gått ut, får du foreløpig bare tilgang til modell-APIet gjennom den OpenAI-kompatible Chat Completion-protokollen. Z.ai skriver at dette skal forbedres i kommende iterasjoner.
Kvoteordningen er lagt om til poeng, og der ligger den ene besparelsen som faktisk er din å styre.
«Model calls made during off-peak hours, including all day on weekends, consume only 50% of the standard points» — Z.ai, om den nye GLM Coding Plan
På ytelsessiden oppgir Z.ai 50 prosent bedre koding enn GLM-5.2 på selskapets egen Z.ai Code Bench, og beste resultat blant åpne modeller på offentlige tester som Terminal Bench 3.0 og Agents' Last Exam (CLI). Cybersikkerhetsevnene er den andre kurven Z.ai trekker fram: modellen har selskapets beste resultat til nå på CyberGym, og på testene som måler faktisk utnyttelse er scorene mer enn doblet fra GLM-5.2.
For deg som kjører en kodeagent mot Z.ai kommer altså to ting i samme slipp. Modellen er merkbart sterkere på lange oppgaver, og API-kontrakten har mistet en bryter du kanskje brukte til å holde regningen nede.
Hva bør du gjøre?
- Søk gjennom klientkoden etter thinking.type satt til disabled, bytt den til enabled og sett reasoning_effort til low, før du oppdaterer modell-ID til glm-5.3.
- Sett reasoning_effort bevisst per oppgavetype i stedet for å la standarden stå: low på enkle kall, max på koding der Z.ai selv anbefaler det.
- Flytt batch-jobber og lange agentkjøringer til helg eller utenfor rushtiden hvis du er på den nye kvoteordningen. Halv poengpris er en reell rabatt på arbeid som ikke haster.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.