ZGCM-1: 7B-modell slår Qwen3-235B på agentisk nettsøk
Matcher en tett 7,39-milliarders modell 235B-modeller på agentisk nettsøk, og hele treningsoppskriften er offentlig.
Hvor mye av resonneringen i en frontmodell ligger i parametrene, og hvor mye ligger i oppskriften? ZGCM-1 scorer 63,09 % på WebWalkerQA, der Qwen3-235B-A22B med verktøytilgang lander på 59,60 % og Kimi-K2 på 63,00 %. På MMLU faller den samme modellen til 73,88 % mot Qwen3-8B sine 85,40 %, og det avgrenser påstanden: resonnering og søk løftes av oppskriften, mens ren faktahukommelse fortsatt følger parametertallet.
Modellen er beskrevet i arXiv-artikkelen 2609.13356, og bloggeren Jaehun har gått gjennom hele designrapporten med tabellene hentet mekanisk fra artikkelens LaTeX-kilde. Arkitekturen er en dekoder på 32 lag der 27 lag bruker gated sliding-window attention med et vindu på 128 tokens, mens bare 5 lag har global attention, plassert på lag 6, 12, 18, 24 og 30. Effekten er målbar i minne: KV-cachen faller fra 128 KiB til 20 KiB per token, som ved 256K kontekst betyr 5,0 GiB i stedet for 32,0 GiB.
Treningsgevinsten er ikke ett grep, men fire som ganges sammen. Forfatterne dekomponerer hastigheten på 4,2 ganger som 1,4 fra sliding-window attention, 1,5 fra FP8-systemet, 1,8 fra Muon-optimalisatoren og 1,1 fra Pre-LN. Produksjonskjøringen holdt rundt 585 TFLOP/s per GPU, omtrent 60 % av BF16-ekvivalent utnyttelse på H100. Fortreningen brukte 0,99 billioner tokens i første trinn og 3,20 billioner i andre, før 600,51 milliarder tokens med mid-training som trappet konteksten opp gjennom 16K, 64K og 256K.
Begrensningene står i samme rapport. På SWE-bench Verified og Terminal-Bench 2.0 er fullføringsratene fortsatt lave, og IFEval på 75,42 % ligger under Qwen3-8B sine 88,20 %. Styrken sitter i strukturerte agentmiljøer: på Binary Function Search, der modellen skal finne inngangsadressen til en funksjon i en strippet ELF-binær, treffer ZGCM-1 62,00 % mot 12,00 % for Qwen3-8B og 18,00 % for GPT-4o.
Det som skiller denne utgivelsen fra vanlige open-weight-slipp, er at vekter, mellomlagrede sjekkpunkter, kode, datamiks og til og med W&B-loggene er lagt ut. Da kan du faktisk teste påstandene selv i stedet for å ta benchmarktabellen på ordet.
Hva bør du gjøre?
- Kjør den lokalt hvis du trenger lang kontekst på lite VRAM. 5,0 GiB KV-cache ved 256K er innenfor et forbrukerkort, mens 32,0 GiB ikke er det.
- Bruk den til strukturert agentarbeid, ikke som kunnskapsbase. Nettsøk og binæranalyse er der tallene holder, mens MMLU på 73,88 % betyr at du bør hente fakta utenfra.
- Hent sjekkpunktene hvis du forsker på treningsdynamikk. De mellomlagrede sjekkpunktene og datamiksen er det som mangler i de fleste open-weight-slipp.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.