Hy4 preview: Tencent slipper 770 milliarder parametere med 1 million tokens kontekst
Last ned 770 milliarder parametere under Apache-2.0: Hy4 preview aktiverer bare 49 milliarder per token og tar 1 million tokens kontekst.
770 milliarder parametere totalt, 49 milliarder aktive per token. Det er regnestykket bak Hy4 preview, flaggskipmodellen Tencent Hy-teamet la ut 28. august under Apache-2.0. Kontekstvinduet er på 1 million tokens, og Tencent selger modellen inn på de lange løpene: programvareutvikling over mange steg, dokumenttunge kontoroppgaver og vitenskapelig forskning.
Arkitekturen forklarer hvorfor de tallene ikke er så skremmende som de ser ut. Ryggraden er 78 lag, der det første bruker et tett FFN og de øvrige 77 er MoE-lag med 256 rutede eksperter og én delt ekspert hver. Hvert token aktiverer topp-8 av de rutede ekspertene pluss den delte. I tillegg ligger det ett innebygd MTP-lag på 10 milliarder parametere, hvorav 0,7 milliarder aktiveres, for spekulativ dekoding. Oppmerksomhetsmodulen bruker Gated DeepSeek Sparse Attention med IndexCache, og Tencent oppgir selv at arkitekturvalgene er inspirert av DeepSeek og GLM.
«Sterkere pre-trening og en vesentlig større post-treningskjøring bygger seg opp til nok et sprang i kapabilitet, det største generasjonsspranget vi har målt, og nok til å plassere Hy4 preview på open source-fronten.» — Tencent Hy-teamet
Tallene Tencent legger fram fra egen testing er nøkterne. I en blindtest der 163 interne eksperter vurderte modellsvar på 203 ingeniøroppgaver, endte Hy4 preview på 2,99 i snitt mot 2,92 for GLM 5.3 og 2,94 for Kimi K3. Fordelingen mot GLM 5.3 var 46,8 prosent seire, 12,8 prosent uavgjort og 40,4 prosent tap. Det er en ledelse, men en tynn en, og den er målt av leverandøren selv på egne oppgaver.
Tencent er også uvanlig åpen om hva som ikke sitter.
«Dette er en tidlig versjon av Hy4. Vi sender den fra oss med kjente problemer, blant annet at den bruker lengre tid enn nødvendig på å resonnere seg gjennom komplekse oppgaver, og en tendens til å oververifisere sitt eget arbeid.» — Modellkortet for Hy4 preview
For deg som bygger, betyr 49 milliarder aktive parametere at inferenskostnaden per token ligner en langt mindre modell, mens minnebehovet for vektene fortsatt følger 770 milliarder. Tencent publiserer en FP8-kvantisert variant ved siden av fullvektsmodellen, og både vLLM og SGLang har ferdige images der referanseoppsettet forutsetter åtte GPU-er i tensorparallell. Det er datasenterterritorium, ikke hjemmekontor. Vektene ligger på Hugging Face, ModelScope, GitCode og CNB.
Hva bør du gjøre?
- Start med FP8-varianten hvis du skal teste selv. Det offisielle vLLM-imaget vllm/vllm-openai:hy4-preview kjører den med tensorparallell over åtte GPU-er og spekulativ dekoding via MTP-laget.
- Sett temperature til 0,9 og top_p til 1,0, som er verdiene Tencent anbefaler. Resonneringen står som standard på «high», så send reasoning_effort som no_think når du bare vil ha korte, direkte svar.
- Se på AngelSlim, Tencents eget komprimeringsverktøy, hvis åtte GPU-er er utenfor rekkevidde og du vil prøve lavere bit-bredder.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.