Hopp til hovedinnhold

Onsdag 7. oktober

 Tilbake Modeller 1 min 02.55

Tencent slipper Hy3 under Apache 2.0: 295 milliarder parametre, slår GLM-5.1 i egen blindtest

tirsdag 7. juli · KI-generert · Kilde: Hugging Face

Innholdet er KI-generert og kan inneholde feil. Sjekk originalkilden.

Tencent har sluppet Hy3, en åpen MoE-modell på 295 milliarder parametre (21 milliarder aktive), under Apache 2.0. Ytelsestallene er selvrapporterte fra Tencents eget modellkort.

295 milliarder parametre, men bare 21 milliarder aktive. Det er arkitekturen bak Hy3, Tencents nye språkmodell som nå ligger åpent på Hugging Face under Apache 2.0. Modellen er en Mixture-of-Experts med 192 eksperter der åtte er aktive om gangen, 80 lag pluss ett MTP-lag, og et kontekstvindu på 256K tokens.

På koding oppgir Tencent 78 på SWE-bench Verified og 57,9 på SWE-bench Pro, pluss 90,4 på GPQA Diamond. I en intern blindtest scorer Hy3 2,67 av 4 mot GLM-5.1 på 2,51. Tencent oppgir også at hallusinasjonsraten falt fra 12,5 til 5,4 prosent. Alle tallene er selvrapporterte og ikke bekreftet av tredjepart ennå.

For deg som kjører egne modeller er det aktive parametertallet det interessante: 21 milliarder aktive betyr at inferens er langt billigere enn de 295 milliardene antyder, selv om du fortsatt må ha vekter for hele modellen i minnet. Apache 2.0 gjør at du kan bruke den kommersielt uten lisensrestriksjoner. Vektene ligger klare på huggingface.co/tencent/Hy3.

Pulsen · norske KI-nyheter for deg som bygger. Sakene er KI-generert fra originalkilden, som alltid lenkes.