Multiverse-modell i 4 bit slår sin egen 16-bits kilde på 7 av 9 tester
Distiller den kvantiserte modellen direkte fra originalen i stedet for fra den komprimerte mellomversjonen, og 4 bit slår 16 bit.
Multiverse Computing komprimerte OpenAIs GPT-OSS 120B ned til 60 milliarder parametere, kvantiserte resultatet til MXFP4 og endte med en modell som slår sin egen bfloat16-versjon på 7 av 9 benchmarks. Oppskriften heter Quantization-Aware Healing, og teamet beskrev den på Hugging Face 25. august.
Den vanlige rekkefølgen er å komprimere arkitekturen, kvantisere vektene og deretter reparere skaden med quantization-aware training. Den reparasjonen kjører hele det dyre etter-treningsløpet på nytt gjennom en støyende lavpresisjons-forwardpass. Alternativet, distillasjon fra en frossen fullpresisjonslærer, forutsetter at det finnes en fullpresisjonsversjon av nøyaktig samme arkitektur. Etter strukturell komprimering finnes den ikke, og eneste kandidat er det gjenopprettede bfloat16-sjekkpunktet, som selv er en tilnærming til originalen.
QAH bytter lærer: studenten distilleres fra modellen slik den var før komprimering. Lærer og student deler ikke engang arkitektur, men fordi en lærers utgangsfordeling er arkitekturuavhengig, går overføringen gjennom KL-divergens på logitene likevel. Kvantiseringstrinnet blir dermed en ny runde med veiledning i stedet for et tapsledd på slutten.
Stabiliteten er den andre gevinsten. I en direkte sammenligning på GPT-OSS 9B nådde begge metodene omtrent samme topp, 54,9 for QAH mot 54,6 for QAT, men QAH kom dit på rundt 100 steg mot QATs 700 og ble liggende innenfor to poeng resten av treningen. QAT falt nesten 19 poeng fra toppen til steg 1200. Et QAT-sjekkpunkt må derfor stoppes tidlig mot et holdout-signal, mens et ferdigtrent QAH-sjekkpunkt ikke driver videre.
For deg som serverer modeller selv betyr det at 4 bit ikke lenger trenger å være kompromisset du godtar for å få plass i minnet. Modellen bruker rundt fire ganger mindre vektminne enn bfloat16-studenten og halverer beregning per token mot 120B-læreren, og slår den likevel på LiveCodeBench med 66,5 mot 66,0.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.