Hopp til hovedinnhold
Tilbake
Modell 2 min · Kilde: Hugging Face - Blog

Liquid AI trener 4-bit inn i modellen og beholder 97 prosent av BF16

KI Takeaway KI-generert · kan inneholde feil

Trener kvantiseringen inn i modellen i stedet for å legge den på etterpå, og beholder 96,5 til 97,4 prosent av BF16-nivået i 4-bit.

Vanlig kvantisering skjer etter trening: du tar en ferdig modell og presser vektene ned til fire bit, og noe nøyaktighet forsvinner på veien. Liquid AI har gjort det motsatte med de fire nye LFM2.5-sjekkpunktene, som ble lagt ut på Hugging Face i august. Metoden heter quantization-aware distillation, forkortet QAD: en lærermodell i høy presisjon destilleres inn i en elevmodell som allerede er kvantisert, slik at modellen lærer å leve med tapet mens den trenes.

Resultatet er målt på LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct og LFM2.5-2.6B. På en testpakke med GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF og BFCLv4, pluss GSM8K eller AIME25 avhengig av størrelse, beholder QAD-sjekkpunktene henholdsvis 97,1, 96,5, 97,4 og 96,6 prosent av BF16-utgaven. Tallene er snittet over fem gjentakelser.

Det praktiske poenget ligger i formatet. Q4_0 er den enkleste GGUF-kvantiseringen, og den raskeste, men også den som pleier å tape mest. Liquid AI måler dekodingshastighet på MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra og Raspberry Pi 5, og der matcher de to minste QAD-modellene kvaliteten til Q5_K_M med 4 til 33 prosent høyere gjennomstrømning. De to største matcher Q4_K_M med 3 til 14 prosent høyere gjennomstrømning. På 230M og 1,2B holder de også følge med Unsloths UD-Q4_K_XL, et sterkt sjekkpunkt laget med kvantisering etter trening.

Filene kjører i llama.cpp eller enhver runtime som støtter Q4_0-GGUF, og lastes direkte fra Hugging Face med llama-cli -hf LiquidAI/LFM2.5-350M --hf-file LFM2.5-350M-QAD-Q4_0.gguf.

Hva bør du gjøre?

  1. Bytt ut Q4_K_M- eller Q5_K_M-filene dine for LFM2.5 med QAD-Q4_0-varianten og mål på nytt. Gevinsten er hastighet til samme kvalitet, ikke omvendt.
  2. Kjør din egen verktøykalling-test hvis agenten din er avhengig av den. BFCLv4 er med i testpakken, men snittet skjuler variasjon mellom oppgavetyper.
  3. Sikt på 230M eller 350M hvis målet er Raspberry Pi eller telefon, der Arm-CPU gjør jobben og minnet er det harde taket.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter