Nunchaku Lite gir 4-bits diffusjon direkte i Diffusers
Laster Diffusers nå Nunchaku-kvantiserte modeller direkte, uten egen inferensmotor og uten lokal CUDA-kompilering.
12 GB toppminne mot 24 GB, og et 1024x1024-bilde på rundt 1,7 sekunder på et RTX 5090. Det er tallene Hugging Face oppgir for det første ferdigkvantiserte Nunchaku Lite-sjekkpunktet, som nå lastes med from_pretrained() som en hvilken som helst annen Diffusers-modell. Fram til nå krevde slike sjekkpunkter et separat inferensbibliotek.
De fleste kvantiseringsbakendene i Diffusers er vektbaserte: de lagrer vektene i lav presisjon og pakker dem ut igjen til høy presisjon når det faktisk skal regnes. Minnebruken går ned, men farten gjør sjelden det, og av og til går den litt opp. SVDQuant, metoden bak Nunchaku, kjører i stedet transformerlagene med 4 bit på både vekter og aktiveringer. Utliggerne i aktiveringene flyttes over i vektene, den vanskeligste delen av hver vektmatrise beholdes som en liten 16-bits lavrangsgren, og resten kvantiseres ned til 4 bit.
Prisen for at dette virker uten modellspesifikk integrasjon er fart. Nunchaku Lite mangler de sammensmeltede kjernene den originale motoren har, og lander på rundt 30 prosent raskere enn BF16 der fullversjonen gir mer. Legger du på torch.compile, faller full pipeline fra 3,00 til 1,68 sekunder, altså 1,8 ganger raskere. Maskinvaren avgjør hvilken variant du trenger: NVFP4 krever Blackwell, altså RTX 50-serien, RTX PRO 6000 eller B200, mens INT4 dekker Turing, Ampere og Ada. Volta og Hopper støttes ikke, og kvantisereren sjekker CUDA-kapabiliteten ved lasting og feiler tydelig i stedet for å produsere gale bilder.
Hva bør du gjøre?
- Har du et Blackwell-kort: hent et ferdig NVFP4-sjekkpunkt fra Hub-en og last det med from_pretrained(). Kjernene lastes ned automatisk første gang de brukes.
- Sitter du på RTX 30 eller 40: velg INT4-varianten i stedet. API-et er det samme, bare kjernene bak er andre.
- Kvantiser tekstkoderen med bitsandbytes NF4 i tillegg. Det tar ytterligere 22 prosent av toppminnet uten å koste målbar latens.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.