Hopp til hovedinnhold
Tilbake
Forskning 2 min · Kilde: Level1Techs Forum

Nvidias FP4-kvant flippet halvparten av tokenene ved 88k kontekst

KI Takeaway KI-generert · kan inneholde feil

Viser at valg av kvantisering og attention-backend, ikke bare vektene, avgjør om den lokale modellen fullfører et verktøykall riktig.

Rundt 50 prosent av de målte posisjonene ga et annet topp-token enn referansen da Nvidias NVFP4-kvant av Qwen3.6-27B nådde 88 000 tokens kontekst. Det er sisteplass blant fem oppsett i en testserie forumbrukeren thr3e la ut på Level1Techs-forumet 16. august. Poenget i serien er ikke hvor mye kvalitet du taper på en kvantisering, men at samme vektsett gir ulike svar avhengig av hva som ligger under det.

Oppsettet var en RTX PRO 6000 Blackwell med tensor-parallellitet 1 og en fastlåst nattlig vLLM-bygg. Testprompten var på rundt 100 000 tokens, hentet fra en reell arbeidsstrøm med verktøykall og valgt nettopp fordi den ikke finnes i noe benchmark-datasett.

Første eksperiment byttet bare attention-backend. FlashAttention 2, Flash Inference og Triton Attention var enige om neste token gjennom de første tusenvis av tokenene, og begynte så å sprike. Kjørte thr3e samme backend flere ganger, var logitene bit for bit identiske. Divergensen kommer fra matrisemultiplikasjonene i selve backenden, ikke fra tilfeldig støy.

Andre eksperiment kvantiserte bare KV-cachen. Der brøt et verktøykall reproduserbart sammen: BF16 gikk fint, int8 klarte å hente seg inn igjen, int4 gjorde det ikke.

Tredje eksperiment sammenlignet fem vektformater. En INT8-kvant med W8A16 slo både Qwens egen FP8-utgivelse og Nvidias NVFP4. Både NVFP4 og en AWQ-kvant med W4A16 klarte ikke å lukke verktøykallene sine, og skrev feil Cisco-kommando: de kjørte show run der show arp var riktig.

«Din lokale implementasjon suger. Men det er greit, for alle andres gjør det også.» — thr3e, Level1Techs-forumet

thr3e advarer også mot å stole på KLD-tall oppgitt på modellkort. Uten referansesjekkpunkt, kjøretidsmiljø, kalibreringsdata og retningen på divergensen er tallet umulig å tolke.

Hva bør du gjøre?

  1. Bruk sampler-innstillingene modellkortet oppgir. For lav temperatur er grunnen til at Qwen-modellen din blir gående i loop inne i sin egen tenkeutgang.
  2. Skal du spare minne på lang kontekst: kvantiser KV-cachen til int8, ikke int4. Int4 var den eneste som ikke kom seg etter et feilet verktøykall.
  3. Mål på din egen arbeidsmengde med lang kontekst og verktøykall. Tre testprompter på temperatur null sier ingenting om hvordan oppsettet ditt oppfører seg som agent.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter