Hopp til hovedinnhold
Tilbake
Verktøy 2 min · Kilde: Level1Techs Forum

ROCm 7.14 halverte farten på én modell, men ikke på den ved siden av

KI Takeaway KI-generert · kan inneholde feil

Advarer mot å oppgradere til AMDs ROCm 7.14-image hvis du kjører FP8-kvantiserte MoE-modeller: én modell mistet nesten halve gjennomstrømningen, en annen på samme maskin merket ingenting.

En bruker på Level1Techs-forumet har A/B-testet oppgraderingen fra vLLM-imaget med ROCm 7.2.1 til AMDs dag-0-image med ROCm 7.14 på fire Radeon AI PRO R9700 med 32 GB hver, og resultatene spriker kraftig mellom to modeller på identisk maskinvare. Qwen3.6-35B-A3B-FP8 falt fra rundt 77 til 39 tokens i sekundet ved samtidighet 1, og fra rundt 250 til 140 ved samtidighet 4. Det er 47 til 49 prosent regresjon. Gemma-4-26B-A4B-it på samme host, samme image og samme TP=2-topologi lå uendret innenfor støygrensen.

Nettopp kontrasten er det nyttigste funnet. Den utelukker at det nye imaget bare er generelt tregere på RDNA4-kort, og peker i stedet mot den FP8-kvantiserte kjernebanen. Brukeren utelukket RCCL-protokollen, oppmerksomhetsbackenden og MoE-backend-valget, som var identiske på begge images. AITER viste seg å ikke være installert i det nye imaget i det hele tatt, så miljøvariabelen for å skru den på var en stille nullhandling for Qwen, mens den for Gemma krasjet hardt med en ValueError fra vLLMs MoE-backend.

Den andre halvdelen av rapporten er en gevinst du kan hente uansett image. vLLM leverer ferdigtunede Triton-kjernekonfigurasjoner per GPU-modell og matriseform, men katalogen inneholder oppføringer for MI300X og MI325X og null for Radeon R9700 ved de formene disse modellene trenger. Brukeren genererte sine egne med vLLMs egne tuning-benchmarks og fikk 7 prosent ved samtidighet 1 og 9 prosent ved samtidighet 4 på det gamle imaget, uten ulemper. På det nye imaget flyttet de samme konfigurasjonene bare 2 til 3 prosentpoeng, noe som bekrefter at manglende tuning ikke er årsaken til regresjonen.

Merk at forumteksten er brukerens egen KI-genererte oppsummering av testene, ikke rådata. Tallene er repetert tre ganger per punkt fordi kortet har en dokumentert bimodal gjennomstrømning avhengig av prosessoppstart.

Hva bør du gjøre?

  1. Kjører du FP8-blokk-kvantiserte MoE-modeller på RDNA4, mål gjennomstrømningen før og etter i stedet for å anta at dag-0-imaget er bedre.
  2. Startlogget til vLLM skriver «Config file not found» med akkurat de matriseformene modellen din trenger. Er kortet ditt ikke MI300X-klassen, er sjansen stor for at du kjører utunet.
  3. Kjør en ikke-kvantisert modell gjennom samme test som kontrollgruppe. Uten den kan du ikke skille et generelt tregere image fra en spesifikk kjernebane.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter