ROCm 7.14 halverte farten på én modell, men ikke på den ved siden av
Advarer mot å oppgradere til AMDs ROCm 7.14-image hvis du kjører FP8-kvantiserte MoE-modeller: én modell mistet nesten halve gjennomstrømningen, en annen på samme maskin merket ingenting.
En bruker på Level1Techs-forumet har A/B-testet oppgraderingen fra vLLM-imaget med ROCm 7.2.1 til AMDs dag-0-image med ROCm 7.14 på fire Radeon AI PRO R9700 med 32 GB hver, og resultatene spriker kraftig mellom to modeller på identisk maskinvare. Qwen3.6-35B-A3B-FP8 falt fra rundt 77 til 39 tokens i sekundet ved samtidighet 1, og fra rundt 250 til 140 ved samtidighet 4. Det er 47 til 49 prosent regresjon. Gemma-4-26B-A4B-it på samme host, samme image og samme TP=2-topologi lå uendret innenfor støygrensen.
Nettopp kontrasten er det nyttigste funnet. Den utelukker at det nye imaget bare er generelt tregere på RDNA4-kort, og peker i stedet mot den FP8-kvantiserte kjernebanen. Brukeren utelukket RCCL-protokollen, oppmerksomhetsbackenden og MoE-backend-valget, som var identiske på begge images. AITER viste seg å ikke være installert i det nye imaget i det hele tatt, så miljøvariabelen for å skru den på var en stille nullhandling for Qwen, mens den for Gemma krasjet hardt med en ValueError fra vLLMs MoE-backend.
Den andre halvdelen av rapporten er en gevinst du kan hente uansett image. vLLM leverer ferdigtunede Triton-kjernekonfigurasjoner per GPU-modell og matriseform, men katalogen inneholder oppføringer for MI300X og MI325X og null for Radeon R9700 ved de formene disse modellene trenger. Brukeren genererte sine egne med vLLMs egne tuning-benchmarks og fikk 7 prosent ved samtidighet 1 og 9 prosent ved samtidighet 4 på det gamle imaget, uten ulemper. På det nye imaget flyttet de samme konfigurasjonene bare 2 til 3 prosentpoeng, noe som bekrefter at manglende tuning ikke er årsaken til regresjonen.
Merk at forumteksten er brukerens egen KI-genererte oppsummering av testene, ikke rådata. Tallene er repetert tre ganger per punkt fordi kortet har en dokumentert bimodal gjennomstrømning avhengig av prosessoppstart.
Hva bør du gjøre?
- Kjører du FP8-blokk-kvantiserte MoE-modeller på RDNA4, mål gjennomstrømningen før og etter i stedet for å anta at dag-0-imaget er bedre.
- Startlogget til vLLM skriver «Config file not found» med akkurat de matriseformene modellen din trenger. Er kortet ditt ikke MI300X-klassen, er sjansen stor for at du kjører utunet.
- Kjør en ikke-kvantisert modell gjennom samme test som kontrollgruppe. Uten den kan du ikke skille et generelt tregere image fra en spesifikk kjernebane.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.