Intel Arc A750 kjører Gemma-4-E4B på 33 tokens i sekundet, men stuper på MoE
Regn med rundt 33 tokens i sekundet: et førstegenerasjons Intel Arc A750 kjører Gemma-4-E4B gjennom llama.cpp og Vulkan, men faller til 3,5 tokens i sekundet på MoE-modeller.
33 tokens i sekundet, med dropp ned mot 28. Det er det et Intel Arc A750 leverer på Gemma-4-E4B i Q4_K_M, ifølge en gjennomgang hos XDA Developers der kortet ble hentet frem fra skuffen og satt i en gammel hjemmeserver. Skribenten ventet under 15, og endte altså bare 4 til 6 tokens i sekundet bak et GTX 1080 på samme modell.
Oppsettet er enklere enn ventet, og det er halve poenget. Kortet står i en Proxmox-vert med to Xeon E5-2650 v4 og 64 GB DDR4 ECC, og Proxmox oppdaget det uten videre, i motsetning til skribentens GTX 1080. Vulkan-driverne kom fra mesa-vulkan-drivers, vulkan-tools og libvulkan1, GPU-en ble sendt videre til en Debian-container med det ferdige passthrough-skriptet fra ProxmoxVE, og llama.cpp ble bygget med cmake -B build -DGGML_VULKAN=ON. Ingen Intel-spesifikk verktøykjede, ingen oneAPI. Modellen ble startet med llama-server og en MMPROJ-fil ved siden av, og tok imot bilder, lydklipp og store regneark uten problemer.
Mixture-of-Experts er der det ryker. Gemma-4-26B-A4B med 30 lag avlastet til CPU ga 3,5 tokens i sekundet, mot 14 og oppover på det samme GTX 1080-kortet med 8 GB VRAM. Å senke avlastingen til 20 lag fikk llama.cpp til å krasje, 25 lag med kontekstvinduet nede i 10 000 tokens ga samme resultat, og GPT-OSS-20B oppførte seg likt. Skribenten fant GitHub-tråder om at Intel-GPU-er gjør det dårlig med MoE-avlastningsflagg, så det kan være en feil i llama.cpp snarere enn i maskinvaren. Konklusjonen er nøktern: et Arc-kort er ikke verdt å kjøpe for å kjøre modeller lokalt, men har du et liggende, driver det fint en tett modell i 4B-klassen.
Hva bør du gjøre?
- Bygg llama.cpp mot Vulkan i stedet for å lete etter en Intel-spesifikk sti. To cmake-kommandoer og tre Vulkan-pakker er hele avhengighetslista, og
vulkaninfo | grep -i deviceNamebekrefter at kortet er synlig inne i containeren. - Hold deg til tette modeller på et Arc-kort. En 4B-klasse modell i Q4_K_M med multimodal MMPROJ er det oppsettet som faktisk leverer brukbar hastighet her.
- Mål MoE-avlastningen selv før du planlegger rundt den. Tallene over er fra ett kort på Vulkan, og om det er llama.cpp eller maskinvaren som står i veien er ikke avklart.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.