Macuda kjører llama.cpp med CUDA på RTX 5090 fra en Mac, uten NVIDIA-driver
Prøv Macuda bare hvis du har en Apple Silicon-Mac, et RTX 5090 i Thunderbolt-kabinett og en Linux-maskin med nvcc, for prosjektet er et imponerende hack og ikke en ferdig driver.
Samme RTX 5090 genererer 75,3 tokens i sekundet med Qwen3.8-27B i en Windows-PC med NVIDIAs driver 595.79, og 70,7 koblet til en M4 Max-Mac over Thunderbolt, uten NVIDIA-programvare på Mac-en. Tallene kommer fra Macuda, et MIT-lisensiert prosjekt GitHub-brukeren Davinchy la ut 16. september.
Tre biblioteker erstatter NVIDIAs stack. libtinynv er en C-port av userspace-driveren i tinygrad som booter kortets GSP-fastvare og styrer kanaler og kjerneoppstart. libtinycudart og libtinycublas gir de CUDA- og cuBLAS-kallene ggml faktisk bruker. Tilgangen til PCI-bussen går via tinygrads signerte TinyGPU.app med en DriverKit-utvidelse, og både llama.cpp og stable-diffusion.cpp kjører umodifisert.
Prefill ligger på paritet med rundt 2550 mot 2447 tokens i sekundet, og SDXL-Turbo lager et 512-bilde på 2,72 sekunder mot 4,11 native. MoE-modellen Qwen3.5-35B-A3B er det svake punktet med rundt 166 mot 245 tokens i sekundet. Der krever hvert token rundt 2000 kjerneoppstarter, og hver oppstart koster mer via denne stien enn med NVIDIAs driver.
Oppsettet krever også en Linux-maskin med CUDA 13 og nvcc over ssh for å kompilere GPU-koden, med mindre du har et ferdigbygd libggml-cuda.a for den låste llama.cpp-versjonen.
«Kortet er skjørt over Thunderbolt: en fastlåst GSP eller en DART-feil krever at du plugger det ut og inn igjen, og ingenting her kan gjøre det for deg» — Davinchy, README for Macuda
Hva bør du gjøre?
- Kjør sh tools/preflight.sh før du rører kortet, siden skriptet bare leser tilstanden og svarer med en VERDICT.
- Driv laptopen fra Apples egen lader og ikke via kabinettet, for Thunderbolt-tunnelen falt to ganger under full last med USB-C-strøm fra kabinettet.
- Start med tools/serve.sh, som gir en OpenAI-kompatibel llama-server på 127.0.0.1:8090.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.