M5 Ultra leser prompter 150 prosent raskere, men RTX 5090 leder fortsatt
Leser M5 Ultra Mac Studio prompter 150 prosent raskere enn M3 Ultra, mens en RTX 5090 fortsatt genererer rundt 25 prosent raskere på alle promptstørrelser.
En RTX 5090 slår Apples nye toppmaskin på begge hastighetsmålene og har 32 GB VRAM. M5 Ultra har 256 GB delt minne og taper på hastighet. Det er hele avveiningen for lokale agenter, og MacStories har målt den over fire dager med en M5 Ultra Mac Studio mot en M3 Ultra med 512 GB og en 5090 i en gaming-PC.
Prompt-prosessering er der spranget ligger. Den er opp 150 prosent i snitt fra M3 Ultra, det testeren beskriver som rundt 2,5 ganger bedre enn forrige oppsett, mens generering er omtrent 70 prosent raskere side ved side i Open Minis. Qwen3.8-Flash-Next klarer over 100 tokens i sekundet på korte prompter og holder 60 til 85 med 64K til 256K kontekst bak seg. Under panseret sitter en firedelt arkitektur der UltraFusion kobler sammen to M5 Max-brikker, 80 GPU-kjerner med hver sin Neural Accelerator, og en minnebåndbredde som har gått fra 819 GB/s til 1,2 TB/s.
Mot 5090-en holder regnestykket seg nøkternt. På en prompt på 6 000 tokens leste M5 Ultra rundt 1 700 tokens i sekundet mot NVIDIA-kortets rundt 3 000, og kortets 1,79 TB/s gir det et jevnt forsprang på generering. Men skal du kjøre noe som ikke får plass i 32 GB, må 5090-en flytte modellag over PCIe til systemminnet. Ved 256K kontekst kommer den bare i mål med en 8-bits attention-cache.
Poenget testeren selv trekker fram, er ikke toppfarten. Et team av lokale agenter på DeepSeek V4 Flash og olmOCR kjørte døgnet rundt i 99 dager over 310 dokumenter, til en samlet API-kostnad på null kroner.
Hva bør du gjøre?
- Regn i minne før du regner i tokens per sekund. Modellen du vil kjøre avgjør maskinen, ikke omvendt, og 32 GB VRAM setter et hardt tak som ingen båndbredde kompenserer for.
- Vent på 512 GB-varianten hvis du sikter mot de største åpne modellene. MacStories oppgir at den kommer i slutten av oktober.
- Kopier testoppsettet hvis du skal sammenligne selv. Målingene ble kjørt med oMLX 0.7.0.dev2 på macOS 27 og LM Studio med CUDA 12 på Windows, med alle 66 lag lagt på GPU.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.