Ollama 0.40-rc2 gjør MLX til standardmotor på Apple Silicon
Test Ollama v0.40.0-rc2 hvis du kjører lokale modeller på en Mac, for forhåndsutgivelsen sender støttede modeller til Apples MLX-rammeverk uten at du velger det selv.
Til nå har Ollama pekt Mac-brukere til egne MLX-varianter, som gemma4:12b-mlx i juni og en NVFP4-kvantisert Qwen-variant i mars. I v0.40.0-rc2 er det omvendt: på Apple Silicon kjører alle modellarkitekturer som MLX-runtimen støtter, automatisk på MLX. Eksempelet i release-notatene er bare ollama pull qwen3.8 fulgt av ollama run qwen3.8, uten tag-suffiks.
MLX-motoren har vært under arbeid siden forhåndsvisningen 30. mars, der Ollama varslet 1851 token/s prefill og 134 token/s decode med int4-kvantisering på Qwen3.5-35B-A3B. I juni ble motoren opptil 20 % raskere, og Ollama la til snapshots av modelltilstanden der samtaler forgrener seg, slik at subagenter og tenkemodeller slipper å prosessere den samme konteksten om igjen.
«Agent workloads are dominated by prompt processing.» — Ollama, i bloggposten om MLX-ytelse fra juni
Det er derfor endringen betyr mest for deg som kobler Claude Code, OpenCode eller Pi til en lokal modell: hvert verktøykall sender hele transkriptet på nytt.
Begrensningene står i notatene. Dette er en pre-release, og Ollama skriver at flere modeller skal testes og slås på underveis, uten å liste hvilke arkitekturer som er med nå. Release-pakkene har også egne -mlx-bygg for Linux og Windows på amd64, men notatene omtaler bare Apple Silicon. Siste stabile versjon er fortsatt 0.35.1.
Hva bør du gjøre?
- Installer Ollama.dmg fra release-siden for v0.40.0-rc2 på en Mac der det går greit om noe brekker.
- Kjør samme modell på 0.35.1 og rc2 med
ollama run --verboseog sammenlign eval rate i token/s. - Bli på 0.35.1 på maskinen som serverer agentene dine til stabil 0.40.0 er ute.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.