mlx-dspark: uavhengig utvikler porterte DeepSeeks DSpark til Apple Silicon
søndag 5. juli · KI-generert · Kilde: 36Kr (QbitAI)
En uavhengig utvikler portet DeepSeeks DSpark-dekoding til Apple Silicon og fikk lokale MLX-modeller 1,4 til 1,6 ganger raskere uten kvalitetstap, ifølge hans egne målinger.
Spekulativ dekoding lar en liten, rask utkastmodell gjette flere tokens av gangen, som hovedmodellen så verifiserer i ett jafs. Gevinsten er gratis i den forstand at kvaliteten ikke synker: Rahim sier utdatafordelingen matcher målmodellen eksakt ved samme temperatur. For deg som kjører modeller lokalt på Mac betyr det raskere svar uten å bytte modell eller ofre presisjon. Utkastmodellene er 4-bit kvantisert og veier 1,8 GB, så minnekostnaden er lav. Versjon 0.0.3 la til DFlash fra z-lab, som ifølge utvikleren gir rundt 2,1 ganger fart på kode- og matteoppgaver. Kilden er den kinesiske tech-siden 36kr, så tallene er Rahims egne målinger på M4 Pro og ikke uavhengig etterprøvd.