PrismML klemmer en 27 milliarder-parameter KI-modell ned til under 4 GB for iPhone
Komprimerer en 27 milliarder-parameter-modell til under 4 GB som kjører på iPhone 15 og nyere, med Apple som interessert testpartner.
Caltech-avleggeren PrismML slapp 14. juli en komprimert 27 milliarder-parameter-modell som får plass i under 4 GB minne og kjører på enhver iPhone 15 eller nyere. Ifølge CNBC bekrefter PrismML-sjef Babak Hassibi at Apple og flere unavngitte selskaper tester modellene, og måler hastighet, energibruk og ytelse på enheten.
«De evaluerer teknologien vår akkurat nå» — Babak Hassibi, sjef i PrismML, til CNBC
Timingen er tett: Apple åpnet første offentlige beta av iOS 27 den 13. juli, dagen før PrismML slapp modellen. iOS 27 er bygget rundt en ombygd Siri AI som i dag deler arbeidet mellom enheten og skyen, og spørsmålet Apple undersøker er om PrismMLs komprimering kan flytte mer av det tilbake til telefonen.
Skalaen er poenget. Alibabas Qwen3.6 27B, basismodellen PrismML jobbet med, tar rundt 54 GB ved vanlig 16-bits presisjon, og selv en aggressiv 4-bits variant krever cirka 18 GB. PrismMLs Bonsai 27B reduserer hver vekt til én bit i binærvarianten, eller tre mulige verdier i ternærvarianten, gjennom hele modellen. På PrismMLs egne målinger beholder 1-bits-modellen på 3,9 GB over 90 prosent av basismodellens ytelse, og kjører 11 tokens i sekundet på en iPhone 17 Pro. Tallene er selskapets egne og ennå ikke uavhengig verifisert.
Prisen betales først og fremst på faktakunnskap, som svekkes før høyere ferdigheter som resonnering og koding, ifølge Hassibi. Det er en interessant avveining for agent-oppgaver, der verktøybruk og flerstegsplanlegging holder seg bedre enn ren memorering.
PrismMLs tilnærming skiller seg fra Apples egen. Apples AFM 3 Core Advanced er en 20 milliarder-parameter-modell som lagrer vektene i flash og bare laster 1 til 4 milliarder inn i aktivt minne per forespørsel. PrismML holder alle 27 milliarder aktive samtidig, fordi hver vekt er krympet til én bit. Haken er at ternære vekter trenger native maskinvarestøtte for å gi reell fartsgevinst, og om Apples Neural Engine kan kjøre 1-bits matriseoperasjoner uten å pakke dem ut igjen, er fortsatt et åpent spørsmål.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.