Ternary Bonsai 2 27B presser Qwen3.8 27B ned i 5,9 GB
Kjør en 27B-modell lokalt på 5,9 GB: PrismMLs Ternary Bonsai 2 27B komprimerer Qwen3.8 27B og oppgir 98,2 prosent av full presisjon.
1,76 effektive bits per vekt er tallet som bærer denne utgivelsen. PrismML har komprimert Qwen3.8 27B til ternære vekter, altså minus én, null eller pluss én, med FP16-skalering per gruppe. Resultatet er en modell på 5,9 GB, over ni ganger mindre enn utgangspunktet, som selskapet måler til 83,9 i samlet benchmarkscore og 98,2 prosent av full-presisjonsmodellen. Lavbitrepresentasjonen er brukt gjennom hele språkmodellen, ikke bare på utvalgte lag.
Forrige generasjon Bonsai 27B kom for to måneder siden, og PrismML oppgir at gapet til full presisjon er lukket fra 95 til over 98 prosent. Selskapet peker selv på hvor slike gap gjør mest skade: kodeagenter, verktøybruk, multimodale arbeidsflyter og oppgaver over mange steg er særlig følsomme for degradering, fordi små feil forplanter seg gjennom kjeden. Det er nettopp der PrismML hevder at kapasiteten er bevart.
Vektene er Apache 2.0, kontekstvinduet er 262K tokens og modellen tar både tekst og bilde inn. Hastigheten oppgis til opptil 143 tokens i sekundet på RTX 5090 og 46,8 på M5 Max. På RTX 4090 bruker den 0,714 mWh per token, som PrismML oppgir er 40 prosent mer energieffektivt enn en 8B-modell i full presisjon.
«Lavbitmodeller kan endre økonomien og arkitekturen i KI-systemer på tvers av enheter, arbeidsstasjoner og datasentre.» PrismMLs kunngjøring av Bonsai 2 27B
Haken ligger i kjøretiden. Bonsai 2 27B går på NVIDIA-GPU-er via CUDA og på Mac, iPhone og iPad via MLX, men gjennom PrismMLs egne lavbitkjerner. Kunngjøringen nevner ingen andre kjøretider. Du bytter altså vekk kjøretidsvalget ditt mot et fottrykk som er over ni ganger mindre, og den avveiningen ser forskjellig ut avhengig av hvor mye du har bygget rundt et eksisterende oppsett.
Alle tallene er PrismMLs egne, målt på deres egen benchmarksuite, og fulle per-benchmark-resultater ligger i et whitepaper framfor i kunngjøringen. Det er en viktig reservasjon når du sammenligner med andre kvantiseringsprosjekter: en samlet score på 98,2 prosent sier lite om hvilke oppgaver som eventuelt faller, og uavhengige målinger av samme modell kan lande annerledes fordi de bruker et annet sett oppgaver.
Det praktiske poenget er likevel konkret. PrismML oppgir at modellen kjører på iPhone og iPad i tillegg til Mac og NVIDIA-kort, og en 27B-klasse modell med bildeinput på et fottrykk i denne størrelsen flytter oppgaver som dokumentanalyse og skjermbildetolkning inn på maskinen du allerede har. For arbeidsflyter der innholdet ikke skal forlate enheten, er det forskjellen på om oppgaven i det hele tatt kan kjøres.
Hva bør du gjøre?
- Sjekk kjøretiden før vektene. Har du bygget stacken din rundt llama.cpp eller Ollama, må du vurdere om PrismMLs CUDA- eller MLX-kjerner er verdt oppsettet.
- Mål på dine egne oppgaver. En samlet retensjon på 98,2 prosent er et gjennomsnitt, og det er verktøykall og lange agentløkker som først avslører hva som mangler.
- Er du på Apple-silisium, er MLX-veien den korteste. PrismML oppgir 46,8 tokens i sekundet på M5 Max.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.