Escha-W2 kjører en 35B MoE-modell i 2 bit på ett 24 GB-kort
Kjører en MoE-modell med 35 milliarder parametere på ett vanlig skjermkort etter 2-bits kvantisering.
12,3 GB på disk. Det er hele Escha-W2, Escha Labs sitt 2-bits bygg av Qwen3.6-35B-A3B, som selskapet la ut på Hugging Face 22. juli. Basismodellen er en Mixture-of-Experts med 256 eksperter, og pakken inkluderer en serverstack som legger vektene bak et OpenAI-kompatibelt HTTP-endepunkt, slik at klientene du allerede bruker kan peke rett på den.
Maskinkravet er der saken blir konkret for deg som vurderer å kjøre lokalt. Escha Labs oppgir 24 GB VRAM som anbefalt og 16 GB som minimum, der du på et 16 GB-kort må velge mellom færre samtidige strømmer eller kortere kontekst, ikke begge deler. Stacken kjører på Linux x86-64 med Python 3.12 for SGLang-motoren, eller som én enkelt binærfil via ZML-motoren helt uten Python.
Kvalitetstapet er selskapets eget regnestykke. Escha Labs måler 2-bits-bygget mot en FP8-utgave av samme modell, som selv krever rundt 35 GB, og oppgir 100,2 prosent gjennomsnittlig bevaring over seks kapabilitetsakser. Den ene reelle nedturen er langhorisont kodegenerering: LiveCodeBench faller fra 67,0 til 62,6, altså 93,4 prosent av referansen. Tallene er målt 27. juli i selskapets eget testoppsett, med selskapets eget valg av referansepunkt, og ingen uavhengig lab har etterprøvd sammenligningen.
Hva bør du gjøre?
- Pin torch til 2.9.x før du installerer escha-wheelen. Modellkortet advarer om at en løs versjonsangivelse henter 2.11 og gir «undefined symbol» etter flere gigabyte nedlasting.
- Kjør dine egne kodeoppgaver mot modellen før du bytter ut en hostet toppmodell. Det er der 2-bits-bygget taper mest.
- Velg SGLang-motoren hvis kortet ditt har 16 GB. ZML-binæren krever de 24 GB-ene den ber om, og feiler med HTTP 500 på lange prompts under det.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.