Swift-Qwen3.8-27B tenker 58 prosent kortere og svarer 1,95 ganger raskere
Kutter tenketokenene til Qwen3.8-27B med 58,3 prosent uten at treffsikkerheten faller mer enn ett prosentpoeng.
58,3 prosent færre tenketokener i median og 1,95 ganger raskere gjennomkjøring: det er tallene UkisAI oppgir for Swift-Qwen3.8-27B, en finjustert utgave av Alibabas Qwen3.8-27B som nå ligger på Hugging Face. Modellkortet oppgir under ett prosentpoeng tap i score på de fleste benchmarkene, og vektene er lastet ned 2 753 ganger den siste måneden.
Metoden er smalere enn vanlig destillering. UkisAI identifiserte det de kaller resonnerings-markørtokener, altså ord og fraser som utløser overtenkning i Qwens resonneringsspor, og straffet bruken av dem under finjusteringen. Modellen inneholder i tillegg en overføringskomponent hentet fra BottleCap AIs ThinkingCap-Qwen3.6-27B. Treningen gikk på åtte NVIDIA H100-kort.
«Vi ble skikkelig irriterte av tilfeldige resonneringssløyfer da vi kjørte kvantiserte Qwen 3.8 27B-instanser. Sløyfene var vedvarende både på medium og lav resonnering.» — kisjovan, UkisAI, i Show HN-tråden om modellen
Tallene er ujevne på tvers av oppgavetyper. På GPQA-Diamond faller scoren fra 88,38 til 88,28 prosent mens medianen av tenketokener går ned 58,3 prosent. På LiveCodeBench v6 går scoren faktisk opp, fra 76,76 til 81,55 prosent. Matematikk betaler mest: AIME 2026 faller fra 98,67 til 94,00 prosent og HMMT fra 99,33 til 96,00 prosent. Er oppgavene dine matte-tunge, er det der kuttet merkes.
Gevinsten holder seg også når du skrur ned innsatsen selv. UkisAI oppgir 41,0 prosent kortere tenkning på xhigh, 22,7 prosent på medium og 25,8 prosent på low. Sammenligningen som betyr mest praktisk er Swift på xhigh mot basemodellen på medium: 88,28 mot 84,14 prosent på GPQA-Diamond, med 8 855 mot 4 451 tenketokener i snitt. Du betaler altså flere tokener enn den sparsomme baseinnstillingen, men får bedre score.
Alle er ikke overbevist om at 27B er riktig størrelse å optimalisere i det hele tatt.
«Jeg ville så gjerne kjøre Qwen3.8-27B lokalt på en fullastet M1 Max med 64 GB, men MLX-akselerasjonen var så dårlig at jeg heller bruker billige tokener fra skyen.» — bellowsgulch, Hacker News
Lisensen bør leses før du planlegger produksjon. Basemodellen er Apache 2.0 fra Alibaba Cloud, mens UkisAIs egne vekter ligger under Swift Open License v1.0. Personlig bruk, forskning, utdanning, evaluering og kommersiell bruk er gratis for organisasjoner med inntil én million dollar i årlig bruttoinntekt. Over den terskelen kreves en egen Swift Enterprise License.
Hva bør du gjøre?
- Server modellen med vLLM eller SGLang og sett resonneringsparseren til qwen3. Modellkortet oppgir 262 144 tokens kontekst i BF16, og tensor-parallellismen må justeres etter GPU-minnet ditt.
- Skru på MTP-hodet hvis du vil ha selv-spekulativ dekoding. Vektene inneholder basemodellens MTP-hode, og vLLM aktiverer det med speculative-config satt til mtp.
- Test på dine egne matteoppgaver før du bytter. Det er der kuttet koster mest presisjon, og UkisAI tilbyr et gratis testendepunkt uten API-nøkkel hvis du vil prøve før du laster ned 27 milliarder parametere.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.