Qwen 3.8 27B brukte 21 minutter på én SVG med standardinnstillingen
Kjør Qwen 3.8 27B lokalt fra en fil på 17 GB med full kontekst og lav resonnering, så får du verktøykalling, bildeforståelse og kodegenerering på en laptop.
«Min sterke anbefaling: ignorer den standarden», skriver Simon Willison om Qwen 3.8 27B, modellen Alibabas Qwen-lab slapp under Apache 2 forrige fredag. Willison kjørte den 17 GB store Q4_K_M-kvantiseringen i LM Studio på både en MacBook Pro med M5 Max og 128 GB minne og en NVIDIA DGX Spark. Det første han støtte på var at LM Studios standard kontekstvindu på 8 192 tokener ble spist opp av tenkingen alene.
Etter at han lastet modellen med hele kontekstlengden på 262 144 tokener forsvant det problemet, men ikke overtenkingen. Den beste pelikan-SVG-en Willison har fått ut av en lokal modell tok 21 minutter og 22 276 resonneringstokener for å produsere 3 223 tokener output. Samme prompt med resonnering slått av ga 3 715 tokener på 137 sekunder. Qwens egen dokumentasjon setter xhigh som standard for reasoning_effort, med medium og low som alternativer.
«Var det verdt å vente 21 minutter på? Absolutt ikke.» — Simon Willison, utvikler
Modellen er langt mer enn en tegnedemo. Willison ba den returnere JSON-avgrensningsbokser rundt pelikaner i et foto på en skala fra 0 til 1000, og fikk to bokser som traff. Han koblet den også til kodeagenten Pi, med LM Studio kjørende på Spark-maskinen og delt over tailscale serve, og lot den svare på spørsmålet «how does auth work?» i Datasette-kodebasen. Deretter fikk han den til å skrive og teste et Python-skript som konverterte agentens JSONL-transkript til markdown.
Flaskehalsen er hastighet. Willison måler 15 til 30 tokener i sekundet fra LM Studio, mot 74 for OpenAI 5.6 Sol og 184 for 5.6 Luna slik Artificial Analysis rapporterer det. Qwen 3.8 27B støtter Multi-Token Prediction, der en billigere mekanisme gjetter flere tokener fram og hovedmodellen verifiserer gjetningene. Etter et tips fra llama.cpp-skaper Georgi Gerganov kjørte Willison llama serve med draft-mtp som spekulativ type, og en sammenlignende benchmark på Spark-maskinen ga rundt 72 prosent bedre ytelse enn LM Studios standard-GGUF.
Poenget Willison sitter igjen med er ikke pelikanen. En fil på 17 GB gir deg lang kontekst, fungerende verktøykalling, brukbar bildeforståelse og kodegenerering som holder til en agentloop, på maskinvare du kan ha stående hjemme. Det som holder modellen fra å bli en daglig arbeidshest er minnebåndbredde: tette modeller uten Mixture-of-Experts krever mye av den, og verken M5 Max eller DGX Spark ligger i toppsjiktet der.
Hva bør du gjøre?
- Sett reasoning_effort til low, eller slå resonneringen helt av, første gang du laster modellen. Standarden xhigh er ikke et fornuftig utgangspunkt på forbrukermaskinvare.
- Last modellen med full kontekstlengde i stedet for LM Studios standard på 8 192 tokener. Tenkingen alene spiser opp vinduet.
- Test draft-mtp i llama.cpp hvis maskinvaren din tillater det. Willison måler rundt 72 prosent raskere enn standardoppsettet.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.