Unsloth Desktop 0.1.801 ruller chatten forbi kontekstgrensen
Oppdater til Unsloth Desktop 0.1.801 hvis du kjører lange lokale chatter: eldre turer rulles nå ut i et søkbart arkiv i stedet for å bli kastet.
Over 200 pull requests er slått sammen i Unsloth Desktop 0.1.801-beta, som Unsloth ga ut torsdag 20. august ifølge utgivelsesnotatet på GitHub. Den tyngste endringen heter auto compaction og angriper problemet alle som kjører en lokal modell kjenner: samtalen treffer kontekstvinduet, og noe må ut.
Unsloth løser det uten å oppsummere. Hele de eldste turene fjernes fra aktiv kontekst, aldri midt i en melding, og den lagrede transkripsjonen røres ikke. De utkastede turene indekseres i et søkbart arkiv per tråd via Unsloths eksisterende RAG-pipeline, og et oppslag tvinges fram under selve utkastingen i stedet for at modellen må huske å søke på egen hånd. Leksikalsk søk prioriteres, fordi det du leter etter i en chatlogg som regel er et eksakt treff: et navn, et tall, en ID.
«No summarization: it showed little benefit and added ~190s per compaction» — Unsloths utgivelsesnotat for 0.1.801-beta
Oppsummering er standardgrepet i de fleste agent-rammeverk, og her måler Unsloth det til rundt 190 sekunder ekstra per komprimering uten nok gevinst til å forsvare ventetiden. Arkivet består på tvers av kontekst-epoker, så en senere komprimering kan hente tilbake noe som ble kastet ut tidligere.
Nummer to på lista er nettverkstilgang. Remote & LAN access, merket preview, lar deg nå Unsloth fra en annen maskin på samme nett uten Cloudflare-lenke, med tilkoblingsadresser, QR-kode og valgfri autostart. Funksjonen er avslått som standard og krever at du bytter det genererte admin-passordet før den kan slås på. Fornuftig default, men husk hva du åpner: et inferens-endepunkt som alt på LAN-et kan nå.
For deg som skrur på oppsettet er den tredje endringen den viktigste. 0.1.801 tar egne llama.cpp-bygg, og du får brytere for Cache RAM, mmap, mlock, sjekkpunkter, KV-cache for spekulativ dekoding og vision av eller på. Intel XPU er lagt til, ROCm, xFormers og flash-attention spiller bedre sammen, og valideringen fanger opp manglende GPU-støtte og for store GGUF-filer før du starter. Responses-API-et støtter nå strukturert output, og llama-server kommer seg bedre etter krasj.
Utgivelsen følger Unsloth Dynamic 3.0-kvantiseringene fra forrige uke. Teamet oppgir at de nye Qwen3.8-27B-GGUF-ene med Dynamic v3.0 gir over 10 prosent høyere top-1-nøyaktighet enn alternativene, et tall selskapet måler selv og som ingen tredjepart har etterprøvd.
Hva bør du gjøre?
- Oppdater til 0.1.801-beta hvis lange chatter er arbeidsflyten din, og se på kontekstvindu-informasjonen som nå vises før chatten starter.
- La LAN-tilgang stå av til du faktisk trenger den. Slår du den på, bytt admin-passordet og behandle maskinen som en server på nettet ditt.
- Bygg llama.cpp selv hvis du er avhengig av en flagg-kombinasjon som ikke har rukket å bli med i det medfølgende bygget.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.