Jeff: åpne 0,8B-modeller tar Jev-lignende valg på 28 ms på Apples M4 Max
Bruk Jeff til rask klassifisering lokalt, men finjuster på egne eksempler før du lar den ta valg som krever resonnering.
Ett RTX PRO 6000-kort til trening, to DGX Spark som skrev de syntetiske treningsdataene med Qwen3.8-Flash-Next, og en MacBook til testing, overvåket fra mobilen over Tailscale. Det er hele maskinparken bak Jeff, et sett små beslutningsmodeller fra utvikleren bak GitHub-kontoen firelex, som fikk over 100 poeng på Hacker News. Ingen sky-GPU-er ble brukt, og ingen output fra lukkede modeller havnet i treningsdataene.
Jeff er finjusteringer av Qwen3.5 0.8B, Qwen3.5 2B og Gemma 4 E2B for zero-shot klassifisering, med samme forespørselsformat som TypeSafes Jev. Du beskriver en situasjon og lister alternativene i vanlig tekst, og modellen gir en kalibrert sannsynlighet for hvert alternativ i ett fremoverpass. På Apple silicon kan Qwen-modellene kjøre på MLX.
2B-modellen får 83,1 prosent på et panel av fem benchmarker, mot Jevs publiserte 83,0, men tallene er målt på ulike utvalg. Jeff er sterkest på klassifisering, med 96 prosent på Financial PhraseBank, og svakest på resonnering, der BBH gir 64-68 prosent mot Jevs 94. En bruker på Hacker News målte 70 prosent mot Jevs 94 på sine egne oppgaver.
«Resonner i kode, bestem med Jeff. Den er en klassifiserer, ikke en planlegger.» — README-en til Jeff
README-en peker på finjustering som løsningen. En modell for stemmenavigasjon, finjustert på rundt 11 000 eksempler, gikk fra 31,7 til 95,8 prosent treffsikkerhet etter en halvtime på én GPU. Koden er MIT-lisensiert og vektene Apache 2.0, men modellene forstår bare engelsk tekst.
Hva bør du gjøre?
- Last ned Jeff-Qwen3.5-0.8B, start serveren med
uv run jeff-serveog test den på et utvalg av dine egne kategorier. - Skriv alternativene som konsekvenser i vanlig tekst, ikke som lange ID-er, slik README-en anbefaler.
- Finjuster med
autojev-trainpå egne eksempler hvis zero-shot ikke holder mål.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.