PostHog Jeeves: 9B-modell tenker før den velger og slår Jev på JevBench hard
Bruk Jeeves når en Jev-lignende klassifisering krever resonnering, men sett et tak på tenkingen hvis svartiden betyr noe.
TypeSafes Jev og lignende beslutningsmodeller gir kalibrerte sannsynligheter, men lav treffsikkerhet, ifølge README-en til Jeeves. Jeeves, publisert under PostHogs GitHub-konto av Nicholas P. Waltz, går motsatt vei: modellen skriver en tankerekke per spørsmål før et pekerhode velger svar og gir en kalibrert sannsynlighet for hvert alternativ. Den bygger på Qwen3.5-9B med LoRA, trent med SFT og deretter forsterkningslæring med CISPO på 9 992 spørsmål.
På JevBench hard (111 offentlige oppgaver) får Jeeves 0,865 mot Jevs 0,730, og 0,889 mot 0,857 på testsettet den aldri ble trent på. Kunnskapsspørsmål er svakheten: 0,793 mot 0,900 på MMLU.
Prisen er tid. På ett H100 bruker et svar rundt 0,3 sekunder uten tenking, 3,3 sekunder i median med og 17,1 sekunder ved p90. Med max_think på 768 og nothink_threshold på 0,9 faller p90 til 5,6 sekunder, mens treffsikkerheten på dev-settet går fra 0,825 til 0,806. En diffusjonsbasert drafter øker dekodingen fra 109 til 176 tokens i sekundet.
«På min M5 Pro med 48 GB tok det over 30 minutter å avgjøre bare 100 tweets» — TN1ck, i Hacker News-tråden om Jeeves
Samme bruker fikk 68 riktige mot Jevs 79 på sin egen test med ironi i tyske fotballtweets. Koden er MIT-lisensiert, vektene Apache 2.0, og serveren snakker Jevs /v1/systemone-format.
Hva bør du gjøre?
- Start serveren med drafteren på en CUDA-maskin og pek Jev-klienten din mot den, siden
jeeves_sdker laget som erstatning for Jevs Python-SDK. - Kjør med
max_think768 ognothink_threshold0,9 først, og øk bare hvis treffsikkerheten på dine egne data krever det. - Behold Jev eller en større modell for spørsmål som hviler på faktakunnskap, der Jeeves ligger klart bak.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.