Kev-9B ligger 3,5 poeng bak Jev, men ruter syntetiske supportsaker bedre
Kjør Jev-lignende beslutningsmodeller på egen maskin: Jared Palmer slapp 20. september Kev i 0,8B, 4B og 9B med vekter, treningskode og evalueringsdata under Apache 2.0.
På utviklingssettet med kilder modellen aldri har sett, treffer Kev-9B 0,822 mot 0,857 for hostede Jev, en forskjell på 3,5 poeng. På en ekstern testmengde snur bildet delvis: prosjektet scienthoon har generert 900 syntetiske supportsaker med et regelbasert skript, og der ruter Kev-9B 0,952 riktig mot Jevs 0,897, mens Jev er marginalt best på tonevurdering med 0,914 mot 0,911. Settet er laget nettopp fordi det ikke kan ligge i treningsdataene til noen av dem.
Kev er ingen chatmodell. Den tar én tekst og et sett spørsmål av tre typer, ja/nei, flervalg og skala, og svarer med sannsynlighetsfordelinger i stedet for løpende tekst. API-et følger TypeSafes System One, så den offisielle Python-SDK-en trenger bare en ny base_url for å peke på din egen server. Kev-4B og Kev-9B får plass på en Mac med 32 GB i bf16, og alle tre modellene fikk 21. september en kort ekstra treningsrunde som løftet Kev-9B fra 0,837 til 0,852 på testsettet.
«Vi vet ikke hvilke datasett Jev er trent på, så dette er ikke en kontrollert sammenligning av de to arkitekturene» — README-en i jaredpalmer/kev
Begrensningslista er der de praktisk viktige tallene ligger. Hvert sjekkpunkt lagrer nå en temperatur på rundt 2,1 til 2,4 som kalibrerer sannsynlighetene når modellen lastes, og den senker andelen selvsikre feil, altså gale svar med minst 0,9 sannsynlighet, fra 8,7 til 4,0 prosent på nye kilder. Det er omtrent Jevs 3,7 prosent. Andelen beslutninger du kan automatisere innenfor et feilbudsjett på 5 prosent ligger likevel på 0,45 til 0,57 mot Jevs 0,70. Datoregning er den tydeligste svakheten: Kev-9B lander på 0,80 på fristspørsmålene mot Jevs 0,93, og innstillingen KEV_DATE_FACTS=1, som legger inn antall dager mellom to datoer i teksten, løfter den til 0,90.
Hastigheten er den andre bøygen. På Apple Silicon finnes det ingen raske kjerner for DeltaNet-lagene i Qwen3.5, så PyTorch kjører referansekode: fem spørsmål mot en tekst på rundt 230 tokens tar 779 millisekunder med Kev-4B og omtrent to sekunder med Kev-9B på en M5. Forrige generasjon, bygget på Qwen3-baser, gjør samme jobb på 174 og 300 millisekunder og er fortsatt publisert. Serveren håndterer dessuten én forespørsel om gangen uten batching på tvers av kallere, og treningen brukte maks 1 024 tokens for tekst pluss ett spørsmål selv om serveren aksepterer 8 192.
Hva bør du gjøre?
- Start med Kev-4B og hev til 9B først når treffsikkerhet og kalibrering betyr mer enn minnebruk. Begge krever
transformers5.17 eller nyere. - Mål kalibreringen på dine egne data før du velger en terskel. De publiserte tallene er kjørt i fp32, ikke i bf16-serveringsstien du faktisk bruker.
- Test rekkefølgen på svaralternativene i playgrounden. Permute-modusen kjører samme flervalgsspørsmål i seks ulike rekkefølger, og svaret kan endre seg.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.