AutoTrust slipper JEV-27B: Jev-lignende beslutninger fra en åpen modell på 54 GB
Velg JEV-9B framfor JEV-27B hvis du bare trenger ruting og moderering, og valider en konfidensterskel før agenten handler på svarene.
AutoTrust AI i Singapore har sluppet JEV-27B, en beslutningsmodell med åpne vekter under Apache 2.0, ifølge en pressemelding fra selskapet. Modellen er destillert fra TypeSafe AIs lukkede Jev 1.13 og svarer på ja/nei-spørsmål, flervalg og skår fra 0 til 5 i ett fremoverpass, med en kalibrert sannsynlighet for hvert alternativ. Trenings- og serveringskoden ligger på Hugging Face sammen med vektene.
Oppskriften er å fryse Alibabas Qwen3.8-27B og bare trene en beslutningsblokk på 108,9 millioner parametere, 0,4 prosent av modellen. Treningen tok rundt 9,2 timer på én Nvidia B200. En ruter sender hver forespørsel enten til beslutningsblokken (System 1) eller til den urørte genereringsdelen (System 2). Med blokken slått av var alle 164 HumanEval-svarene byte-identiske med basismodellens.
«Hver KI-agent er egentlig en lang kjede av små beslutninger: hvilken knapp den skal trykke, hvilken fil den skal åpne, hvilken kø en sak hører hjemme i.» — Josh Liu, styreleder og medgründer i AutoTrust AI
Tallene er AutoTrusts egne, noe selskapet selv understreker. På seks offentlige benchmarkgrupper fikk JEV-27B et snitt på 84,07 prosent mot 83,85 for den hostede Jev 1.13, høyere på fire grupper og lavere på to. Median beslutningstid var 137 ms på én B200, mot 238 til 301 ms målt mot Jev-API-et, men API-tallene inkluderer nettverkstid.
Modellkortet oppgir en nedlasting på rundt 54 GB i bf16. Forgjengeren JEV-9B gir nesten samme svar 2,6 ganger raskere på ruting, moderering og korte alternativlister, mens 27B-varianten anbefales for lange alternativlister, kodesjekker og svindelfiltrering. JEV-27B arver Jevs blindsoner: flertrinns resonnering, regning, datoer og fiendtlig input. Treningsdataene er engelskspråklige, og AutoTrust fraråder bruk i beslutninger med høy innsats.
Hva bør du gjøre?
- Start med JEV-9B hvis jobben er ruting eller moderering, og bytt bare til 27B-varianten for lange alternativlister eller kodesjekker.
- Mål treffsikkerheten på dine egne data og sett en terskel for når agenten får handle automatisk, slik AutoTrust selv anbefaler.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.