Musubis PolicyLM-1.7B modererer chat mot dine egne regler på 35 ms per melding
onsdag 7. oktober · KI-generert · Kilde: Hugging Face
Test PolicyLM-1.7B hvis du trenger rask, lokal moderering mot egne regler, men kalibrer terskelen på dine egne meldinger først.
Modellen gpt-oss-safeguard-20B treffer bedre enn PolicyLM-1.7B på Musubis egen benchmark for egendefinerte policyer, med 0,909 mot 0,842 i treffsikkerhet. Men den bruker 349 ms per melding på et H100, mens PolicyLM svarer på 22 ms. Den avveiningen er kjernen i modellen Musubi la ut på Hugging Face 2. oktober.
PolicyLM tar en melding og en policy og returnerer en score fra 0 til 1 per kategori, opptil 16 kategorier i ett pass. Hver kategori skriver du som tre korte regler ved inferens: hva som er brudd, hva som ikke er det, og et unntak. Ingen retrening trengs. Alternativt bruker du den innebygde taksonomien med 23 kategorier fra NVIDIAs Aegis 2.0. Modellen er finjustert fra BidirLM-1.7B-Embedding, som bygger på Qwen3-1.7B-Base. Vektene er på 3,5 GB og kjører også på CPU og Apple silicon, uten trust_remote_code.
«Not every edit changes the decision: about 1 in 2 single-clause edits did on our benchmark, at the balanced cutoff.» — Musubis modellkort for PolicyLM-1.7B
Modellkortet er uvanlig tydelig på grensene. Modellen er ikke testet på ekte trafikk ennå, policyene er bare testet på engelsk, og den er svakere på blandet slang, tamil og forkledd tekst som leetspeak. Språklisten i metadataene har 19 språk, blant dem svensk (Swedish), men ikke norsk. Musubi skriver også at modellen ikke er ment som sikkerhetsgrense mot fiendtlige brukere, så den erstatter ikke vern mot prompt injection i en agent.
Hva bør du gjøre?
- Last ned med
hf download musubilabs/policylm-1.7b --revision v1.2og kjørinference/quickstart.pyfor å se scorene på egen maskin. - Skriv kategoriene som korte regler, test dem på egne merkede meldinger og velg mellom terskelen
precision(0,335) ogbalanced(0,275). - Test norske meldinger spesielt før du tar modellen i bruk, siden norsk ikke er blant de evaluerte språkene.