Mistral slipper Shieldstral: 3B-moderasjonsmodell som leser reglene som tekst
Slipper en moderasjonsmodell på 3 milliarder parametere med åpne vekter som leser sikkerhetsreglene som vanlig tekst i hver forespørsel.
84,9 prosent gjennomsnittlig F1 på tekstsikkerhet, på nivå med GPT-OSS-Safeguard-20B som er nesten sju ganger så stor. Mistral AI la ut Shieldstral 1.0 3B på Hugging Face 4. august under Apache 2.0-lisens, og tallene kommer fra selskapets egen tekniske rapport, målt på benchmarks selskapet selv har valgt.
Det interessante er ikke størrelsen, men hvor policyen bor. Vanlige guard-modeller har en fast taksonomi av skadekategorier bakt inn i vektene, så en ny produktkontekst betyr ny trening. Shieldstral tar i stedet inn tre felter per forespørsel: en instruksjon om kontekst og strenghet, ett ja/nei-spørsmål av typen «Fremmer dette innholdet fysisk vold?», og innholdet som skal vurderes. Modellen leser bare logit-verdiene for «yes» og «no» fra ett enkelt forward-pass og normaliserer dem til en kontinuerlig score med terskel på 0,5. Samme sjekkpunkt kan dermed vurdere et sikkerhetsverktøy og en tjeneste for psykisk helse etter helt ulike standarder, uten finjustering.
Under panseret er modellen bygget på Ministral-3-3B-Base-2512 med Pixtral-billedkoder for bildeinnhold, trent på sekvenser opp til 32k tokens, og den kjører på én GPU. Modellkortet lister tolv språk. Norsk er ikke blant dem.
Den svake flanken er flerspråklighet. Rapportens eget vedlegg viser at modellen ligger bak flere konkurrenter på arabisk og indonesisk, og Mistral oppgir ujevn språkdekning som en kjent begrensning og et av de neste arbeidsområdene. Konkurrenten som slår den på policy-tilpasning, GPT-OSS-Safeguard-20B, genererer en lang resonneringstekst før den svarer. Shieldstral bruker ett token.
Hva bør du gjøre?
- Last ned vektene fra Hugging Face og test dem mot dine egne policy-spørsmål, ikke mot benchmarken.
- Formuler hver regel som ett ja/nei-spørsmål og kalibrer terskelen selv, siden 0,5 bare er standardvalget.
- Mål treffsikkerheten på norsk før du setter modellen i produksjon, siden norsk ikke er blant de tolv trente språkene.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.