Mistrals Shieldstral på 3B matcher en sikkerhetsmodell sju ganger så stor
Bytt ut den faste risikotaksonomien i filteret ditt med ja- eller nei-spørsmål du selv formulerer ved kjøretid.
Shieldstral har 3 milliarder parametere og scorer 84,9 prosent F1 på de kombinerte tekstbenchmarkene for innholdssikkerhet. GPT-OSS-Safeguard-20B, som er rundt sju ganger større, lander på samme tall. Det er hovedfunnet i en ny artikkel fra Mistral, med medgrunnlegger Guillaume Lample blant forfatterne, omtalt av The Decoder.
Den viktigere endringen er ikke størrelsen, men grensesnittet. De fleste guardrail-modeller sorterer innhold etter en fast taksonomi bestemt under trening. Forfatterne peker på to problemer med det: offentlige sikkerhetsdatasett grupperer risiko for ulikt til å dele én felles taksonomi, og de samme reglene passer uansett ikke alle bruksområder. Innhold som er helt greit i et sikkerhetsverktøy kan være skadelig på en plattform for psykisk helse. Shieldstral snur på det. Du forteller modellen hva den skal se etter med et spørsmål i klartekst, for eksempel om innholdet oppfordrer til vold, og modellen svarer bare ja eller nei. Sannsynligheten for hvert svar blir til en sikkerhetsscore mellom null og én.
På bilder og kombinasjoner av bilde og tekst scorer Shieldstral 83,8 prosent, mot 77,6 for OmniGuard-7B og 71,6 for LlavaGuard-7B. Den taper derimot på tilpasningstesten, der reglene er helt nye eller avviker fra treningskategoriene: 91,3 prosent mot GPT-OSS-Safeguard-20B sine 94,1. Forfatterne argumenterer for at Shieldstral likevel er mest praktisk, siden de større konkurrentene genererer lange resonneringssekvenser som koster beregning, mens Shieldstral returnerer ett ord.
Treningsoppskriften forklarer tilpasningsevnen. Rundt 54,1 millioner eksempler ble slått sammen til ett format, og teamet brukte en annen språkmodell til å skrive om trygg tekst til utrygge varianter. Hvert eksempel fikk også en lignende, men annerledes kategori som skulle avvises, slik at modellen lærte å skille mellom nært beslektede regler i stedet for å dømme grovt trygg eller utrygg. I en valideringstest med finmaskede kategorier løftet de syntetiske kategoridataene F1-scoren med 23,3 prosentpoeng.
Hvorfor dette betyr noe for deg som bygger: klassifikatoren står i veien for hvert eneste kall, både på vei inn og på vei ut, så størrelsen dens går rett i latens- og regningsbudsjettet ditt. The Decoder minner samtidig om hva dårlig innstilte filtre koster i praksis, og viser til Artificial Analysis sin måling av at et system automatisk rutet åtte til ni prosent av oppgavene til en svakere modell, og til brukere som fikk MRI-analyse flagget som bioterror. Shieldstral er bygget på Ministral-3B med Pixtral sin bildeenkoder, og vektene er tilgjengelige under Apache 2.0.
Hva bør du gjøre?
- Skriv screeningkriteriene dine som spørsmål som passer akkurat din app, i stedet for å arve andres kategorier. Det er hele poenget med kjøretidsreglene, og du slipper å trene noe på nytt når kravene endrer seg.
- Mål latensen klassifikatoren legger på, ikke bare treffsikkerheten. Ett ord ut mot lange resonneringssekvenser er forskjellen som avgjør om filteret er brukbart i en interaktiv løkke.
- Test med kategorier du selv finner på og som ikke ligner treningsdataene. Det er der Shieldstral ligger nesten tre prosentpoeng bak den største konkurrenten, og der ditt eget bruksområde sannsynligvis lever.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.