Sikkerhetstrening nådde 84,75 prosent avslag, og avviste 74 prosent av ufarlige spørsmål
Viser en studie fra Multiverse Computing at sikkerhetstrening som løfter avslagsraten på skadelige forespørsler, samtidig kan gjøre modellen ubrukelig på de lovlige forespørslene rett ved siden av.
På Qwen3-8B løftet trening på politiske avslagsdata andelen avviste forespørsler innenfor fordelingen fra 9,47 til 84,75 prosent, og gjennomsnittlig andel usikre svar på HarmBench, StrongREJECT og WildJailbreak falt fra 26,26 til 0,14 prosent målt med LlamaGuard-3. Ved samme sjekkpunkt steg overavslag på XSTest fra 2,00 til 74,00 prosent. Konfigurasjonen med lavest andel skadelige svar er altså den samme som avviser nesten tre firedeler av åpenbart trygge forespørsler.
Studien, som Multiverse Computing beskriver på Hugging Face-bloggen, angriper et smalere problem enn vanlig sikkerhetsjustering. Spørsmålet er hvilken delmengde av et tema som er uforenlig med en gitt utrullingspolicy, ikke om hele temaet skal avvises. Forfatterne bruker politisk overtalelse som testbenk, fordi manipulerende overtalelse kan gjøre reell skade mens faktisk politisk informasjon er legitim. LlamaGuard-3 dekker til sammenligning valg kun som «faktisk uriktig informasjon om valgsystemer og valgprosesser», noe som både utelater overtalelse og utelater de faktabaserte forespørslene en tjeneste må fortsette å svare på.
Tre svakheter i den vanlige selvgenererings-oppskriften faller ut av den innrammingen. Ett enkelt styringsforsøk gir ikke alltid et godkjent avslag, og de forespørslene forsvinner stille ut av treningssettet. En eskalerende retry-strategi tar frafallet fra 19,88 til 0,20 prosent og etterlater 40 293 skadelige treningsforespørsler. Videre bygger forfatterne inn 11 955 verifiserte harmløse forespørsler som ser farlige ut på overflaten, fordelt på 18 semantiske typer. Til slutt måler holdt-ut par, 1 539 på hver side, selve formen på grensen, i stedet for å belønne en modell som bare utvider avslaget innover i det tillatte.
For deg som finjusterer egne modeller er konsekvensen at en avslagsrate alene ikke sier om modellen ble tryggere eller bare mer ubrukelig, og at begge sider av grensen må rapporteres sammen for at tallene skal bety noe.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.