SynthID-vannmerking svekket avslagene i seks åpne modeller
Test modellene dine på nytt før du slår på vannmerking: SynthID-Text endret avslagsatferden i seks åpne modeller, sterkest under prompt-injeksjon.
De samme seks modellene med åpne vekter fikk de samme skadelige promptene to ganger: én gang med SynthID-Text aktivert, én gang uten. Med vannmerking svarte flere av dem på forespørsler de ellers avslo, skriver Ars Technica om ny forskning fra Lasso Security.
Bakteppet er en ny EU-lov som presser KI-plattformer til å merke innholdet de genererer. Anthropic har opplyst at kommende Claude-modeller skal bruke SynthID-Text, en metode Google har lagt ut som åpen kildekode. Den bytter ut den tilfeldige tallgeneratoren i token-samplingen med en hemmelig nøkkel: der toppkandidaten kunne vært «overskyet», velger nøkkelen kanskje «grått». Teknikken kalles tournament sampling, der kandidat-tokens konkurrerer parvis på skjulte poeng til én vinner står igjen. Den som kjenner nøkkelen kan regne ut sannsynligheten for at teksten kom fra modellen.
«Sammenlignet med de samme modellene uten vannmerking kommer dette helt sikkert til å endre oppførselen deres, særlig når vi setter dem under motstandsforhold, eller når vi får modellene til å kalle verktøy mens de driver en agent.» — Andrea Siposova, KI-sikkerhetsforsker i Lasso Security, til Ars Technica
Poenget som treffer deg som bygger agenter: de samme samplede tokenene avgjør både om modellen nekter og hvilket verktøy som kalles med hvilke argumenter. Siposova kaller effekten sampling drift. Et svekket avslag blir langt mer alvorlig når modellen også kan handle gjennom verktøy. Svarene varierte dessuten med hvilken hemmelig nøkkel som ble brukt.
Forbeholdene er reelle. Testen brukte Hugging Faces urørte SynthIDTextWatermarkLogitsProcessor i den ikke-distorderende konfigurasjonen, ikke implementasjonen Claude-modellene skal kjøre, og den målte ingen Claude-modeller.
Hva bør du gjøre?
- Kjør red team-testene dine på nytt med vannmerking slått på, ikke bare av. Avslagsatferden du målte uten vannmerke er ikke nødvendigvis den du får i produksjon.
- Test prompt-injeksjon spesifikt. Det er der effekten var størst, og det er også der agenten din har mest å tape.
- Behandle nøkkelen som en variabel i testoppsettet. Bytter du nøkkel, bytter du potensielt også oppførsel.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.