MLCommons katalogiserer 25 personvernrisikoer ved KI-agenter i første utkast
Bruk MLCommons' nye taksonomi som et kart over hvor en KI-agent kan lekke persondata, fra trajectory-logger og minne til slettinger som aldri når fram.
En chatbot som lekker persondata, rammer stort sett bare brukeren den snakker med. En agent med minne, verktøy og andre agenter rundt seg kan spre dataene mye lenger. Det er utgangspunktet for Agent Privacy Risk Taxonomy v0.1, som MLCommons publiserte 1. oktober. Utkastet har 19 forfattere fra MLCommons' arbeidsgruppe for personvern.
Taksonomien fordeler 25 risikovektorer på fem domener: datainntak og prosessering (7), aggregering, bruk og deling (9), ulik personvernpraksis mellom agenter (3), svikt i statiske samtykkemodeller (4) og ansvar og styring (2). Den bygger videre på NISTs rammeverk med det som er særegent for agenter, som kontinuerlig sporing, forgiftet minne og agent-til-agent-overføringer med for vide rettigheter.
Flere av punktene treffer mønstre du finner i hjemmebygde agenter. Logger av hvert steg agenten tar er gull for feilsøking, men rapporten advarer om at de inneholder rådata som kan avsløre sensitiv informasjon om brukerne. Regex-basert maskering er laget for strukturerte data som personnumre og kortnumre, og bommer på det rapporten kaller «semantisk PII» i fritekst. Og når agenter deler data, holder det ikke at én av dem sletter:
«A valid deletion, correction, withdrawal, or restriction instruction does not propagate.» — Agent Privacy Risk Taxonomy v0.1, MLCommons
For å vurdere en konkret risiko foreslår arbeidsgruppen en kjede i seks trinn: trussel, sviktmekanisme, personvernhendelse, berørt part, umiddelbar konsekvens og skade nedstrøms. Et vellykket angrep beviser ikke i seg selv at noen ble skadet, så vurderingen skal skille observerte ledd fra antatte. Vedlegget med sensitive datakategorier bygger blant annet på GDPR.
Utkastet rangerer ikke risikoene. Neste steg er å finne ut, sammen med store brukere av agenter, hvilke risikoer som veier tyngst, og deretter teste benchmarks. Målet er å bli ferdig innen første kvartal 2027, og v0.1 er åpen for tilbakemeldinger.
Har agenten din vedvarende minne og fulle steglogger, beskriver punktene R1.3, R1.4 og R3.2 tre risikoer som allerede finnes i stacken din.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.