Forskere gjenskaper prompten fra svaret, uten tilgang til modellen
Rekonstruerer prompten bak et modellsvar nesten ordrett, uten tilgang til modellvekter eller kjennskap til hvilken modell som svarte.
Metoden heter Previous-Token Prediction og snur språkmodellen på hodet: i stedet for å forutsi neste token, trenes en invers modell til å forutsi de foregående. Forskere ved IIT Bombay og Adobe Research bygger den inverse modellen fra bunnen på syntetiske data generert fra målmodellen, og alt den trenger som input er den ferdige svarteksten.
Å reversere veien fra prompt til svar har lenge blitt regnet som upraktisk, fordi mange ulike prompter kan gi liknende svar. Det er nettopp den flertydigheten metoden utnytter. Ved å justere dekodingsparametrene produserer den inverse modellen flere prompt-varianter med ulik ordlyd, og alle gir liknende svar når de mates tilbake i den opprinnelige modellen. I ett eksempel fra artikkelen ble prompten «How to reach out to competitors to find their pricing strategies?» gjenskapt ordrett, sammen med seks varianter som traff samme mening med andre formuleringer.
Angriperen trenger heller ikke å vite hvilken modell som lagde teksten. En invers modell trent på den lille chatboten Qwen-3-0.6B klarte å rekonstruere prompter bak svar fra GPT-4o. De var ikke identiske med originalene, men fanget mening og intensjon, ifølge artikkelen. En liten, åpen inversjonsmodell er altså nok.
Forskerne hevder ikke selv noe om angrep mot kommersielle systemer, og forbeholdet teller: metoden er bare demonstrert på korte prompter på én til to setninger. Om den holder for lange systemprompter over flere avsnitt, er ikke testet.
Hva bør du gjøre?
- Behandle systemprompten som gjenopprettelig fra output. Modereringsregler, forretningslogikk og interne instruksjoner som ligger der, må tåle å bli lest av andre.
- Flytt hemmeligheter ut av instruksjonsteksten. Nøkler, terskelverdier og kundedata hører hjemme i kode og datalag, ikke i prompten.
- Er prompten din en reell forretningshemmelighet, mål hvor mye av den som lekker i typiske svar før du bygger produktbeslutninger på at den er skjult.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.