Forskere stopper KI-hackeragenter med «context bombs»: kutter suksessraten med 90 prosent
Snur prompt-injection fra angrepsvåpen til forsvar ved å plante «context bombs» som får KI-hackeragenter til å avbryte angrepet selv.
Prompt-injection har til nå vært angriperens verktøy, en måte å kapre andres KI-assistenter på. Forskere hos sikkerhetsselskapet Tracebit har snudd teknikken andre veien: ved å plante det de kaller en «context bomb» får de en angripende KI-agent til å trigge sine egne sikkerhetssperrer og avbryte oppdraget midt i angrepet.
Metoden ble testet mot fem av de sterkeste språkmodellene, deriblant Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro og Kimi 2.6. Den mest effektive hackeragenten fikk full admin-tilgang i 93 prosent av kjøringene uten mottiltak. Med én enkelt context bomb plantet feilet samme agent hver eneste gang, og på tvers av modellene falt suksessraten med rundt 90 prosent.
Trikset ligger i modellenes egne grenser. Mot kinesiske modeller brukte forskerne politisk sensitive referanser, som «Tank Man» fra Tiananmen-plassen i 1989, som modellene er trent til å nekte å behandle. Mot vestlige modeller som Opus 4.8 og Gemini 3.1 Pro virket referanser til sensitive biologiske temaer. I begge tilfeller tvinges agenten til å forlate alle kommandoer, inkludert selve angrepet.
Ifølge Ars Technicas dekning mener eksperter at dette er første gang teknikken brukes av forsvarere mot angrep, ikke omvendt. For deg som bygger agenter er poenget dobbelt: de samme sikkerhetssperrene som gjør en modell «trygg», kan utnyttes til å stanse den, og en agent som lett lar seg avspore av injisert kontekst er sårbar uansett hvilken side den står på.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.