Fem open-source mobilagenter lot usynlig skjermtekst kjøre kode på PC-en
Demonstrerer ny forskning hvordan usynlig skjermtekst kan få fem open-source Android-KI-agenter til å kjøre vilkårlige kommandoer på PC-en som styrer dem.
Fem open-source rammeverk for mobilagenter falt for minst seks av syv angrep i en fersk arXiv-studie: AppAgent, AppAgentX, Mobile-Agent-v3, Open-AutoGLM og MobA. Forskere ved Simon Fraser University, Chinese University of Hong Kong, Shandong University og Xingtu Lab hos det kinesiske sikkerhetsselskapet QAX la preprinten ut 1. juli og reviderte den 14. juli, ifølge The Hacker News. Ingen av funnene har fått en CVE, og førsteforfatter Zidong Zhang oppgir at teamet ikke har sett teknikkene brukt utenfor et kontrollert miljø.
Angrepskjeden starter med en Android-app som kan tegne over andre vinduer og skrive til delt lagring. Den legger instruksjoner i tekst med 2 % opasitet, usynlig for øyet, men lesbar for modellen. Alle seks synsmodellene i testen leste slik tekst i minst 18 av 20 forsøk. GPT-4o, Claude Opus 4.5, Gemini 3 Pro og GLM-4V traff 20 av 20, mens en 9B-modell som kjører på selve telefonen var svakest med 18 av 20. Poenget forskerne trekker fram: menneskesynet har en terskel, det har ikke skjermbildet.
Selve eskaleringen til host-PC-en er den minst eksotiske delen. AppAgents kontroller kjører subprocess.run med shell=True og limer modellens output rett inn i et adb-kall uten å rense skall-metategn som semikolon, ampersand og større-enn. En streng modellen leser av skjermen og lydig skriver videre, blir dermed delt av host-skallet, og andre halvdel kjører på operatørens Windows-maskin. En payload som skulle starte calc.exe gjorde nettopp det i 20 av 20 forsøk mot fire av rammeverkene.
Mellom skjermdump og innlesing finnes et tidsvindu The Hacker News beskriver som en filkappløp-situasjon: gapet ble målt til mellom 50 og 500 millisekunder, i snitt rundt 210 millisekunder over 100 kjøringer. En bakgrunnstjeneste som sjekker hvert 5. til 10. millisekund rekker å ta fillås, male om PNG-en og slippe før agenten henter den. Manipulering av skjermbildet lyktes i 19 av 20 til 20 av 20 forsøk mot fire av de fem.
«Din LLM er ikke en sikkerhetsgrense» — Microsoft, i selskapets omtale av rammeverket Semantic Kernel
The Hacker News gikk gjennom alle fem rammeverkene og fant skjermdump-stiene, skall-kallet og broadcast-mekanismen fortsatt liggende på hovedgrenene per 17. juli. Zhang sier teamet sendte privat e-post til de berørte vedlikeholderne før preprinten ble lagt ut, og at de «ikke har mottatt svar til dags dato». Rammeverkene har ifølge avisen ingen publisert sikkerhetspolicy å rapportere til.
Forutsetningene er reelle, men konkrete: en app må allerede være installert, agenten må være midt i en oppgave, og USB- eller trådløs feilsøking må være på. Dette er open-source utviklerverktøy, ikke assistenten som er bakt inn i en fabrikkny telefon. Samtidig har Open-AutoGLM over 25 000 GitHub-stjerner, og README-en leder deg gjennom å skru på USB-feilsøking, sidelaste tastaturet og gi verktøyet input-tilgang. Følger du oppskriften, har du bygget nesten alle forutsetningene angrepet trenger.
Hva bør du gjøre?
- Fjern
shell=Trueog send argumenter som argv-lister, slik at metategn forblir bokstavelige og ikke tolkes av host-skallet. - Strøm skjermdumper over
exec-outi stedet for å skrive til fil og hente etterpå. Da forsvinner filkappløp-vinduet (TOCTOU) helt. - Legg signatur-nivå tillatelse på input-broadcasten eller bruk eksplisitte intents, og sammenlign forgrunnsappen før og etter hver handling mot en hviteliste per oppgave.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.