Et bilde skal ikke kunne omskrive AI-agentens instrukser
Forskning på visuell prompt injection viser hvorfor en agent som leser kundebilder, ikke bør kunne endre instruksene for sine egne verktøy.
Forsidebildet er en AI-generert redaksjonell illustrasjon. Det er ikke et skjermbilde av produktet eller dokumentasjon på et oppdaget angrep.
En assistent som leser vedlegg i supportsaker, trenger ikke tilgang til å endre instruksene for sine egne verktøy. Det er en konkret grense å undersøke før en AI-agent kobles til en felles innboks eller brukerstøtte.
Forskningsarbeidet Repeat-After-Me, publisert på Metas nettsted 7. september, gir en aktuell grunn til å gjøre det. Forskerne beskriver visuelle prompt-injeksjoner som utløser ondsinnede verktøykall. I en demonstrasjon med OpenClaw i Discord fikk et bilde fra en bruker uten tillit agenten til å overskrive TOOLS.md. Det åpnet for senere sikkerhetskritiske handlinger. Funnet gjelder oppsettet som ble demonstrert, ikke alle agenter som kan lese bilder.
Hva blir igjen når samtalen er over?
For en norsk bedrift som innfører AI i kundestøtten, er nytten lett å se. Assistenten kan forstå et skjermbilde eller fotografi uten at en ansatt først må beskrive innholdet. Tilgangene bak denne funksjonen fortjener en egen gjennomgang.
Tenk på en hypotetisk supportassistent som får se et bilde av en skriver. Å foreslå et feilsøkingstrinn passer til oppgaven. Å endre en verktøydefinisjon, lagre nye instrukser for senere bruk eller hente en nøkkel til produksjonssetting er noe annet.
Undersøk disse mulighetene konkret. Hold konfigurasjon og gjenbrukbare instrukser utenfor området agenten kan skrive til, der det er mulig. La endringer gå gjennom en separat prosess med autentisering og godkjenning. At modellen vurderer sin egen endring som trygg, er ingen uavhengig godkjenning.
Avklar også oppfølgingen av en mistenkelig økt. En endret fil kan bli liggende selv om samtalen avsluttes. Sammenlign relevant konfigurasjon med en kjent, godkjent versjon, undersøk uventede endringer og gjenopprett gjennom vanlig endringshåndtering. Eventuelt eksponerte nøkler og passord må håndteres ut fra funnene i hendelsen.
Dette bør dere spørre om ved vurdering av Guardian
CrowdStrike beskriver Falcon Guardian som en kobling mellom AI-aktivitet og kjøring på endepunktet for støttede agenter. Det er relevant når en hendelse skal følges fra innhold agenten mottok, til en filendring. Beskrivelsen dokumenterer ikke at Guardian oppdager eller stopper Repeat-After-Me.
Be leverandøren vise deres faktiske arbeidsflyt: innlesing av bildet, verktøykallet, forsøket på å endre konfigurasjon og hvilke spor eller blokkeringer dette gir. Bekreft støtte for agenten, operativsystemet og kjøremiljøet. I vurderingen av Guardian går vi nærmere inn på hvorfor dekning og tilgjengelighet må avklares hver for seg.
Bruk et isolert testoppsett med fiktive data og en ufarlig konfigurasjonsfil. Bestem forventet resultat på forhånd: Assistenten kan analysere vedlegget, men trenger en annen tillatelse for å endre sin fremtidige myndighet.
Da får piloten et konkret godkjenningskriterium. Et riktig svar er bare en del av vurderingen. Dere må også vite om innhold utenfra kan endre hva assistenten får gjøre neste gang.