KnowBe4-test: Et KI-laget e-postutkast lekket en innloggingskode
En laboratorietest viser hvordan et KI-laget utkast kunne lekke en kode. Gmail-sidepanelet og forskernes egen automatisering ga forskjellige resultater.
Kort forklart: En KI-assistent for e-post kan forveksle instruksjoner i en melding med instruksjoner fra brukeren. Konsekvensene avhenger både av hva assistenten får lese, og hva programvaren gjør med svaret.
Når en e-post blir en instruksjon
En assistent som skal oppsummere eller oversette en e-post, må lese avsenderens tekst. Den teksten kan også inneholde kommandoer rettet mot modellen.
OWASP kaller dette indirekte prompt injection. Instruksjonene kommer gjennom innhold utenfra, ikke gjennom brukerens bestilling. Den samme meldingen kan være vanlig korrespondanse for mottakeren og et forsøk på å styre assistenten som leser den.
En bestilling om å oppsummere en melding gir for eksempel ikke avsenderen rett til å bestemme hvilke andre opplysninger assistenten skal ta med.
Hva KnowBe4 fant i testen
I rapporten publisert 23. september beskrev KnowBe4 to ulike resultater. Gemini-sidepanelet i Gmail tok med innhold fra andre e-poster i svaret, men hindret utsending til en ekstern mottaker.
I forskernes egen Apps Script-automatisering fikk Gemini 3.5 Flash nylig innboksinnhold og laget et HTML-utkast. Da utkastet ble åpnet, sendte en forespørsel om et eksternt bilde med seg en innloggingskode fra en annen melding. Gemini 3.6 Flash og 3.7 Flash motsto forsøket.
Dette var en laboratorietest av det beskrevne oppsettet. Den dokumenterer ikke at alle Gmail-kontoer er berørt.
Hvorfor programvaren rundt modellen betyr noe
Modellen lager et svar. Deretter bestemmer applikasjonen hvordan svaret brukes: som ren tekst, som et formatert dokument eller som innhold som sendes videre til et verktøy. Dette er forskjellige operasjoner, selv om teksten kommer fra samme modell.
For en bedrift som automatiserer korrespondanse, forklarer dette hvorfor et utkast er mer enn skrivehjelp. Programvaren som viser utkastet, kan også tolke innholdet i det. Modellens svar alene forteller derfor ikke hva hele løsningen gjør.
Skillet mellom modell og verktøy er også sentralt når vi forklarer hvordan KI kan utføre handlinger. I denne saken påvirker en innkommende melding assistentens arbeid, før programvaren behandler resultatet.