For the complete documentation index, see /llms.txt. Markdown version of this page: /insights/ai-security/tankevirus-ai-agenter-smitter-hverandre-gjennom-minnefiler.md.
AI-sikkerhet ↗

Agentminnet må beskyttes mot fremmede instruksjoner

En studie viser instruksjoner som sprer seg mellom AI-agenter. En advarsel i prompten hjalp i forsøkene, men erstatter ikke tilgangskontroll.

AI-generert illustrasjon: Utvikler vurderer upålitelige instrukser i en agents minnefil.

Forsidebildet er en AI-generert redaksjonell illustrasjon. Skjermer og dokumenter er illustrerte konsepter.

En forskningsartikkel publisert 10. august undersøker instruksjoner som sprer seg mellom AI-agenter ved å få hver mottaker til å sende dem videre. Forskerne demonstrerte dette i kontrollerte forsøk med flere agenter. En kort advarsel i systemprompten reduserte spredningen kraftig.

Artikkelen beskriver risikoen som reell, men foreløpig begrenset. Resultatet garanterer ikke at et advarselsavsnitt stanser alle angrep mot andre modeller eller oppsett.

Minnet påvirker neste oppgave

Varig kontekst er nyttig fordi assistenten slipper å lære prosjektet på nytt hver gang. Samtidig kan en uønsket instruksjon overleve samtalen der den først dukket opp.

Derfor er opphavet til en minneoppføring viktig. Har brukeren godkjent den? Skrev agenten den etter å ha lest en ekstern nettside? Kan en annen prosess endre den? Dette er ulike nivåer av tillit.

Vi anbefaler å skille gjennomgåtte arbeidsinstruksjoner fra materiale agenten samler inn underveis. Hvis et hentet dokument får endre reglene for senere arbeid uten videre, har dokumentet fått for stor myndighet.

Gjør endringene synlige

Legg filer som styrer agentens atferd, under versjonskontroll. Begrens hvem som får endre dem, og undersøk uventede endringer. Hvis agenten kan oppdatere sitt eget minne, avklar hva den får lagre og behold historikken.

I delte prosjekter bør dere undersøke om én assistent kan endre instruksjoner som en annen bruker. En rettighet i én arbeidsmappe kan påvirke flere agenter.

En advarsel i prompten kan være et tillegg. Prøv den i egen arbeidsflyt, og behold begrensningene på verktøy, filer og påloggingsdata. Ved opprydding bør dere også gjennomgå det varige minnet. En ny samtale kan ellers starte med den samme uønskede instruksjonen.

← Tilbake til all innsikt
Spørsmål eller forespørsel? [email protected] Kontakt oss →