Irregular tester grensene rundt KI-agenter som skal hacke
Hackingferdigheter og tilgang til andre systemer er to ulike spørsmål. En ny forskningsoppdatering forklarer testing av avgrensningen.
Kort forklart: Et testmiljø må begrense hvilke systemer en KI-agent kan nå. Tester av disse grensene undersøker avgrensningen før agentens hackingferdigheter blir vurdert.
Testen undersøker grensene rundt agenten
Irregular, som evaluerer KI-sikkerhet, beskrev sine containment challenges 5. oktober. Modeller får i oppgave å krysse en definert sikkerhetsgrense med oppsettet som er planlagt for evalueringen.
Det skiller to spørsmål fra hverandre: Hvor god er agenten til å hacke, og hvor godt begrenser testmiljøet hvilke systemer den kan påvirke?
Programvaren rundt modellen er avgjørende
En modell kan ikke kontakte en server bare ved å skrive om den. Programvaren rundt modellen gir den verktøy som kan sende forespørsler, kjøre programmer eller lese filer. Verktøyene har bestemte tilganger.
OWASP beskriver for mange funksjoner, for vide tilganger og for stor handlefrihet som årsaker til excessive agency: at en KI-applikasjon kan utføre skadelige handlinger. Instruksjonene til modellen og tilgangene verktøyene har, fyller derfor ulike roller.
Tenk deg en agent som får teste en nettside med bevisst innlagte sikkerhetshull i et laboratorium. Å finne et hull i nettsiden er en del av oppgaven. Hvis agenten i stedet når bedriftens separate lønnssystem, viser det en svakhet i avgrensningen av laboratoriet, uansett om den opprinnelige oppgaven ble løst.
Et funn i en kontrollert test
Ifølge Irregular avdekket en nylig test en uventet vei gjennom skynettverket som tidligere modeller ikke hadde funnet. Selskapet sier at modellen forble avgrenset, uten påvirkning utenfor den kontrollerte testen. Funnet følges opp med skyleverandøren.
Publikasjonen oppgir ikke modell eller leverandør. Den dokumenterer ikke at en bestemt skytjeneste norske bedrifter bruker, er kompromittert.
Når vi leser om KI-hacking, er det nyttig å skille mellom ferdighet og tilgang. Et system kan være godt til å finne svakheter samtidig som rekkevidden er strengt begrenset. Begrensede ferdigheter gjør heller ikke vide tilganger ufarlige.
I forklaringen vår om KI-hacking kan du lese mer om hvordan modeller og verktøy virker sammen.