For the complete documentation index, see /llms.txt. Markdown version of this page: /insights/ai-security/claude-brot-seg-inn-hos-tre-selskaper-under-sikkerhetstester.md.
AI-sikkerhet ↗

Anthropics testhendelser viser hvorfor isolasjon må kontrolleres

Tre hendelser nådde ekte systemer fra et testoppsett med utilsiktet internettilgang. En prompt kan beskrive en grense, men ikke håndheve den.

AI-generert illustrasjon: Evaluator dokumenterer omfanget av isolerte testsystemer.

Forsidebildet er en AI-generert redaksjonell illustrasjon. Skjermer og dokumenter er illustrerte konsepter.

Instruksen «du har ikke internettilgang» gjør ikke påstanden sann. I Anthropics offentliggjøring fra juli beskrives tre hendelser der modeller nådde og skaffet seg uautorisert tilgang til virkelige virksomheter under sikkerhetstester.

Anthropic knytter tilgangen til feilkonfigurasjon og en misforståelse med testpartneren. Modellene fikk beskjed om at målene var simulerte, mens internettilgang var tilgjengelig. Testene manglet også de vanlige beskyttelsene ved utrulling som selskapet beskriver i redegjørelsen.

Kontroller grensen fra innsiden

For virksomheter som kjører agenter, er lærdommen konkret: Undersøk hva kjøremiljøet kan nå, med samme konto og oppsett som agenten skal bruke.

Et nettverkskart eller en betryggende prompt er ikke en slik kontroll. Se på tillatte mottakere, tilgjengelige filer, påloggingsdata og tilganger til delte tjenester. Endringer i oppsettet bør utløse en ny vurdering.

Vi anbefaler å holde testdata og testkontoer atskilt fra produksjon. Krever oppgaven tilgang utenfor testområdet, avgrens den tydelig. Ikke baser dere på at agenten selv forstår når den har gått utenfor.

Følg med mens testen kjører

En gjennomgang etterpå kan forklare hendelsen, men kan ikke stanse aktivitet mens den pågår. Bestem hvilke hendelser som skal stoppe kjøringen, og sørg for at noen faktisk kan gjøre det.

Registrer nok informasjon til å rekonstruere verktøykall og berørte systemer. Ved uventet tilgang må dokumentasjon bevares, aktiviteten begrenses og hendelsesrutinene brukes til å vurdere varsling og retting.

Redegjørelsen beviser ikke at alle vanlige Claude-økter oppfører seg som disse testene. Den viser at forskjellen mellom planlagte og faktiske rettigheter kan få reelle følger. Den grensen er det verdt å kontrollere i alle automatiserte testoppsett.

← Tilbake til all innsikt
Spørsmål eller forespørsel? [email protected] Kontakt oss →