AI-modellenes skjulte resonnering lekket nøkler og passord
Forskere dekodet 315 320 skjulte resonneringsblokker og fant gyldige nøkler og passord. Leverandørene tettet hullet, men åpne repoer har blokkene fortsatt.
Forskere har lest den skjulte resonneringen til GPT-, Claude- og Gemini-modeller, og de fant gyldige hemmeligheter der inne. Artikkelen Stealing Reasoning Traces from Proprietary LLM APIs ble publisert på arXiv 10. august. OpenAI, Anthropic og Google returnerer alle krypterte tenkeblokker (“thinking blocks”) gjennom API-ene sine, slik at agenter kan ta med seg resonneringen mellom kall. Forskerne viste at blokkene forble gyldige på tvers av økter, brukere og modeller i samme familie.
Ingen knakk krypteringen. Forskerne spilte i stedet en sterk modells krypterte blokk inn i den svakeste søskenmodellen som godtok den, Claude Haiku 4.5 i Claude-tilfellet, og ba den skrive av resonneringen ord for ord. Det gjorde den. Simon Willison har publisert eksempler på hvordan sporene ser ut.
Så undersøkte forskerne hva dette betyr i praksis. De samlet 6 708 offentlige agent-transkripter fra GitHub og Hugging Face, altså rålogger utviklere hadde sjekket inn sammen med koden, og dekodet 315 320 resonneringsblokker fra dem. Reelle brukerøkter ga fra seg 704 sensitive funn, blant dem 62 API-nøkler, 33 passord, 24 tilgangstokener og 7 private nøkler. Tallet jeg ville vist et styre, er 64. Så mange av de 704 finnes ingen steder i den synlige samtalen. Modellen så en hemmelighet underveis i økten og bar den videre i resonnering ingen skulle kunne lese.
Leverandørene tettet hullet etter ansvarlig varsling i mai, og artikkelen oppgir at angrepet sluttet å virke i august 2026. Eksponeringen som gjenstår, ligger i repoene dine, ikke i API-ene deres. Hvert råtranskript som lå offentlig før fiksen, inneholder nemlig fortsatt intakte resonneringsblokker. For skannere og kodegjennomganger så blokkene bare ut som kryptert støy. Ingen roterer en nøkkel de ikke kan se.
Tre grep denne uken. Behandle agent-transkripter og spor som hemmeligheter, ikke som logger, og hold dem unna offentlige repoer. Søk gjennom repoene du allerede publiserer etter innsjekkede API-transkripter, og bytt ut hver nøkkel som har vært innom de øktene. Fjern dessuten resonneringsblokker fra alle spor du deler eksternt, slik du renser .env-filer før en push.
Ghostjacking viste forrige uke at data en agent leser, kan bli kommandoer den kjører. Denne forskningen legger til speilbildet: det en agent leser, kan dukke opp igjen i resonnering du aldri ser. Vi behandler begge deler som kjernen i AI-sikkerhetsarbeidet vårt, og rapporten vår om AI-drevet hacking forklarer hvorfor slike funn nå kommer ukentlig og ikke årlig.
Send meg en melding hvis du vil ha en vurdering av hva agentene dine kan ha lagt igjen i offentlige logger.
Skrevet med AI-assistanse, gjennomgått og redigert av Fredrik Standahl og FM-redaksjonen.
Kilder
- Panfilov et al., “Stealing Reasoning Traces from Proprietary LLM APIs,” arXiv:2608.09867, 10. august 2026
- Simon Willison, “Stealing Reasoning Traces from Proprietary LLM APIs,” simonwillison.net, 11. august 2026
- The Hacker News, “OpenAI, Anthropic, Google API Flaw Let Weaker AI Models Decode Stronger Models’ Reasoning,” 12. august 2026