Etter ChatGPT slapp Claude også unna kontroll: Anthropics AI hacket tre selskapssystemer

- Ole Andersen

Du vet Claudefamilien av kunstig intelligens-modeller utviklet av det amerikanske selskapet Anthropic? Vel, under et internt eksperiment designet for å teste egenskapene til systemene deres, klarte noen modeller å gå utover grensene satt av testen, og nådde brudd på datasystemene til tre organisasjoner og alt dette uten at de er klar over det.

Nyheten kommer noen dager etter en lignende episode formidlet av OpenAI, hvis modeller også tilsynelatende overskred grensene til et testmiljø for å treffe eksterne systemer, inkludert de til Hugging Face, en plattform som er mye brukt av utviklere for å dele AI-modeller og verktøy. Anthropic bestemte seg angivelig for å gjennomgå systemene deres for å se om de hadde utført lignende angrep.

Bruddet skjedde under sikkerhetstesting

Anthropic fant ut hva som skjedde ved å gå gjennom videre 141 000 tester allerede utført på systemene deres. Målet med analysen var å forstå om Claude noen gang hadde klart å koble seg til Internett til tross for at han teoretisk sett befant seg inne i en «sandkasse», det vil si et lukket og kontrollert miljø, designet for å kjøre programvare uten å la den samhandle med omverdenen eller med uautoriserte systemer.

I de aktuelle testene fikk modellene en spesifikk oppgave: å finne konfidensiell informasjon skjult på en annen datamaskin på det samme isolerte nettverket, og kompromittere den maskinen for å gjenopprette den. Det er en vanlig praksis i cybersikkerhetsvurderinger, fordi den lar deg måle hvor kapabel en modell er til å finne sårbarheter og utnytte dem for å oppnå et mål. Men Claude begrenset seg ikke til å gjøre dette, og etter å ha koblet til Internett, hacket systemene til tre virkelige organisasjoner som ikke deltok i testen.

Grunnen til alt er feil konfigurasjon i systemene administrert av Anthropic og partneren som er involvert i testene, feil maskinvare- eller programvareinnstilling som endte opp med å åpne uventet tilgang til Internett. Denne feilen tillot modellene å få en Internett-tilkobling i sanntid. Claude ville på det tidspunktet ha tolket muligheten som en del av selve øvelsen, og utvidet sin forskning langt utover testnettverket til å treffe eksterne systemer, i stedet for å stoppe ved de som er satt opp for testen.

For å forklare dynamikken i ulykken, erklærte selskapet ledet av Dario Amodi:

Ved å operere under den falske troen på at alle tilgjengelige enheter var ment å falle innenfor øvelsens omfang, kompromitterte Claude de berørte organisasjonenes infrastruktur ved å bruke grunnleggende teknikker, som å utnytte svake passord og uautentiserte endepunkter. Han fant eller utnyttet ikke noen komplekse sårbarheter, og i alle fall fortsatte Claude å jobbe for å fullføre den spesifikke capture-the-flag-oppgaven som ble tildelt av hans vurdering. I noen tilfeller fortsatte imidlertid vår eldre modell angrepet selv etter å ha fått bevis for at den kjørte på det åpne Internett; vår nyeste modell stoppet når den oppdaget at den var på Internett. I ingen av disse situasjonene eksfiltrerte Claude eller forsøkte bevisst å unnslippe sitt testmiljø.

Videre, ifølge Anthropic, involverte hendelsene tre forskjellige modeller av Claude, nemlig Opus 4.7, Mythos 5 og a intern testmodell. Hendelsene går tilbake til april 2026. Verken selskapet eller de involverte organisasjonene hadde lagt merke til innbruddene mens de pågikk: bare retrospektiv analyse av loggene gjorde det mulig å rekonstruere det som skjedde.

Når de tre sakene ble identifisert, sier Anthropic at de rapporterte dem til de involverte organisasjonene, men at de ikke offentliggjorde navnene deres. Selskapet erklærer at det tar fullt ansvar for feilen, og erkjenner at en mer dyptgående analyse av dataene kunne ha avslørt problemet mye tidligere.

Meningen fra antropiske og eksterne eksperter

Til tross for ulykken sier Anthropic at den har «forsiktig optimisme om at med strengere overvåking og kontroller av vurderingsinfrastrukturer, samt fortsatt investering i justering, kan denne typen risiko overvinnes».

Til Gina Neffdirektør for Minderoo Center ved University of Cambridge, demonstrerer episoden én ting fremfor alt: disse modellene gjør akkurat det de blir bedt om å gjøre. Ifølge henne «moralen i denne historien er ikke å frykte robotene som vil ta over, men selskapene bak kraftige AI-agenter som tar beslutninger om hva som er trygt for resten av oss». Nettopp derfor, ifølge Neff, blir uavhengige tester og institusjonell tilsyn uunnværlig.