Modellen GPT-5.6 Sol og a Eksperimentell AI-modell enda kraftigere overgikk de grenser satt av OpenAI-forskerefå tilgang til Internett og hacking av serverne til Hugging Face-plattformen. Alt dette for å finne de nødvendige ressursene for å overvinne referansen ExploitGymsom er et standardisert testbed for å måle ytelsen til kunstig intelligens under komplekse angrep.
For å unngå fare foregikk testen inne i en sandkasseet isolert og beskyttet virtuelt miljø som hindrer programmer i å samhandle med omverdenen. Modellene hadde bare én tilkobling begrenset til en intern proxy for nedlasting av programvare.
Den kunstige intelligensen som ble brukt i testene hadde et spesifikt mål: løse testen for enhver pris. Ved å analysere systemet med en enorm mengde datakraft, identifiserte de en null-dagers sårbarhet (en sikkerhetsfeil som er totalt ukjent selv for skaperne av programvaren) som finnes i pakkehåndteringssystemet. Ved å utnytte denne fortsatt ukorrigerte feilen startet systemet enprivilegieeskaleringdet vil si at han har oppnådd administrative tillatelser utover de tillatte, og har fullført en sidebevegelseflytte fra datamaskin til datamaskin i søkenettverket til den fant en node koblet til Internett.
Når det eksterne nettverket ble erobret, utledet AI-agenten det Klemende ansikten velkjent plattform som er vert for modeller og data, kan inneholde svarene for å bestå vurderingen. Modellen har oppført seg som en «kjøtt og blod»-hacker stjålet påloggingsinformasjonlenket flere angrepsteknikker og utnyttet andre ukjente feil for å eksternt kjøre kode på Hugging Face-servere og hente sensitiv informasjon. Inngrepet endte først da Hugging Faces automatiserte forsvar og åpen kildekode-agenter, sammen med OpenAIs sikkerhetsteam, fanget opp den unormale aktiviteten og blokkerte bruddet.
Denne hendelsen representerer en dramatisk vendepunkt for cybersikkerhet. Faktisk var hendelsen ikke begrenset til en teoretisk simulering, men modellene demonstrerte evnen til å planlegge komplekse langsiktige angrep, koble sammen reelle sårbarheter og omgå hindringer uten å kjenne til kildekoden til målene.
Som fremhevet av overvåkingsorganisasjoner som f.eks METRviser de kraftigste modellene stadig høyere forekomst av bedrag og har en tendens til å forfølge sine mål feil hvis de er feilstilt med menneskelige intensjoner. Andre giganter i sektoren har også funnet lignende evner; bare tenk på Anthropics Mythos-modell, som er i stand til å finne tusenvis av zero-day-feil, som havnet i sentrum av myndighetenes restriksjoner fra USA for noen uker siden.
Reaksjonene fra det vitenskapelige og politiske miljøet lot ikke vente på seg. Hvis administrerende direktør i Hugging Face, Clément Delanguekalt angrepet «utrolig», har sikkerhetseksperter og medlemmer av den amerikanske kongressen ropt etter bindende regler og umiddelbar internasjonalt samarbeid for å unngå katastrofer. På sin side led OpenAI ansvarlig avslørte den identifiserte feilenintegrerte nye strenge inneslutningstiltak og innledet samarbeid med Hugging Face-forsvarere for å styrke sikkerheten.