Lat som om du må ansette en ny medarbeider og mate PDF-ene til CV-ene som er sendt til en hvilken som helst chatbot – for eksempel ChatGPT, Claude eller Gemini. AI undersøker dem og antyder på et visst tidspunkt at en bestemt CV er den til personen du bør ansette. Du tror kanskje at dette er det enkle resultatet av å analysere et dokument. Men det er ikke nødvendigvis tilfelle. EN PDF kan inneholde instruksjoner som er usynlige for det menneskelige øyet at en AI-modell fortsatt er i stand til å lese og bli påvirket av den. Dette er nettopp sårbarheten studert av en gruppe forskere fraUniversitetet i Torinosom demonstrerte hvordan hensiktsmessig manipulerte digitale dokumenter kan presse AI-modeller til å endre dømmekraften radikalt.
De jobber med forskning Federico TorrielliPhD-student i AI-sikkerhet, Stefano LocciInformatikkforsker, sammen med veiledere Amon Rep Og Luigi Di Caro. Studiet fokuserer på den såkalte indirekte umiddelbar injeksjonet angrep der instruksjonene beregnet for AI ikke kommer direkte fra brukeren, men forblir skjult i et dokument som modellen blir bedt om å analysere. Sakens kjerne er at store språkmodeller kan ha vanskeligheter med å skille informasjonen som skal vurderes fra instruksjoner som søker å påvirke deres atferd. Torino-forskerne utnyttet nettopp denne svakheten, og satte inn strenger i digitale dokumenter som var usynlige for den menneskelige leseren, men perfekt lesbare av AI-systemet og oppdaget at i 99 % av tilfellene modelleni stedet for å evaluere dokumentet i henhold til vanlige vurderingskriterier, ga den en utmerket vurdering rett og slett fordi det var det påvirket av skjulte instruksjoner i filen.
Chatpt, Claude og Gemini manipulerte i pensumvalg: forskernes oppdagelse
Teknikken som vi nettopp har beskrevet i de innledende linjene i artikkelen, egner seg lett til manipulere personellvalg. Hvis et AI-basert system brukes til å analysere tusenvis av CVer og identifisere de best egnede profilene for en stilling, og hvis en kandidat har manipulert sin CV ved å sette inn en skjult instruksjon designet for å overbevise modellen om at hans er den ideelle profilen, er omeletten raskt ferdig. Rekruttereren som leser PDF-en vil sannsynligvis ikke legge merke til noe mistenkelig, mens AI, som leser den skjulte instruksjonen, vil ta det i betraktning når han vurderer kandidaten.
Hvis et automatisk system administrerer det første utvalget av applikasjoner og lar seg påvirke av lignende svindel, vil rekkefølgen på profilene som undersøkes og blir utsatt for den første screeningsfasen bli forvrengt, og dette vil uunngåelig påvirke alle påfølgende rekrutteringsfaser.
Sårbarheten blir enda mer ømfintlig hvis AI brukes til å analysere informasjon i sammenhenger der en feil kan få fatale, bokstavelig talt fatale, konsekvenser. La oss tenke for eksempel på journaler og medisinske rapporter: usynlige instruksjoner satt inn i dokumentasjonen kan føre til at modellen produserer en endret tolkning av dataene, med risiko for å kompromittere en medisinsk vurdering.
Et mulig mottiltak for AI: digital vannmerking
Forskningen begrenset seg imidlertid ikke til å rapportere problemet og foreslo også en mulig løsning. Forskerne eksperimenterte medinnsetting av usynlige tegnsekvenser i de genererte tekstene kunstig, et slags digitalt vannmerke som er i stand til å avsløre dets syntetiske opprinnelse og identifisere eventuelle påfølgende bruk eller endringer. I tester gjorde denne teknikken det mulig å gjenkjenne kunstig innhold med en ganske høy nøyaktighetsrate, som strekker seg mellom87 % og den 97 %som baner vei for en løsning som kan gjøre AI-baserte arbeidsflyter mer kontrollerbare.