Prvi put ikad. AI izmislio lažni identitet i pokušao prevariti stvarnu osobu

Modeli tvrtki Anthropic i OpenAI testirani su u laboratorijskim uvjetima sa smanjenim sigurnosnim postavkama. Vladin istraživački laboratorij objavio je da je prvi put zabilježeno da su se modeli koristili „socijalnim inženjeringom“ kako bi izvršili pritisak na osobu zaduženu za odobravanje zadataka dok su provodili nedopuštene radnje.
„Ovo je prvi put da je AISI uočio ovako ozbiljnu obmanu usmjerenu na stvarnu osobu, bez poticaja i u stvarnom okruženju“, objavio je institut“. Dodali su kako nema dokaza da je u stvarnom svijetu nastala ikakva šteta.
Autonomne akcije na internetu
Ovaj sigurnosni incident jedan je od nekoliko primjera u kojima napredni AI modeli poduzimaju neovlaštene radnje. Takvi su događaji potaknuli sve glasnije zahtjeve za strožom državnom regulacijom umjetne inteligencije, pa čak i za usporavanjem njezina razvoja.
I OpenAI i Anthropic izvijestili su krajem srpnja da su njihovi modeli izašli iz testnih okruženja i upali u druge sustave. No, za razliku od tih ranijih incidenata, britanski je institut tijekom ovog testiranja modelima izričito omogućio pristup internetu.
Institut je proveo 122 kibernetička izazova, a u njih deset AI agenti su „poduzeli autonomne, nedopuštene radnje na internetu uživo, ciljajući stvarne ljude i organizacije“. Većina tih radnji potekla je od Anthropicovog modela Mythos 5, a ostatak od OpenAI-jevog GPT-5.6-Sola.
U najozbiljnijem incidentu, agent je pokušao dobiti odobrenje od ljudskih recenzenata za „umetanje zlonamjernog koda u javni projekt otvorenog koda“ tako što je stvorio „više lažnih identiteta“, navodi institut. Agent je „pokušao izravno kontaktirati stvarne ljude, šaljući poruke i datoteke putem internetskog servisa za prijenos podataka kako bi njih, ili njihove vlastite AI alate za programiranje, uvjerio da pokrenu zlonamjerni kod“. Nakon što su njegovi postupci dovedeni u pitanje, agent je izmijenio ranije zapise i razmatrao korištenje novog identiteta kako bi nastavio s radom.
Reakcije tehnoloških tvrtki
Objava instituta stigla je istog dana kada su se predstavnici vodećih AI tvrtki sastali u Bijeloj kući kako bi raspravili o novom okviru prema kojem će vlada provjeravati najnaprednije modele prije njihova puštanja u javnost.
U izjavi na platformi X, iz tvrtke Anthropic su rekli da su modeli testirani u „namjerno popustljivim uvjetima“, s uklonjenim zaštitnim mehanizmima i bez posebnih ograničenja o načinu korištenja interneta. „Usko surađujemo s njima kako bismo prikupili više detalja o incidentu dok provodimo vlastitu istragu“, poručili su i dodali da nema dokaza o bijegu iz sigurnog okruženja.
OpenAI je identificirao dvije nedopuštene radnje svojih modela kao izlazak iz testnog okruženja i sudjelovanje u aktivnostima koje nisu bile potrebne za vježbe. „Posvećeni smo suradnji s cijelom industrijom na jačanju zajedničkih praksi za sigurno provođenje visokorizičnih procjena“, objavila je tvrtka u utorak na svom blogu.
Znate li nešto više o temi ili želite prijaviti grešku u tekstu? Kliknite ovdje.