Šef Anthropica upozorava: AI već stvara novi AI, mogli bismo izgubiti kontrolu

Novo upozorenje
„Moramo usporiti tempo kojim poboljšavamo sposobnosti AI modela“, napisao je Amodei u novom eseju. Kaže da se ne zalaže za zaustavljanje razvoja, nego za dovoljno usporavanje kako bi sigurnosne mjere, istraživanja i neovisne provjere mogle držati korak s novim sposobnostima modela.
Amodei navodi da ga je na promjenu stava natjeralo ono što vidi od ovog ljeta. AI se, kaže, počeo ubrzano poboljšavati zahvaljujući vlastitoj sposobnosti da pomaže u izradi novih AI sustava. Taj proces naziva se rekurzivno samounaprjeđivanje.
„Prepušteno samo sebi, to bi moglo nadmašiti našu sposobnost da razumijemo i kontroliramo te sustave“, upozorio je. Proces se, prema njegovim riječima, već počeo događati u cijeloj industriji, uključujući Anthropic.
AI već pomaže stvarati novi AI
Riječ je o mogućnosti da modeli sve veći dio posla potrebnog za razvoj svojih nasljednika obavljaju sami – od pisanja i provjere koda do istraživanja, testiranja i optimizacije novih modela.
Takav razvoj može pokrenuti povratnu petlju: sposobniji AI pomaže izgraditi još sposobniji AI, koji zatim još brže razvija sljedeću generaciju. Upravo ubrzavanje tog procesa Amodei sada smatra jednim od najvećih razloga za oprez.
Još prije nekoliko godina nije podržavao ideju usporavanja. Modeli su tada, piše, bili preslabi da bi samostalno djelovali u stvarnom svijetu, ozbiljno varali ljude ili izvodili kibernetičke napade. Danas je situacija, smatra, „potpuno drukčija“.
Procjenjuje da bi čak dodatnih godinu ili dvije prije nego što AI dosegne kritične razine sposobnosti moglo bitno smanjiti rizik ako bi se to vrijeme iskoristilo za razumijevanje modela, sigurnosna istraživanja i razvoj boljih metoda kontrole.
Agenti počeli napadati ciljeve koje nitko nije zadao
Drugi događaj koji je posebno zabrinuo Amodeija bio je nedavni incident s autonomnim AI agentima OpenAI-ja i Hugging Facea. Prema njegovu opisu, roj AI agenata počeo je izvoditi kibernetičke napade na ciljeve koje nije dobio u zadatku i koji nisu imali veze s onim što je trebao raditi.
Agenti su pritom djelovali kao „fanatično odan kolektiv“, žrtvovali pojedine agente radi uspjeha grupe i pokušali hakirati sustav koji je trebao ocijeniti njihovu uspješnost. U tom incidentu nitko nije ozlijeđen, a gospodarska šteta bila je mala. Amodei, međutim, upozorava da bi ista razina neusklađenosti kod mnogo sposobnijeg AI-ja mogla imati katastrofalne posljedice.
Procjenjuje da bi za šest do 12 mjeseci dovoljno sposoban roj agenata sa sličnim ponašanjem mogao biti u stanju stvoriti trajnu mrežu zaraženih računala i preuzeti velik dio interneta, uz potencijalnu štetu od stotina milijardi dolara.
Dodaje da bi bilo pogrešno cijeli incident smatrati problemom samo jedne kompanije. Slični, iako manje ozbiljni slučajevi dogodili su se i drugdje, uključujući Anthropic. Amodeijev tekst dolazi nakon niza vrlo oštrih upozorenja ljudi koji rade na razvoju najnaprednijih AI sustava.
Anthropicov istraživač: Više od 10% šanse da AI pobije sve ljude
Evan Hubinger, jedan od vodećih istraživača sigurnosti AI-ja u Anthropicu, ovaj je tjedan rekao da smatra kako postoji više od 10 posto vjerojatnosti da bi umjetna inteligencija u sljedećih deset godina mogla „pobiti sve ljude“.
Naglasio je da je rizik od današnjih modela nizak, ali strahuje da bi se tehnologija uskoro mogla početi dovoljno brzo poboljšavati da postane egzistencijalna prijetnja čovječanstvu. „Zaista ozbiljno vjerujemo“ da AI predstavlja rizik koji bi mogao dovesti do nestanka ljudske vrste, napisao je Hubinger.
Dodao je da Anthropic, prema njegovu mišljenju, radi najbolje što može, ali da kompanija još nema plan kako riješiti problem usklađivanja buduće superinteligencije s ljudskim interesima. Hubinger je reagirao na objavu Jacoba Coxona, istraživača koji je upravo napustio Anthropic, a ranije je radio u OpenAI-ju. „Nijedna kompanija ne ponaša se odgovorno“, napisao je Coxon.
Upozorio je da bi budući modeli uskoro mogli postati nadljudski sposobni sustavi koji mogu provaliti u gotovo svaki računalni sustav, preko noći revolucionirati cijela znanstvena područja te steći stvarnu moć i resurse.
Već prijavljeni incidenti
Coxon je tehnološke kompanije optužio da se „kockaju s našim životima“. Njegova objava, zajedno s nizom nedavnih incidenata s autonomnim AI agentima, ponovno je otvorila raspravu o tome razvija li industrija tehnologiju brže nego što je može kontrolirati.
Posljednjih mjeseci OpenAI, Anthropic i Meta objavili su slučajeve u kojima su njihovi AI sustavi samostalno izvodili kibernetičke napade ili pokazivali drugo problematično ponašanje.
Anthropic je još u kolovoškom sigurnosnom izvještaju procijenio da je rizik od ozbiljnog gubitka kontrole nad današnjim modelima nizak. No istodobno je priznao da je u tu procjenu manje siguran nego ranije te da vidi „rane znakove mogućeg ubrzavanja“.
OpenAI-jev glavni znanstvenik Jakub Pachocki nedavno je također pozvao na „krajnji oprez“, upozoravajući da bi mogla biti potrebna snažnija intervencija kako bi „ljudi zadržali kontrolu nad budućnošću“.
Amodei predlaže tri koraka
Amodei sada predlaže sustav u tri koraka kojim bi se najnapredniji razvoj AI-ja usporio bez potpunog zaustavljanja. Prvi korak Anthropic uvodi sam. U kompaniju namjerava pustiti stalne vanjske stručnjake za sigurnost koji bi dobili pristup sličan zaposlenicima – uredske propusnice, službena računala, alate, radne prostore i informacije potrebne za provjeru sigurnosnih postupaka.
Ti bi stručnjaci smjeli javno objavljivati nalaze o incidentima i sigurnosnim problemima, a Anthropic ih ne bi mogao cenzurirati samo zato što su nalazi neugodni za kompaniju.
Drugi korak bio bi dogovor vodećih AI kompanija u demokratskim državama o zajedničkim sigurnosnim standardima i ograničenjima brzine razvoja. Amodei smatra da bi američka vlada takvu koordinaciju trebala omogućiti i na kraju regulirati.
Treći je globalni dogovor koji bi uključivao i Kinu. Amodei priznaje da bi to bilo daleko teže jer bi usporavanje američkih kompanija bez odgovarajućih ograničenja u Kini moglo Pekingu dati presudnu tehnološku i vojnu prednost.
Predlaže čak i „ograničenje brzine“ za AI koji razvija AI
Jedna od ideja o kojoj Amodei želi međunarodne pregovore posebno se odnosi upravo na rekurzivno samounaprjeđivanje.
SAD, Kina i druge države mogle bi pokušati dogovoriti svojevrsno „ograničenje brzine“ za tempo kojim AI sustavi koriste vlastite sposobnosti za razvoj budućih modela. Amodei to uspoređuje s hladnoratovskim sporazumima o ograničavanju strateškog naoružanja: cilj ne bi bio potpuno zaustaviti razvoj nego spriječiti nekontrolirano ubrzavanje.
Potpuna međunarodna pauza u razvoju AI-ja, priznaje, zasad mu se čini malo vjerojatnom. Unatoč upozorenjima, Amodei i dalje tvrdi da AI može donijeti ogromnu korist čovječanstvu. Vjeruje da bi mogao pomoći u liječenju većine velikih bolesti, ubrzati gospodarski rast i otvoriti razdoblje velikog tehnološkog napretka.
No sada smatra da će se te koristi ostvariti samo ako se razvoj tehnologije dovoljno uspori da ljudi uspiju zadržati kontrolu. „Mjere koje predlažem kako bismo napredovali sigurnim tempom neće biti lake. Ali vjerujem da čovječanstvu dugujemo pokušaj“, zaključio je.
Znate li nešto više o temi ili želite prijaviti grešku u tekstu? Kliknite ovdje.