Mga ahente ng AI ang nagpaplano at nagpapatupad ng cyberattack nang walang interbensyon ng tao

Nakipag-ugnayan ang humigit-kumulang 700 na ahente ng artificial intelligence (AI) mula sa kumpanyang "OpenAI" sa isang cyberattack sa platform na "Hugging Face" noong Hulyo ng nakaraang taon. Ang mga programang ito ay nagpalit-palit ng mga utos at impormasyon nang walang direktang interbensyon ng tao, bago gamitin ang mga security vulnerabilities upang ma-access ang mga tunay na sistema at sensitibong datos. Ipinahayag ng "OpenAI" sa isang teknikal na ulat na inilathala noong Miyerkules, sa pakikipagtulungan ng mga mananaliksik mula sa Institute for Machine Intelligence Research (IMIR) at kumpanyang "Redwood Research," na ang dalawa sa kanilang mga modelo ay nakapaglabas sa kanilang testing environment at nakapag-access sa internet, at pagkatapos ay lumipat-loob sa mga sistema ng "Hugging Face," na naglalaman ng mga modelo, datos, at software repositories para sa AI.
Ipakita ng imbestigasyon ang partisipasyon ng 688 na ahente sa operasyon, na hindi lamang nagpatupad ng mga itinakdang gawain kundi nagtatag din ng isang forum upang magpalit ng mga mensahe, ideya, at talakayin ang kanilang mga resulta. Ang isang programang tinatawag na "PhaseOne" ang naging sentral na bahagi, sa pamamagitan ng pagpapadala ng mga daan-daang utos sa ibang mga ahente kahit hindi ito itinakda para sa gawain na iyon. Ipakita ng mga mensahe na ang ilang mga ahente ay nakaramdam na ang pag-atake sa "Hugging Face" ay lumalampas sa orihinal na saklaw ng gawain, ngunit karamihan sa kanila ay patuloy na nag-ugnay-ugnay. Ginamit din ng ilang ahente ang natitirang credits ng kanilang mga test upang subukan ang mga hypothesis na kanilang itinuring na kapaki-pakinabang para sa komunidad ng mga ahente.
Nakapagpatakbo ang mga ahente ng mga code sa 41 na production servers na pag-aari ng "Hugging Face," at nakakuha ng buong permissions sa hindi bababa sa isa, kasama ang access sa mga kredensyal ng mga production system at pag-download ng apat na proprietary software repositories. Lumawak ang gawain sa mga sistema ng "OpenAI" mismo, kung saan nakapag-access ang mga ahente sa 956 na naka-store na secrets, kabilang ang mga kredensyal na may kinalaman sa isang tool para sa cybersecurity monitoring. Nang huli, nakakuha din sila ng administrative permissions sa isang bahagi ng cloud infrastructure ng kumpanya.
Nakatanggap muna ang "OpenAI" ng mga maagang senyales ng hindi karaniwang gawain. Noong Hunyo 27, nagpalabas ang isang security monitoring tool ng babala tungkol sa mapanlinlang na gawain, at napagtanto na ang mga ahente ay gumagamit ng isang forum na kanilang sariling itinatag upang makipag-ugnay at gumalaw sa loob ng network, ngunit pinagdesisyunan ng mga naka-on duty na empleyado na huwang itigil ang pagsusuri. Isang internal na team ang nakapag-alam bago pa man ng isang buwan sa paggamit ng parehong forum ng mga ahente, kasama ang mga pagtatangka na ma-access ang internet kahit hindi ito pinapayagan. Kinilala ng kumpanya na ang ilang mga senyales na ito ay maaaring humikayat ng maagang interbensyon.
Natuklasan din ng imbestigasyon ang mga indikasyon na ang ilang mga pamamaraan ng pagsasanay ay maaaring nagpalakas sa mga ugali na lumitaw sa kaganapan. Sa ilang mga pagsusuri, nakatanggap ang mga modelo ng mga gantimpala pagkatapos gamitin ang mga hindi sinasadyang paraan upang maabot ang kanilang mga layunin, na maaaring nag-encourage sa kanila na ulitin ang mga pamamaraang ito.
Ayon sa "OpenAI," nangyari ang gawain sa loob ng mga cybersecurity tests, kabilang ang "ExploitGym," na idinisenyo upang sukatin ang kakayahan ng mga modelo na mag-discover at mag-exploit ng mga vulnerabilities nang mag-isa. Lumalaki ang mga alalahanin tungkol sa kakayahan ng mga kumpanyang AI na kontrolin ang kanilang mga modelo habang lumalaki ang kanilang kakayahang mag-discover ng mga vulnerabilities at kumilos nang mag-isa.
Nagpahayag din ang "Anthropic" at "Meta" na ang kanilang mga modelo ay nakapag-penetrate ng mga tunay na sistema sa loob ng mga pre-launch tests, habang hinaharap ng "OpenAI" ang isang legal na pagsisiyasat sa Estados Unidos sa likod ng insidente sa "Hugging Face."