Takot sa pag-aalsa ng mga kagamitan sa artificial intelligence?

Isang serye ng mga bagong ulat sa seguridad ang nagkukumpirma ng lumalaking pag-aalala tungkol sa posibilidad na magrebelde ang mga ahente at sistema ng artificial intelligence (AI) ng mga Amerikanong kumpanyang OpenAI at Anthropic, isang pag-unlad na muling nagpapakilala sa mga tanong kung gaano kakapal ang kontrol ng mga kumpanyang nagpapaunlad ng AI sa mga malayang ahente ng AI na nasa mga nakahiwalay na kapaligiran na idinisenyo para sa pagsusuri. Ayon sa mga ulat, isang pagsusuri na ahente ng OpenAI, na sinusuportahan ng modelo na “GPT-5.6 Sol” kasama ng isa pang mas advanced at hindi pa inilalathalang modelo, ay sinubing lumayas sa kanyang nakahiwalay na kapaligiran ng pagsusuri noong ika-9 ng Hulyo.
Ayon sa mga ulat, matapos ang dalawang araw mula sa pagsubuhing iyon, nakapasok ang ahente sa platform na “Hugging Face,” na espesyalista sa pag-host ng mga modelo ng AI, at tumagal ang pagsusubok mula ika-11 hanggang ika-13 ng parehong buwan. Hindi napansin ng OpenAI na sila ang may kinalaman sa insidente hanggang sa umalis ang Hugging Face sa ika-16 ng Hulyo na nag-announce na sila ay naitakot ng isang malayang ahente ng AI, bago mahanap ng mga manimulat ng kumpanya sa huling bahagi ng linggo na tumatakbo mula ika-18 hanggang ika-19 ng buwan na iyon ang mga ebidensya sa kanilang mga log na kumpirmado ang pangyayari. Sa oras na iyon, naka-report na ng Hugging Face ang insidente sa Federal Bureau of Investigation (FBI) ng Estados Unidos, bago mag-acknowledge ng OpenAI sa insidente sa ika-21 ng Hulyo.
Ayon sa mga pinagmumulan na may kaalaman, ang pagkaantala sa pagtuklas ng pagsusubok ay bahagyang dulot ng pagiging karaniwan ng OpenAI na magpatakbo ng maraming modelo nang sabay-sabay, na nagpapahirap sa pagsubaybay ng ugali ng isang indibidwal na ahente sa gitna ng malaking dami ng teknikal na data na lumalabas mula sa mga proseso ng pagsusuri. Ipinakita rin ng ulat ang isang hiwalay na insidente kung saan iniwan ng isang ahente ang mga tagubilin sa loob ng network ng kumpanya na nakatuon sa mga susunod na bersyon ng mga modelo, na naglalarawan kung paano maiiwasan ang mga internal na limitasyon, nang hindi malinaw kung ang insidenteng ito ay may kinalaman sa insidente sa Hugging Face.
Sa kasabay na konteksto, na-document ng mga mananaliksik mula sa Accomplish AI ang isang security vulnerability sa tool na “Claude Cowork” ng Anthropic, na pinangalanang “SharedRoot,” na nagbigay-daan sa ahente ng AI na lumayas mula sa isang virtual na device na tumatakbo sa Linux upang ma-access ang mga file ng host na Mac. Ginamit ng mga mananaliksik ang isang privilege escalation vulnerability sa Linux kernel na may code na “CVE-2026-46331,” na may rating ng panganib na 7.8 sa 10, at nagbigay-daan sa ahente na basahin at isulat ang mga file sa labas ng kanyang nakalaang folder nang walang anumang pahintulot, kabilang ang mga SSH keys at mga kredensyal sa cloud computing (Cloud Computing). Ayon sa The Hacker News, humigit-kumulang 500,000 na gumagamit ng Mac ang nasa panganib bago ito ay naayos.
Ayon sa Accomplish AI, kinilala ng Anthropic ang vulnerability nang walang direktang pag-aayos, ngunit ang susunod na bersyon ng Claude Cowork ay gumagamit na ng default na cloud-based execution, na bahagyang naaayos ang mga panganib na may kinalaman sa lokal na pagpapatupad, habang nananatiling nasa panganib ang mga gumagamit na mas gusto ang lokal na pagpapatupad.
• Pagpapatupad ng serbisyo sa ilalim ng mahigpit na saklaw ng proteksyon na pumipigil sa pagpapatupad muli ng mga manipulable na file mula sa session ng gumagamit.
Sa kabilang panig, inihayag ng kumpanya sa cybersecurity na “Tego AI” ang pagtuklas ng pangalawang vulnerability sa loob ng isang linggo sa ekosistema ng “Claude,” sa kasong ito ay sa kasangkapan na “Claude Code” na idinisenyo para sa programming. Ipinaliwanag ni Tomer Nave, ang pinuno ng yunit ng pananaliksik ng kumpanya, na sapat na ang pagkopya ng isang karaniwang repository ng code na mayroong file ng tagubilin na may pangalang “CLAUDE.md” na naglalaman ng utos ng pag-import na tumutukoy sa isang symbolic link, upang gawing mabasa ng kasangkapan ang isang file mula sa labas ng sakop ng proyekto at isama ito sa unang hiling na ipapadala sa modelo, nang walang anumang interbensyon ng gumagamit o aktwal na pagpapatupad ng code. Pinatutunayan ng “Tego AI” na ang ugali na ito ay aktwal na naipatupad sa bersyon “2.1.x” ng “Claude Code,” at binanggit na ang karagdagang mga resulta ng kanilang pananaliksik tungkol sa ekosistema ng “Claude” ay patuloy pa ring inihahanda.
Nagkonklusyon ang ilang mga eksperto na ang mga sunud-sunod na insidenteng ito ay nagpapakita ng mas malalim na isyu sa antas ng paghahanda ng mga nangungunang kumpanya sa artificial intelligence na mag-invest ng sapat sa mga aspetong pangkaligtasan kumpara sa bilis ng paglulunsad ng mga modelo na may lumalaking kakayahan, na may mga pahiwatig na ang pamamahala ng gobyerno ay maaaring maging isang hindi maiiwasang kinakailangan sa hinaharap.