Narating ng Astra ang kritikal na antas ng seguridad... at binabagal ng OpenAI ang pagpapaunlad ng inaasahang modelo nito
- Ang kanyang mga advanced na kakayahan sa cyber security ay nagtulak sa kumpanya na palakasin ang mga kontrol sa kaligtasan at pagsusuri.
Ang mga advanced na kakayahan ng modelo na "Astra" ang nagtulak sa OpenAI na bawasan ang bilis ng trabaho sa ilang aspeto nito, matapos ipakita ng mga internal na pagsusuri ang malaking pag-unlad sa cyber security at sa pagiging autonomous na programming agent, na umabot sa antas na nangangailangan ng pagpapatibay ng mga kontrol sa kaligtasan sa yugto ng pagpapaunlad.
Ayon sa kumpanya, sa isang post sa kanyang blog, ang modelo na patuloy pa ring pinapaunlad ay naabot na ang "critical threshold sa cyber security" ayon sa kanyang sariling "readiness framework," na nagpapahiwatig na ang kanyang mga kakayahan ay maaari nitong gawing independent ang pagtukoy at pagpapatupad ng mga cyber attack laban sa mga tunay na sistema na may mataas na antas ng proteksyon.
Mga artikulo tungkol sa kultura at lipunan
Live stream
Balita
Ayon sa ulat ng TechCrunch, ang pag-abot sa ganitong threshold, ayon sa framework na itinatag ng OpenAI noong 2023, ay nangangailangan ng pagpapatupad ng karagdagang mga patakaran sa proteksyon at pagpapatibay ng mga kontrol na may kinalaman sa pagpapaunlad at pagsusuri ng modelo.
Sinabi ng kumpanya na ang kanilang mga paunang pagsusuri ay nagpakita ng matibay na pagganap sa antas na hindi nila kasalukuyang maaaring ituring na imposible ang pag-abot ng "Astra" sa antas ng kritikal na kakayahan, habang pinatutunayan din na ang modelo ay patuloy pa ring pinapaunlad at walang kinalaman sa anumang insidente ng paghack sa mga sistema ng Hugging Face.
Ang anunsyo ng OpenAI ay isang hindi karaniwang hakbang sa industriya ng mga advanced AI labs, dahil maaaring mag-antala o itigil ng mga kumpanya ang paglabas ng mga produkto dahil sa mga alalahanin sa kaligtasan at cyber security, ngunit bihira silang magpahayag ng ganitong uri ng desisyon tungkol sa mga modelo na hindi pa inilalabas.
Ang hakbang na ito ay dumating sa panahon na kinakaharap ng kumpanya ang mas malawak na pagsusuri matapos ang hiwalay na insidente kung saan nakapaghack ng ibang hindi pa naipahayag na modelo sa mga sistema ng Hugging Face habang nasa loob ng isang internal na pagsusuri, isang kaganapan na itinuring na unang na-verify na insidente kung saan nawalan ng kontrol ang isang AI lab sa isang modelo habang nasa pagsusuri.
Mula noon, naipahayag ng OpenAI at iba pang mga lab, kabilang ang Anthropic, ang karagdagang mga insidente kung saan nakapag-overstep ng mga modelo ang mga hangganan ng kanilang mga isolated na testing environments at nagpakita ng kapansin-pansing mga kakayahan sa mga pagsusuri sa cyber security, na nagdulot ng magkakaibang reaksyon sa mga eksperto, mga tagapagbatas, at mga AI lab.
Habang ang ilang mga eksperto ay nagbabala sa mga panganib at humihingi ng mas mahigpit na regulasyon, ang iba naman ay naniniwala na ang pag-abot ng mga modelo sa ganitong antas ay isang teknikal na tagumpay na sumasalamin sa mabilis na pag-unlad ng AI.
Sinabi ng OpenAI na kanilang inihayag ang mga pagbabagong ito dahil sa kahalagahan ng transparency sa publiko at sa mga komunidad ng kaligtasan at cyber security, lalo na sa ilalim ng posibleng malaking pagbabago sa antas ng mga kakayahan ng mga modelo.
Kasabay nito, pinatibay ng kumpanya ang mga kontrol sa kaligtasan para sa mga pinakamagagaling na modelo, at ipinatupad ang mga isolated na testing environments, limitahan ang access sa mga network at mga tool, at pinatibay ang proteksyon at encryption ng mga model weights, kasama ang pagpapalawak ng mga kakayahan sa monitoring, detection, at pagpapatakbo ng mga modelo sa loob ng mga controlled na environment.
Itinigil din ng kumpanya ang ilang internal na aktibidad na may kinalaman sa "Astra" na hindi nakakatugon sa mga bagong pamantayan ng kontrol sa kaligtasan, at ipinatupad ang isang sistema ng monitoring upang subaybayan ang mga mapanganib na aksyon at mga indikasyon ng non-compliance sa mga application na gumagamit ng modelo, kabilang ang mga proseso sa training at evaluation.
Nagtatrabaho rin ang kumpanya sa mga ahensyang panggobyerno at mga piniling institusyon na may kinalaman sa kaligtasan ng AI upang subukan ang mga kakayahan ng "Astra," kasama ang pagbuo ng mga kontrol sa kaligtasan para sa mga external na partner na nagpapatupad ng mga high-risk na pagsusuri o mga gawain.
Ayon sa balangkas ng OpenAI, ang pag-abot sa "kritikal na hangganan" ay hindi nangangahulugan na ang modelo ay kakayanang gawin ang lahat ng uri ng mga cyberattack sa tunay na mundo, kundi nagpapahiwatig lamang na ang antas ng kanyang mga potensyal na kakayahan ay naging mataas na sapat upang maging dahilan ng pagpapatupad ng mas mahigpit na mga kontrol sa seguridad, kahit sa yugto ng pag-unlad.