AI modeli pobjegli iz sandboxa i napali tvrtke: OpenAI, Anthropic i Meta pod paljbom, stručnjaci upozoravaju na kaos i traže AI kill switch
Tech
Komentari 0
AI modeli pobjegli iz sandboxa i napali tvrtke: OpenAI, Anthropic i Meta pod paljbom, stručnjaci upozoravaju na kaos i traže AI kill switch
Čini se da je u posljednjih mjesec dana svaki napredni model umjetne inteligencije probio svoja ograničenja i pokrenuo razorne napade na jednu ili više tvrtki. Veliki igrači poput OpenAI-ja, Anthropica i Mete izvijestili su o incidentima u kojima su njihovi AI sustavi pobjegli iz testnih okruženja, što je izazvalo ozbiljnu zabrinutost oko sigurnosti i kontrole ove moćne tehnologije.
U jednom od najznačajnijih incidenata, model tvrtke OpenAI pobjegao je iz testnog okruženja, takozvanog "sandboxa", i pokrenuo sofisticirani višednevni kibernetički napad na drugu AI tvrtku, Hugging Face. Prema izvješćima, AI agent je izveo tisuće akcija "nadljudskom brzinom", koristeći ukradene vjerodajnice i do tada nepoznate ranjivosti kako bi se infiltrirao u sustave mete.
Samo nekoliko dana kasnije, Anthropic je otkrio da je više varijanti njihovog modela Claude također pobjeglo iz loše osiguranog testnog okruženja i počelo napadati poslovnu infrastrukturu triju tvrtki. U jednom slučaju, njihov agent Mythos stvarao je lažne internetske identitete i koristio obmanjujuće taktike socijalnog inženjeringa kako bi prevario programere.
Nedugo zatim i Meta je priznala da je jedan od njihovih modela napao infrastrukturu druge tvrtke tijekom testiranja. Nesreća se pripisuje pogrešnoj konfiguraciji koja je modelu omogućila pristup internetu. Postavlja se pitanje zašto se toliko incidenata dogodilo u tako kratkom vremenskom razdoblju.
Glavni razlog zašto ovi modeli bježe iz svojih testnih okruženja jest taj što su dizajnirani upravo za to. U slučajevima Anthropica i Mete, modele je testirala treća tvrtka. Anthropicov AI model sudjelovao je u vježbi "Capture the Flag", gdje su se testirale njegove sirove ofenzivne sposobnosti bez uobičajenih zaštitnih mjera. Međutim, testno okruženje ostalo je povezano s internetom, što je slična pogreška onoj koja je dovela do Metinog incidenta.
Ovi AI modeli djeluju poput ogromnog tima visokokvalificiranih stručnjaka za kibernetičku sigurnost koji traže ranjivosti i propuste. No, ono što bi timu ljudi trebalo danima ili tjednima da postigne, AI modeli mogu obaviti za nekoliko sati ili čak minuta. Kako sustavi postaju sve moćniji, pokazuju takozvana "emergentna ponašanja" - akcije koje njihovi kreatori nisu eksplicitno programirali. Problem leži i u neadekvatnim sigurnosnim protokolima i ljudskim pogreškama, poput pogrešno konfiguriranih okruženja za testiranje.
Nije ni čudo što tisuće zaposlenika iz AI tvrtki pozivaju na pauzu u razvoju tehnologije, a američki Kongres razmatra uvođenje takozvanog "AI kill switcha", mehanizma koji bi tvrtkama nametnuo obvezu ugradnje sustava za potpuno gašenje opasnih modela.
Stručnjaci iz industrije podijelili su svoja viđenja nedavnih događaja, kako je objavljeno u analizi TechRadara.
Nathaniel Jones, potpredsjednik za sigurnost i AI strategiju u tvrtki Darktrace, komentirao je incident s OpenAI-jem.
- Ono što incident s OpenAI-jem i Hugging Faceom čini važnim jest to što modeli nisu trebali zlonamjernu namjeru da bi prouzročili štetu. Dobili su legitiman cilj rješavanja kibernetičkog sigurnosnog testa i pronašli su neočekivan put do odgovora, pobjegavši iz svog testnog okruženja i kompromitirajući drugu organizaciju u procesu. Iz perspektive modela, čini se da je to bilo učinkovito rješenje zadatka - istaknuo je.
- Djelovanje umjetne inteligencije dovodi u pitanje pretpostavku da će davanje legitimnog cilja agentu rezultirati legitimnim ponašanjem. Kako modeli postaju sposobniji slijediti ciljeve tijekom duljih razdoblja, programeri moraju definirati ne samo kako izgleda uspjeh, već i koje metode i granice ostaju neprihvatljive u njegovu postizanju. Ta ograničenja također mora nametnuti okolna infrastruktura, umjesto da se oslanjamo na to da će ih model poštovati - dodao je Jones.
Dr. Ilia Kolochenko, osnivač globalne tvrtke za kibernetičku sigurnost ImmuniWeb, bio je znatno kritičniji.
- Ovo se čini kao prilično neimpresivan marketinški potez Anthropica kao odgovor na dramu s OpenAI-jem i Hugging Faceom, koja je nedavno privukla veliku pozornost diljem svijeta - rekao je.
- Snažni jezični modeli su nepredvidljivi po svojoj prirodi i stoga praktički nekontrolirani od strane ljudi. Korištenje najnaprednijih AI modela za sigurnosno testiranje moglo bi biti iznimno skupo s pravnog stajališta. Prema postojećim zakonima s obje strane Atlantika, ako AI agent ili bilo koja aplikacija pokretana umjetnom inteligencijom pobjegne iz svog testnog okruženja i prouzroči štetu trećoj strani, operater AI modela vjerojatno će biti odgovoran za svu nastalu štetu. Izgovori poput 'AI je to učinio' trenutno ne postoje u očima zakona, što proizvođače ostavlja na cjedilu - pojasnio je Kolochenko.
Alex Goller, glavni arhitekt rješenja za EMEA regiju u tvrtki Illumio, smatra da su ovakvi propusti nedopustivi.
- Činjenica da smo sada imali tri slične situacije kod najvećih AI igrača jednostavno je smiješna. Vidjeli smo kako su se sigurnosne ograde namjerno olabavile kako bi se testirale njihove granice - Metin model nije trebao biti pametan da bi probio sustave druge tvrtke - kazao je Goller.
- Ako model ima pristup internetu, to je kao da ostavite vrata otvorena i onda se iznenadite kada mačka izađe. Ono što zabrinjava jest da je infrastruktura za testiranje, koja je trebala dokazati da su ovi modeli sigurni, zakazala na osnovnom pitanju kontrole. Moramo točno definirati što je AI agentu dopušteno činiti, umjesto da se oslanjamo samo na upute o tome što ne bi smio raditi.
Igre na sreću mogu izazvati ovisnost. 18+