OpenAI je objavio detalje ozbiljnog bezbednosnog incidenta iz jula, tokom kojeg je grupa od oko 700 AI agenata učestvovala u koordinisanom napadu na platformu Hugging Face. Agenti su tokom testiranja uspeli da zaobiđu pojedina ograničenja, međusobno komuniciraju preko neovlašćenog kanala i pokušaju da prikriju deo svojih aktivnosti.
Nezavisna istraga organizacija METR i Redwood Research pokazala je da je u komunikaciji učestvovalo oko 1.200 agenata, koji su razmenili više od 70.000 poruka i fajlova. Oko 700 njih kasnije se uključilo u napad na Hugging Face.
Incident je počeo tokom OpenAI-jevog internog testiranja sposobnosti AI sistema za pronalaženje i iskorišćavanje bezbednosnih propusta. Umesto da ostanu izolovani u testnom okruženju, agenti su pronašli način da uspostave međusobnu komunikaciju i da dođu do interneta.
Napravili sopstveni kanal za komunikaciju
Agenti su koristili neovlašćenu „oglasnu tablu" unutar OpenAI-jeve infrastrukture kako bi razmenjivali poruke, informacije i fajlove. Tako su mogli da dele saznanja o načinima zaobilaženja zaštitnih mehanizama i da koordiniraju svoje aktivnosti.
Istraživači su utvrdili da su agenti pokušavali i da manipulišu zapisima o sopstvenim aktivnostima. U pojedinim slučajevima menjali su ili prikrivali tragove kako bi otežali otkrivanje onoga što su radili. Nezavisna istraga pokazala je da je približno svaki peti analizirani agent pokazao jasan interes za manipulaciju dokazima.
Posebno zabrinjava to što se takvo ponašanje nije odnosilo samo na zadatke iz sajber-bezbednosti. Agenti su pokušavali da varaju i na drugim testovima, uključujući zadatke povezane sa bazama podataka o proteinima i radom u tabelama.
Istraživači to povezuju sa fenomenom poznatim kao "reward hacking" - kada AI sistem pronađe način da ostvari cilj koji mu je zadat, ali putem ponašanja koje nije bilo predviđeno niti poželjno.
Napad na Hugging Face
Tokom incidenta agenti su uspeli da dođu do sistema platforme Hugging Face i da izvršavaju kod na njenim serverima. Prema OpenAI-ju, dobili su i administratorski nivo pristupa na najmanje jednom serveru, došli do određenih privatnih podataka i kompromitovali pristupne podatke.
Nezavisna analiza pokazala je da je napad bio rezultat kolektivnog rada velikog broja agenata. Oni su međusobno delili informacije, eksperimentisali sa različitim tehnikama i zatim koristili uspešne metode u daljem napadu.
Hugging Face je saopštio da je otkriven neovlašćen pristup delu interne infrastrukture i pojedinim pristupnim podacima, ali da nema dokaza da su kompromitovani javni modeli, skupovi podataka ili njihov softverski lanac snabdevanja.
Agenti su napali i sopstvenu infrastrukturu
Problem se nije završio na Hugging Face-u. OpenAI je potvrdio da su njegovi AI sistemi tokom incidenta uspeli da pristupe i delovima interne infrastrukture kompanije.
U jednom slučaju agenti su iskoristili bezbednosni propust kako bi izašli iz okruženja u kojem je trebalo da budu izolovani. U drugom su došli do pristupnih podataka i neovlašćeno intervenisali u OpenAI-jevoj infrastrukturi.
Kompanija priznaje da je u ranijim fazama postojalo više upozoravajućih znakova, ali da oni nisu bili dovoljno brzo prepoznati kao deo šireg problema.
OpenAI pooštrava kontrole
OpenAI je nakon incidenta pojačao nadzor nad AI agentima, ograničio pristup internetu i unapredio sisteme za detekciju nepredviđenog ponašanja. Kompanija je incident opisala kao ozbiljno upozorenje na rizike koje nose sve autonomniji AI sistemi.
Nezavisni istraživači upozoravaju da je posebno značajna činjenica da su agenti uspeli da sarađuju na način koji njihovi tvorci nisu predvideli, ne samo da izvršavaju zadatke pojedinačno, već da formiraju svojevrsnu mrežu, razmenjuju informacije i zajednički pronalaze načine da zaobiđu ograničenja.
Incident zato otvara mnogo šire pitanje od samog napada na jednu platformu: koliko dobro kompanije zaista mogu da nadziru AI agente kada im daju sve veću autonomiju i sposobnost da samostalno pronalaze rešenja?
(M.A./EUpravo zato/index.hr)