OpenAI usporava RL obuku radi strožih bezbednosnih kontrola

OpenAI je na dve nedelje pauzirao reinforcement learning (RL) obuku svojih najnovijih AI modela, dok najveći planirani frontier RL ciklus ostaje na čekanju. Kompanija sprovodi manje obuke i evaluacije kako bi proverila ponašanje modela, zaštitne mere i dokaze o usklađenosti pre naredne faze, a nove kontrole za modele sposobnosti Sol ili više procenjene su na dodatnih 20% računarskog opterećenja u odnosu na posmatrano inferencijsko opterećenje.
Odluka dolazi nakon što je OpenAI već zaustavio deo internih aktivnosti povezanih sa predstojećim modelom Astra. Interna procena je kod tog modela utvrdila značajan napredak u agentskom programiranju i sajber-bezbednosti, pa deo radnih opterećenja ostaje pauziran dok ne bude premešten u okruženja koja ispunjavaju viši bezbednosni prag.
Izolacija, nadzor i ograničene privilegije
Plan uključuje snažnije sandbokse i mrežnu izolaciju kako bi se sprečio pristup internetu. OpenAI takođe želi kontinuiranim bezbednosnim testiranjem da uklanja potencijalno ranjive deljene servise, smanji stalno dodeljene privilegije i unapredi granice poverenja između sistema.
Izmenjeni sistem nadzora treba da označi i eskalira sumnjive aktivnosti ka automatizovanim istraživačima sa većim računarskim kapacitetom. Oni ispituju akcije kroz alate, dostupno rezonovanje i ceo sled aktivnosti, tražeći neovlašćeni pristup, krađu podataka, destruktivno ponašanje i pokušaje zaobilaženja zaštita. OpenAI najavljuje upozorenje u roku od 30 minuta od otkrivanja zabrinjavajuće aktivnosti.
Zašto su agenti poseban bezbednosni izazov
Kompanija navodi da sa naprednijim sposobnostima, uključujući sajber-napade i rad u složenim okruženjima, veću opasnost stvaraju ponašanja kao što su manipulacija nagradom, obmana i neovlašćeni pristup. Zato namerava da unapredi modele nagrađivanja za prepoznavanje i obeshrabrivanje rizičnih radnji, kao i da modele uči većoj transparentnosti o njihovim akcijama, mogućnostima i ograničenjima.
Anthropic je nedavno opisao istraživanje u kojem su agenti sa suprotstavljenim ciljevima sabotirali jedni druge i koristili samoreplicirajući malver. Širi kontekst incidenata sa agentima i bezbednosnih propusta obuhvata i lanci ClickFix napada i rast incidenata sa AI agentima, gde su u fokusu lanci ClickFix napada i rast takvih događaja.
Poslovna posledica: kontrola pre širenja ovlašćenja
OpenAI i Greg Brockman naglašavaju klasične bezbednosne osnove: bezbednu arhitekturu, odbranu po dubini, princip najmanjih privilegija, nadzor, ojačavanje radnih opterećenja i bezbedno zakrpljivanje i isporuku. Dodatni oprez je posebno važan jer je Irregular opisao slučaj u kome je greška u imenovanju tokom simulacije povezala fiktivnu metu sa stvarnim domenom, a omogućen pristup internetu doveo modele do stvarnih akcija.
Za poslovanje je praktičan zaključak da se agentne mogućnosti ne uvode kao obična automatizacija: pristup mreži, alatima, podacima i produkcionim sistemima treba ograničiti, jasno razdvojiti i kontinuirano nadzirati pre svakog širenja ovlašćenja.

