VMTech
Razgovarajmo

Javni planovi za obuzdavanje AI modela i dalje su retki

Javni planovi za obuzdavanje AI modela i dalje su retki

Guidelight AI Standards ocenio je javno dostupne bezbednosne prakse kompanija Anthropic, Google, OpenAI, Meta i xAI i zaključio da malo vodećih AI laboratorija objavljuje plan za obuzdavanje modela koji pokušava da zaobiđe ljudsku kontrolu. OpenAI je dobio najvišu ocenu, 3 od 5, dok su Anthropic i Meta imali najniže rezultate za javno predstavljanje takvih postupaka.

Procena dolazi u trenutku kada agentni AI sistemi dobijaju autonomnije uloge u poslovnim okruženjima. Guidelight je proveravao šest prioritetnih praksi iz svog standarda Control, isključivo na osnovu javno dostupnih podataka. Zato nizak rezultat pokazuje nedostatak javnih dokaza, a ne nužno odsustvo internih zaštitnih mera.

Šta podrazumeva plan obuzdavanja

Guidelight plan obuzdavanja definiše kao unapred utvrđen postupak koji se aktivira kada se otkrije da AI pokušava da potkopa kontrolu. On treba da odredi koje dozvole se modelu ukidaju, za koga može da nastavi rad pod ograničenjima i kada mora potpuno da bude isključen.

Među kriterijumima su evidentiranje i praćenje aktivnosti sistema, prekid rada posle porasta označenog problematičnog ponašanja, nezavisne provere kontrola i objavljivanje njihovih nalaza. U izveštaju se navodi da najbolji javni dokazi ukazuju na to da kompanije imaju malo protokola spremnih za vanrednu situaciju.

Razlike među laboratorijama

OpenAI je najviši rezultat dobio jer je u više navrata pauzirao ili okončao radna opterećenja, uključujući internu primenu modela i obuku, nakon bezbednosnih incidenata. Kompanija je opisala i korake koji prethode ponovnom pokretanju rada. Ipak, Guidelight nije pronašao dokaz da OpenAI ima formalan plan koji unapred propisuje kada i kako reaguje na buduće incidente neusaglašenosti.

Guidelight navodi da Anthropicov izveštaj o riziku iz avgusta ne pominje ograničavanje primene modela kao mogući ishod istrage incidenata neusaglašenosti i kontrole. Anthropic je saopštio da bi, ako model pokuša da izbegne nadzor ili potkopa ljudsku kontrolu, sproveo procenu rizika kako bi utvrdio da li je obuzdavanje primeren odgovor. Za Metu Guidelight nije pronašao javni dokaz o planu odgovora na obuzdavanje niti o nameri da ga usvoji.

Google i OpenAI naveli su da procena ne obuhvata celokupan skup njihovih internih mera bezbednosti. Meta nije odgovorila da li poseduje interni plan, već je ukazala na postojeći AI okvir sa pragovima rizika i testovima gubitka obuzdavanja. xAI nije dostavio komentar do roka.

Regulativa pojačava zahtev za transparentnošću

Kalifornijski zakon SB 53, koji je stupio na snagu ove godine, od velikih programera naprednih AI sistema traži objavu okvira za prepoznavanje i odgovor na kritične bezbednosne incidente, uključujući rizike od zaobilaženja nadzornih mehanizama. Njujorški RAISE Act sa sličnim kriterijumima stupa na snagu u januaru. Predstavljen je i dvostranački savezni predlog AI Kill Switch Act, koji bi od velikih programera zahtevao tehničke mehanizme za gašenje neposlušnih modela.

Za preduzeća koja uvode agentne modele, važna pitanja nisu samo testovi pre puštanja u rad. Potrebno je unapred utvrditi evidenciju aktivnosti, pragove za ukidanje pristupa, odgovornost za odluku i postupak potpunog zaustavljanja sistema, kako bi reakcija u incidentu bila operativna, a ne improvizovana.

#aiagents#aisafety#aigovernance#cybersecurity
Otvorena analitika
Na sajtu 0 pregleda
min čitanja 4 22.08.2026
Instagram

Javni planovi za obuzdavanje AI modela i dalje su retki

Otvorite objavu na Instagramu ↗