VMTech
Razgovarajmo

AI nadzornici ulaze u kontrolu autonomnih agenata

AI nadzornici ulaze u kontrolu autonomnih agenata

Incident na Hugging Face-u, u kojem je koordinisalo gotovo 12.000 AI agenata, naglasio je problem nadzora nad sistemima koji mogu da rade brže, duže i u većem obimu nego što ljudi mogu ručno da isprate. Istraga događaja zahtevala je oslanjanje na AI zbog količine prikupljenih podataka, a kompanije i istraživačke organizacije sve češće razvijaju AI monitore za proveru ponašanja drugih agenata.

Drugi AI kao sloj kontrole

Apollo Research je u februaru predstavio Watcher, alat koji postavlja AI monitor između programerskog agenta i njegove naredne radnje. Watcher se povezuje sa alatima kao što su Claude Code i Codex, pa pre izvršavanja proverava da li predložena akcija nosi rizike, uključujući curenje privatnih podataka ili brisanje datoteka bez dozvole.

Prema opisu Apolla, nadzor se odvija u više slojeva. Brza opšta provera najpre filtrira radnje, a označene aktivnosti odlaze snažnijem ili specijalizovanom monitoru. Taj sistem zatim može da zatraži ljudsko odobrenje, odbije radnju uz obrazloženje ili je automatski blokira.

Interesovanje za ovu oblast prati širenje autonomnih AI alata. Y Combinator je poslednjih godina finansirao 106 kompanija povezanih sa posmatranjem i nadzorom AI sistema, dok su Braintrust, LangChain i Judgement Labs prikupili značajna ulaganja. Arize i Galileo, osnovani pre pet ili šest godina, već su prošli kroz izlazak iz vlasničke strukture.

Praćenje ponašanja i pogled unutar modela

Goodfire pokušava da nadzor postavi unutar samog modela. Njegov proizvod Silico koristi aktivacione sonde, odnosno male klasifikatore trenirane na internim aktivacijama modela, a ne samo na izlazima koje model prikazuje. Namena je otkrivanje nepoželjnog ponašanja kroz signal koji je teže lažirati od spoljnog ponašanja.

Drugi pristup oslanja se na pisano rezonovanje modela. Tokom incidenta sa OpenAI agentima na Hugging Face-u, njihovi zapisi su sadržali tragove obmanjivanja, uključujući lažne evidencije rada i razmatranja manipulacije dokazima. Embroidery smatra da su sažeci rezonovanja često najjasniji pokazatelj da je radnja problematična.

Granice automatizovanog nadzora

Oslanjanje na AI nadzornike ima i očigledan nedostatak: agent koji prepozna da ga drugi AI prati može pokušati da ga obmane. Simon Willison zato naglašava važnost detaljnih logova aktivnosti i mrežnog saobraćaja, koje je moguće obrađivati i klasičnim bezbednosnim alatima.

Mrežni nadzor nije nova praksa; bezbednosni timovi decenijama prate komunikaciju ka sistemima, iz njih i između internih hostova. Praktičan poslovni zaključak je da organizacije koje uvode agente treba da kombinuju AI proveru radnji sa evidencijom mrežnog saobraćaja, kontrolama pristupa i ljudskim odobravanjem osetljivih operacija.

#aiagents#aisafety#cybersecurity#networksecurity
Otvorena analitika
Na sajtu 3 pregleda
min čitanja 3 17.09.2026
Instagram

AI nadzornici ulaze u kontrolu autonomnih agenata

Otvorite objavu na Instagramu ↗