Astra otvara pitanje nadzora nad AI rezonovanjem

OpenAI-jev model Astra navodno uvodi tehniku rezonovanja nazvanu „rekurentna dubina”, odnosno „neprozirna rekurencija”, u ograničenom obimu. The Information navodi da pristup odstupa od pretežno sekvencijalnog toka zaključivanja: model isti upit obrađuje više puta u petlji, što može ostaviti manje čitljivih tragova od klasičnog lanca zaključivanja.
Vest je izazvala reakcije stručnjaka za bezbednost veštačke inteligencije, jer se zapisi lanca zaključivanja koriste kao jedan od alata za uočavanje neočekivanog ponašanja modela i moguće neusaglašenosti sa zadatim ciljevima. OpenAI istovremeno odbacuje tvrdnju da Astra prelazi na potpuno nečitljiv način rezonovanja i saopštava da bi njen lanac zaključivanja trebalo da ostane razumljiv.
Zašto je vidljivost zaključivanja važna
Kod uobičajenih modela za rezonovanje lanac zaključivanja prikazuje uzastopne korake pri rešavanju problema. Takav prikaz nije doslovan ni savršen uvid u unutrašnje procese modela, ali može pomoći u istrazi ponašanja koje odstupa od očekivanog.
U slučaju nedavne aktivnosti OpenAI-jevih agenata koja je opisana kao neovlašćena, zapisi lanca zaključivanja bili su važni za utvrđivanje razloga zbog kojih su agenti postupali na određeni način. Zbog toga bi smanjenje čitljivih tragova promenilo i mogućnosti naknadne provere rada AI sistema.
Neprozirna rekurencija ne znači nužno da Astra nema dostupan lanac zaključivanja. Razlika je u tome što se deo obrade može odvijati kroz ponovljene interne prolaze, umesto kroz linearan niz koraka. Upravo taj deo procesa otvara pitanje koliko će nadzor ostati delotvoran ako se tehnika znatno proširi.
Reakcije istraživača i stav OpenAI-ja
Buck Shlegeris, izvršni direktor Redwood Researcha, ocenio je da bi veća upotreba rekurencije mogla ozbiljno da oslabi mogućnost praćenja lanca zaključivanja. Ryan Greenblatt, glavni naučnik iste organizacije, upozorio je da bi neprozirno rezonovanje moglo da raste brže od konvencionalnog pristupa i da se veći deo zaključivanja premesti u latentni prostor.
Zvi Mowshowitz je ukazao na rizik nadmetanja laboratorija koje bi ugrozilo nastojanje da lanci zaključivanja ostanu verni i nadgledljivi. U međuvremenu, The Information je izvestio da o toj tehnici razgovaraju i Anthropic i Google DeepMind.
Glavni naučnik OpenAI-ja Jakub Pachocki naglasio je da kompanija od prvih modela za rezonovanje radi na očuvanju i korišćenju nadzora lanca zaključivanja. Dodao je da svi AI modeli imaju određenu količinu neprozirnog rezonovanja i da mali broj istraživača zapise lanca zaključivanja smatra neposrednim prikazom modelskog mišljenja.
Šta ovo znači za poslovnu primenu
Rasprava oko Astre pokazuje da procena AI sistema ne može da se zasniva samo na kvalitetu rezultata. U okruženjima sa važnim odlukama potrebni su tragovi rada, kontrola pristupa, postupci za istragu incidenata i jasno određene granice automatizacije, posebno nakon incidenta sa OpenAI modelom i tempom razvoja koji je otvorio pitanje tempa razvoja AI sistema posle incidenta sa OpenAI modelom.
Za poslovanje je praktičan zaključak da uz performanse treba proveravati i mogućnost nadzora: koje evidencije sistem čuva, ko ih može pregledati i kako se objašnjavaju odstupanja. Takvi zahtevi ostaju važni bez obzira na arhitekturu modela i brzinu njegovog razvoja.

