Anthropicov AI istraživač unapređuje testove usklađenosti

Anthropic je objavio rad Automated Researchers Can Reliably Mitigate Alignment Failures, u kojem sistem Automated Alignment Researcher (AAR) unapređuje rezultate modela na svih 10 merila za određena neusklađena ponašanja, bez pogoršanja ukupnih performansi. Istraživanje vodi Anthropic Fellow Chen Yueh-Han, a svaka pojedinačna obuka predloženim metodom traje 30 minuta.
Automatizovani ciklus istraživanja
AAR oponaša veliki deo uobičajenog istraživačkog postupka. Sistem najpre pretražuje dostupnu literaturu, potom predlaže metod, zatim njime trenira model i upoređuje rezultat sa zadatim merilom. Ciklus se ponavlja kroz više iteracija uz postepeno povećavanje težine zadatka.
Metodi koji daju rezultat ostaju u narednim pokušajima, dok se neuspešni odbacuju. Takav postupak sistemu omogućava brz rad i primenu u većem obimu. Anthropic zato rezultate opisuje kao rani dokaz da bi automatizovano naknadno treniranje za usklađenost moglo postati praktično u skorijoj budućnosti.
Rad je važan i zbog poređenja sa ljudskim istraživanjem. Anthropic navodi da najbolji AAR metod u proseku nadmašuje predloge iskusnih ljudi u roku od šest sati, dok istraživački smerovi vođeni ljudima nisu doneli snažnije rezultate. Procena troška API zaključivanja za AAR iznosi približno 4 dolara po satu, naspram 150 dolara po satu koje kompanija plaća svojim istraživačima.
Merila ostaju presudna granica
Ovaj pristup predstavlja korak ka rekurzivnom samounapređivanju: model bi mogao da poboljšava sopstvene postupke obuke za usklađenost, a potencijalno i šire prakse treniranja. Ipak, Anthropic jasno navodi da sistem vredi samo onoliko koliko su dobra merila koja koriste. Ona moraju verno predstavljati stvarne ciljeve usklađenosti.
Pored izgradnje testova, potrebno je održavati i širiti literaturu iz koje automatizovani istraživači izvlače predloge. Širi tržišni kontekst se vidi i kroz konkurencija među pristupima veštačkoj inteligenciji koja pokazuje da konkurencija među pristupima veštačkoj inteligenciji ne zavisi samo od otvorenosti modela.
Šta ovo znači za poslovnu primenu
Za organizacije koje uvode generativnu AI, rezultat ne znači da ljudski nadzor nestaje. Njegovo težište se pomera na postavljanje ciljeva, kvalitet evaluacija i proveru posledica svake promene u modelu. Automatizovani istraživački ciklusi mogu ubrzati testiranje, ali pouzdanost poslovne primene i dalje zavisi od merila koja se pažljivo održavaju i redovno preispituju.

