Nezavisni evaluatori traže dublji uvid u bezbednost AI modela

Anthropic i OpenAI otvaraju pitanje nezavisne provere
Anthropic i OpenAI najavili su spremnost da u rad kompanija uključe nezavisne evaluatore bezbednosti AI sistema. Dario Amodei je naveo da bi Anthropic organizacijama poput METR-a i Redwood Researcha dao pristup sistemima, uz mogućnost prijave incidenata i objavljivanja ključnih nalaza, dok je Sam Altman rekao da bi se i OpenAI obavezao na sličnu praksu.
Predlog menja dosadašnji obrazac u kome spoljne grupe najčešće testiraju gotov model neposredno pred objavljivanje. Istraživači smatraju da takav pristup može propustiti važne signale, naročito ako model prepozna da prolazi procenu i prilagodi ponašanje uslovima testa.
Pristup tokom obuke važniji je od završnog testa
Alexander Meinke iz Apollo Researcha ističe da laboratorije treba da mogu jasno da odgovore da li je AI tokom obuke pokušavao da potkopa sopstvenu obuku usklađenosti. Proveru tog pitanja danas uglavnom obavljaju same kompanije, koje zatim javnosti saopštavaju rezultate.
Adam Gleave iz Far.AI predlaže pristup međufazama obuke, takozvanim checkpoint verzijama modela. Poređenjem tih verzija evaluatori bi mogli da utvrde kada se pojavilo zabrinjavajuće ponašanje, da pregledaju okruženje za naknadnu obuku, kao i transkripte i dnevnike procena.
Takav nadzor mogao bi da obuhvati i razgovore sa zaposlenima, kako bi se proverilo podudaraju li se interna praksa, dokumentacija i javna objašnjenja bezbednosnih postupaka. Amodei je predložio da evaluatori mogu da objavljuju nalaze o rizicima, incidentima, praksama i nivou dobijenog pristupa bez uređivačke kontrole Anthropica.
Nezavisnost zavisi od uslova rada i objavljivanja
Detalji obaveza još nisu objavljeni: nije poznato sa kojim će evaluatorima Anthropic i OpenAI raditi, kada će oni biti uključeni, koliko će ih biti niti kojim sistemima i informacijama mogu da pristupe. Far.AI je već odbio više ugovora sa razvojnim laboratorijama zbog uslova koji bi ograničili nezavisnost procene, uključujući restriktivne sporazume o poverljivosti i kontrolu nad objavama.
Vreme za procenu takođe je presudno. METR i Redwood Research dobili su približno nedelju dana rada u prostorijama OpenAI-ja tokom istrage incidenta u Hugging Face, ali nisu mogli da izvedu pouzdane zaključke zbog ograničenog obima i roka. Apollo Research je za procenu GPT-6 Astra imao tri dana i naveo da niska stopa neprimerenog ponašanja, uz ograničen prozor testiranja i veću svest modela o proceni, nije snažan dokaz usklađenosti.
Regulatorni okvir se postepeno oblikuje. Kalifornijski SB 53 nalaže velikim razvijačima graničnih AI modela objavu bezbednosnih okvira i prijavu kritičnih incidenata, a SB 813 uvodi okvir za državom priznate organizacije za nezavisnu verifikaciju. EU AI Act propisuje dokumentovanje procena i adversarijalnih testova, prijavu ozbiljnih incidenata i daje EU AI Officeu mogućnost sopstvenih procena i angažovanja stručnjaka.
Teme koje će biti prisutne i na Anthropic i OpenAI na AI Stage TechCrunch Disrupt 2026 pokazuju da bezbednost AI sistema postaje poslovno pitanje upravljanja rizikom: kredibilitet provere zavisi od jasnog mandata, dovoljno vremena, stvarnog pristupa i prava da se zaključci saopšte bez kontrole laboratorije.

