OpenAI zaustavio kampanju izvlačenja skrivenog rezonovanja

OpenAI je saopštio da je do 28. jula prekinuo koordinisanu kampanju usmerenu na izvlačenje zaštićenog rezonovanja iz svojih modela. Aktivnost je počela 1. jula, a 24. i 25. jula dostigla je vrhunac od 16.000 zahteva sa relevantnim obrascem ekstrakcije, koje je poslalo više od 4.000 korisnika. Šira istraga obuhvatila je klaster od preko 15.000 korisnika.
Kompanija ovaj obrazac opisuje kao adversarijalnu destilaciju: sistematsko i neovlašćeno korišćenje izlaza ili rezonovanja jednog modela radi obuke, reprodukcije ili unapređivanja drugog. Zaštićeno rezonovanje predstavlja interni zapis rada modela na zadatku i može sadržati informacije koje nisu prikazane u konačnom odgovoru.
Napad bez provale u infrastrukturu
Operateri nisu probili enkripciju, kompromitovali bazu podataka niti dobili neposredan pristup sačuvanim razgovorima korisnika. Umesto toga, menjali su tok interakcija sa modelom kako bi se zaštićeno rezonovanje pojavilo u obliku vidljivom podnosiocu zahteva, i to koordinisano i u većem obimu.
Jedan od uočenih postupaka bio je kopiranje šifrovanog rezonovanja iz jednog razgovora, a zatim zahtev modelu u drugom razgovoru da taj sadržaj dešifruje i prepiše. Nezavisni bezbednosni istraživači prijavili su i srodne propuste između modela i pri sažimanju razgovora. OpenAI je potvrdio da su putanje napada koje su identifikovali bile stvarne.
Pripisivanje i posledice za razvoj AI
OpenAI navodi da nije jasno da li svi operateri iz posmatranog perioda pripadaju istom akteru. Ipak, jezgro aktivnosti pripisuje osobama povezanim sa kompanijom Moonshot AI, razvijačem modela Kimi. Kompanija upozorava da ova vrsta rizika nije jedinstvena za njene modele, već može pogađati i druge napredne AI sisteme.
Izvučeno rezonovanje može poslužiti za obuku drugog modela bez zadržavanja zaštitnih mera primenjenih na korisnički vidljive odgovore. U većem obimu, takva destilacija može ubrzati prenos naprednih sposobnosti bez istog ulaganja u bezbednost, posebno kako modeli napreduju u domenima sa dvostrukom namenom.
Kontrole nad nalozima, izlazima i partnerima
Odgovor je obuhvatio zabrane i ograničenja prevarnih naloga, strože kontrole registracije i infrastrukture, kao i prošireno praćenje povezanih mreža. OpenAI je pojačao zaštite skrivenog rezonovanja kroz korisnike, radne prostore, organizacije i porodice modela.
Kompanija je zatvorila putanju koja je omogućavala osobi sa tuđim šifrovanim rezonovanjem da ga ponovi i povrati sadržaj. Uvedene su i provere koje mogu otkriti i zadržati strimovani izlaz koji bi mogao otkriti rezonovanje. Kada je aktivnost išla preko usluga trećih strana, OpenAI je sarađivao s tim pružaocima radi identifikovanja i prekidanja uključenih naloga.
Za poslovanje, poruka je da zaštita AI okruženja ne može ostati ograničena na podatke u skladištu ili kontrolu pristupa API-ju. Potrebne su slojevite kontrole naloga, izlaza alata, detekcije obrazaca i usklađena zaštita kod cloud partnera, uz razmenu informacija o pretnjama kroz ceo lanac isporuke.

