OpenAI prekinuo kampanju za izvlačenje rezonovanja modela

OpenAI je 28. jula 2026. prekinuo koordinisanu kampanju za neovlašćeno izvlačenje zaštićenog rezonovanja iz svojih AI modela. Kompanija je jezgro aktivnosti, koja je počela prve nedelje jula, povezala sa osobama udruženim sa pekinškim Moonshot AI. Vrhunac je zabeležen 24. i 25. jula: 16.000 pokušaja zahteva sa relevantnim obrascem izvlačenja poteklo je od više od 4.000 korisnika.
Manipulacija interakcijama, a ne proboj sistema
OpenAI navodi da operateri nisu razbili enkripciju, kompromitovali bazu podataka niti neposredno pristupili sačuvanim razgovorima korisnika. Umesto toga, menjali su način interakcije sa modelima kako bi se zaštićeno rezonovanje reprodukovalo u obliku vidljivom podnosiocu zahteva. Kompanija ovu praksu označava kao adversarijalnu destilaciju.
Destilacija u ovom kontekstu znači sistematsko i neovlašćeno korišćenje izlaza jednog modela za obuku, reprodukciju ili unapređenje drugog. OpenAI je tokom istrage pronašao povezanu aktivnost zasnovanu na obrascima promptova kod više od 15.000 korisnika. Nakon prekida kampanje, blokirani su nalozi za koje je utvrđeno da su bili uključeni u prevarnu aktivnost.
Zatvorena putanja za ponavljanje šifrovanih tragova
Kompanija je saopštila i da je zatvorila putanju koja je omogućavala osobama koje već poseduju šifrovano rezonovanje drugog korisnika da ga ponove i povrate njegov sadržaj. Uvedene su dodatne provere za otkrivanje i zadržavanje strimovanog izlaza koji bi mogao da otkrije rezonovanje.
Ovaj nalaz se nadovezuje na rad istraživača iz MATS Research, ELLIS Institute Tübingen i Synk, objavljen u avgustu 2026. Oni su opisali arhitektonsku ranjivost u kojoj su šifrovani tragovi rezonovanja kompatibilni i zamenljivi između sesija, korisnika i modela unutar ekosistema jednog provajdera. Slabije zaštićen model mogao bi, prema njihovom opisu, da dekodira ubačeni šifrovani trag i prikaže ga kao običan tekst.
Takav mehanizam, kako navode istraživači, može omogućiti masovno izvlačenje privatnih podataka, skrivene prompt injekcije u šifrovanim blokovima i otkrivanje opasnih informacija iz procesa rezonovanja, čak i kada vidljivi odgovor odbije štetan zahtev. Kontekst dodatno osvetljava i istraživanje o zloupotrebi OpenAI i Claude modela jer pokazuje kako interakcije među modelima mogu otvoriti neočekivane bezbednosne putanje.
Zašto je zaštita rezonovanja poslovni problem
Zaštićeno rezonovanje može otkriti način na koji model rešava zadatak, kao i osetljive podatke koji bi pomogli reprodukciji njegovih sposobnosti. OpenAI upozorava da bi izdvojeni tragovi mogli poslužiti za obuku drugog modela bez zaštitnih mera prisutnih u korisnički vidljivim odgovorima. Rizik raste kod modela sa sposobnostima primenljivim u oblastima dvostruke namene.
Za organizacije koje uvode generativnu AI, praktičan zaključak je da kontrola pristupa sama po sebi nije dovoljna. Potrebno je pratiti obrasce upita, izlaze koji se strimuju, ponavljanje šifrovanih artefakata i zloupotrebu naloga, uz jasno definisana ograničenja za razmenu podataka i modelskih izlaza.

