Šifrovani blokovi rezonovanja u API-jima otkrili poverljive podatke

Istraživači su opisali propust u načinu na koji su API-ji kompanija OpenAI, Anthropic i Google prenosili šifrovane blokove rezonovanja između poziva. U analizi 6.708 javnih putanja agenata dekodirali su 315.320 thinking blokova i pronašli 704 različita privatna artefakta iz stvarnih korisničkih sesija: 62 API ključa, 33 lozinke, 24 pristupna tokena i sedam privatnih ključeva.
Rad pod naslovom Stealing Reasoning Traces from Proprietary LLM APIs pokazao je da se ne radi o razbijanju šifrovanja niti pribavljanju ključa za šifrovanje. Napad se oslanjao na to da je provajder prihvatao netaknuti, neprozirni blok rezonovanja kada se on ponovo pošalje kroz drugu sesiju, nalog ili kompatibilan model iste porodice.
Kako su blokovi postali izvor izlaganja podataka
Ovakvi objekti služe da sačuvaju stanje rezonovanja kada aplikacija sama vodi istoriju razgovora ili radi bez trajnog stanja. OpenAI vraća šifrovane reasoning stavke, Anthropic koristi šifrovani potpis za kompletno rezonovanje, a Google šifrovane thought potpise. Klijent ne vidi otvoreni tekst, ali može da prosledi objekat nazad API-ju.
Tokom testiranja, slabiji kompatibilni modeli mogli su da posluže kao „neprecizni” dekoderi jačih modela: Claude Haiku 4.5 za Claude tragove, GPT-5.6 Luna za GPT tragove i Gemini Robotics ER-1.6 za Gemini tragove. Od 704 izdvojena artefakta van skupova za testiranje, 64 su se pojavila samo u skrivenom rezonovanju, a ne i u vidljivom delu zapisa.
To znači da uklanjanje tajne iz čitljivog dijaloga nije nužno uklanjalo tajnu iz objavljenog zapisa agenata. Istraživanje ne govori o proizvoljnom pristupu privatnim razgovorima: za prikazani napad bio je potreban već pribavljen šifrovani blok, na primer iz javno objavljenog loga, kao i API pristup kompatibilnom modelu istog provajdera.
Posledice za deljenje logova agenata
Autori su prikazali i mogućnost da se u neprozirni blok smesti prompt-injekcija, a zatim blok ponovo upotrebi u nepovezanom zadatku. U njihovom konceptualnom primeru prijemni model je dodao radnju otpremanja po instrukciji napadača, iako se sama instrukcija nije videla u otvorenom tekstu.
Zaključci se nadovezuju na incidenti sa AI agentima i bezbednost konteksta gde su incidenti sa AI agentima pokazali zašto kontrola konteksta i tokova izvršavanja mora ostati bezbednosni prioritet. Autori novog rada navode da su nalaze prijavili pogođenim provajderima, Microsoftu i Hugging Face-u i da demonstrirani napadi nakon ublažavanja više nisu reproduktivni u avgustu 2026.
Javno nije zabeležena potvrda provajdera koja direktno povezuje sadašnju dokumentaciju sa ovim nalazima, niti je dokumentovana zloupotreba u stvarnim napadima. Takođe, autori upozoravaju da bez izvornog otvorenog teksta ne mogu garantovati savršenu vernost svake rekonstruisane putanje.
Praktičan zaključak za organizacije
Timovi koji grade ili testiraju AI agente treba da iz deljenih tragova uklone reasoning blokove i druga neprozirna polja, čak i kada je vidljivi sadržaj očišćen. Sirove API transkripte ne treba postavljati u javna spremišta, jer objavljeni šifrovani objekat može nositi poverljive podatke koje obična redakcija teksta nije uklonila.

