VMTech
Razgovarajmo

GPT-5.6: arhitektura agenata sa manjim troškom obrade

GPT-5.6: arhitektura agenata sa manjim troškom obrade

OpenAI je objavio vodič za GPT-5.6, porodicu modela namenjenu ekonomičnijem radu agenata. U testu BrowseComp, GPT-5.6 Luna na nivou rezonovanja Extra High ostvarila je 84,04% uz cenu od 1,33 dolara, dok je GPT-5.5 Extra High ranije postigao 84,36% uz trošak od 33,27 dolara. Vodič istovremeno predstavlja izmene u Responses API-ju za kontinuitet rezonovanja, koordinaciju više agenata i programsko pozivanje alata.

OpenAI ističe da GPT-5.6 nastavlja pravac prethodnih generacija: rešavanje zadataka dužeg trajanja sa manje tokena i uz manje promena u postojećem okruženju za izvršavanje. Na testu Agents’ Last Exam, GPT-5.6 Sol pri niskom nivou rezonovanja nadmašio je GPT-5.5 pri visokom nivou, uz nepromenjen harness.

Izbor modela više nije jedinstvena odluka

Manji modeli iz porodice 5.6, Luna i Terra, namenjeni su obimnim poslovima, interakcijama osetljivim na kašnjenje i ponavljajućim koracima u agentnim tokovima. OpenAI kao primer navodi pravnu tehnologiju: rukom pisani dokumenti mogu se prvo izdvojiti i strukturisati manjim modelom, a zatim proslediti agentu za dalju analizu.

Kompanija Hypha navela je da Luna zadržava 98% tačnosti GPT-5.5 u ekstrakciji uz jednu osamnaestinu cene. Browser Use je, prema sopstvenom testiranju, rešio 78% od 106 zahtevnih zadataka u pregledaču za oko 14 dolara, dok je tadašnji vodeći model dostigao 80% za približno 235 dolara. PlayerZero je za jedan zadatak istraživanja koda prijavio 64% manje troškove inferencije, 90% kraće vreme odgovora i rast F1 mere za pet poena.

Ovi primeri ne znače da će svaki proces imati isti rezultat, ali pokazuju zašto izbor modela treba vezati za konkretan korak posla. Cenovne promene za modele Luna i Terra dodatno utiču na računicu, što je opisano u tekstu o cene modela Luna i Terra i režimu Fast za Sol.

Četiri mehanizma za efikasniji tok rada

Responses API uvodi zadržavanje rezonovanja između poziva i izvorno sažimanje dugih razgovora. Time agent može da nastavi prethodni rad bez ponovne izgradnje celog konteksta. Na ARC-AGI-3, GPT-5.6 Sol je sa standardnim harnessom ostvario 13,3%, a uz zadržano rezonovanje i compaction 38,3%, uz približno šest puta manje izlaznih tokena.

Programmatic Tool Calling omogućava modelu da napiše JavaScript za orkestraciju alata, paralelno izvršavanje nezavisnih poziva i obradu rezultata van kontekstnog prozora. Namenjen je koracima kao što su filtriranje, spajanje i agregiranje podataka, dok model zadržava zadatke koji zahtevaju procenu. Rogo je u svojim evaluacijama prijavio isti kvalitet prema rubrici uz 21% manje ulaznih tokena.

Za složene zadatke koji se mogu podeliti, multi-agent režim raspoređuje rad podagentima, a glavni agent objedinjuje njihove rezultate. OpenAI navodi da se ponašanje može usmeriti instrukcijama o tome kada treba pokretati podagente, kako bi se dodatni tokeni trošili samo kada donose bolji rezultat.

Keširanje kao operativna optimizacija

Minimalni rok trajanja keša za promptove u celoj porodici produžen je na 30 minuta, a tačke prekida keša mogu se odrediti unutar kontekstnog prozora. Ploy je naveo da je uz tačke prekida i ključeve specifične za radni prostor u zajedničkom promptu od 29.000 tokena smanjio neizkeširani ulaz za 28%.

Praktičan zaključak za poslovanje je da agentni sistem treba meriti po koracima: odvojiti ekstrakciju i determinističku obradu od procene, proveriti gde pomažu manji modeli i pratiti tokene, vreme odgovora i kvalitet. GPT-5.6 pruža API mehanizme za takvu podelu rada, ali njihovu vrednost treba potvrditi na stvarnim zadacima organizacije.

#openai#gptmodels#aiagents#responsesapi
Otvorena analitika
Na sajtu 0 pregleda
min čitanja 4 13.08.2026
Instagram

GPT-5.6: arhitektura agenata sa manjim troškom obrade

Otvorite objavu na Instagramu ↗