VMTech
Razgovarajmo

Dve API postavke podigle rezultat GPT-5.6 Sol na ARC-AGI-3 sa 13,3% na 38,3%

Dve API postavke podigle rezultat GPT-5.6 Sol na ARC-AGI-3 sa 13,3% na 38,3%

OpenAI je 29. jula 2026. objavio da je GPT-5.6 Sol na javnom skupu benchmarka ARC-AGI-3 povećao rezultat sa 13,3% na 38,3%. Promena nije zahtevala novi model: uključeni su zadržavanje privatnog rezonovanja i kompakcija konteksta, što je istovremeno smanjilo broj izlaznih tokena šest puta.

Zašto generički test nije pokazao puni kapacitet

ARC-AGI-3 proverava kako agenti bez eksplicitnih uputstava istražuju nepoznate 2D igre, otkrivaju pravila i prilagođavaju strategiju. Rezultat se izražava metrikom Relative Human Action Efficiency. Prosečan ljudski tester je, prema OpenAI proceni zasnovanoj na zvaničnim zapisima igranja, ostvario 48%.

Zvanični harness je posle svakog poteza odbacivao privatno rezonovanje modela. GPT-5.6 Sol je video prethodne akcije i kratke beleške, ali ne i zaključke, planove i uvide koji su do njih doveli. Kada bi istorija prešla 175.000 znakova, najstarije poruke bile su uklonjene, pa je agent gubio i deo ranijih opažanja.

Dve postavke promenile su rezultat

OpenAI je napravio novu implementaciju preko Responses API-ja, nalik okruženju u kojem modeli rade unutar ChatGPT-a i Codexa. Prosleđivanje ID-ja prethodnog odgovora zadržalo je rezonovanje između poteza, pa model više nije morao svaki put iznova da tumači igru.

  • Zadržavanje rezonovanja omogućilo je doslednije planiranje i brže poteze.
  • Kompakcija je sačuvala bitne nalaze iz dužih sesija umesto prostog brisanja najstarijeg sadržaja.
  • GPT-5.6 Sol je ostvario 38,3%, naspram 13,3% sa zvaničnim harnessom.

Početni rezultati dodatno pokazuju razmere problema: GPT-5.6 Sol je bio na 7,8%, dok je GPT-5.5 ostvario svega 0,4%. Rezultat dopunjuje sliku koju daje napredak GPT-5.6 u inteligenciji i efikasnosti: kvalitet sistema ne određuje samo model već i način upravljanja njegovim kontekstom.

Za poslovne AI agente zaključak je praktičan: pre zamene modela treba proveriti da li implementacija čuva rezonovanje, sažima dugu istoriju i koristi API za koji je model optimizovan. Loše upravljanje kontekstom može istovremeno povećati trošak tokena i prikriti stvarnu sposobnost sistema.

#ai#openai#aiagents#benchmarking
Otvorena analitika
Na sajtu 0 pregleda
min čitanja 2 31.07.2026
Instagram

Dve API postavke podigle rezultat GPT-5.6 Sol na ARC-AGI-3 sa 13,3% na 38,3%

Otvorite objavu na Instagramu ↗