Nvidijin harness doveo Claude Opus 5 do 100% na ARC-AGI-3

Nvidia je objavila istraživanje u kojem je Claude Opus 5 na interaktivnom testu ARC-AGI-3 ostvario 100% uz sopstveni harness Agentic Variation Operators (AVO), dok je isti model bez tog sloja postigao 30%. ARC-AGI-3 se sastoji od 2D igara bez uputstava; sistem mora sam da zaključi pravila i pronađe način da pobedi.
Okruženje oko modela određuje ponašanje agenta
Nvidia ovim rezultatom ne tvrdi da je izbor modela nebitan, već pokazuje da je on samo jedan deo agentnog sistema. Adel El Hallack, potpredsednik proizvoda u Nvidijinoj AI jedinici, agent opisuje kao spoj modela, sloja alata koji kompanija naziva harness, runtime okruženja, veština i biblioteka dostupnih sistemu.
Harness upravlja memorijom, kontekstom i povratnim informacijama. To je naročito važno za zadatke dugog horizonta, u kojima agent mora niz odluka da povezuje tokom dužeg vremena, umesto da samo generiše odgovor na jedan upit.
AVO je u eksperimentu dobio i nadzorni sloj. Taj nadzorni agent usmerava radni agent kada se udalji od cilja, krene putem koji vodi u ćorsokak ili ponovo istražuje već isprobanu putanju. Nvidia ne predstavlja AVO kao novi proizvod; pod brendom NeMo nudi različite komponente za izgradnju harnessa, od kojih je deo komercijalan, a deo otvoreno dostupan.
Zašto je ARC-AGI-3 važan test
ARC-AGI-3 meri interaktivno rezonovanje, a rezultat od 100% znači da sistem igre rešava na nivou uspeha koji se pripisuje ljudima. OpenAI je prethodno beležio rezultate ispod 10% i u sopstvenom istraživanju utvrdio da izmene dve postavke harnessa mogu utrostručiti rezultat, ali nije dostigao Nvidijin rezultat.
Ovakav nalaz uklapa se u širu konkurenciju među ponuđačima AI sistema za preduzeća, gde konkurencija za AI sisteme u preduzećima pokazuje zašto se vrednost sve više meri celokupnim operativnim slojem, a ne samo sposobnostima osnovnog modela.
Implikacije za trošak i kontrolu
Databricks je u julu takođe ukazao da različiti harnessi uz isti model mogu značajno promeniti trošak, pa čak ga i udvostručiti. Zato poređenje modela po ulaznoj ceni ne daje potpunu sliku kada se planira agentna automatizacija.
Poslovni timovi bi pre uvođenja agenata za višekoračne procese trebalo da testiraju upravljanje memorijom i kontekstom, dostupne alate, način nadzora i ponašanje pri grešci. Nvidijin eksperiment sugeriše da se pouzdanost i trošak takvih sistema procenjuju kroz celu arhitekturu izvršavanja, a ne samo kroz izbor modela.

