VMTech
Razgovarajmo

OpenAI je revidirao procenu SWE-Bench Pro: oko 30% zadataka je neispravno

OpenAI je revidirao procenu SWE-Bench Pro: oko 30% zadataka je neispravno

Prijatelji, želim da podelim važnu vest iz OpenAI ekosistema.

Skrenuo sam pažnju na reviziju SWE-Bench Pro: tim je utvrdio da je oko 30% zadataka u benčmarku neispravno.

Među glavnim problemima su:
— previše strogi testovi;
— nedovoljno precizni promptovi;
— nisko pokrivanje testovima;
— formulacije koje dovode u zabludu.

OpenAI je takođe povukao prethodnu preporuku da se pređe na SWE-Bench Pro.

Zašto je ovo važno: kvalitet benčmarkova direktno utiče na to kako ocenjujemo modele, izvodimo zaključke o mogućnostima veštačke inteligencije i donosimo odluke o primeni.

A kako Vi proveravate da li procena modela zaista odražava stvarnu sposobnost, a ne greške skupa podataka?

#OpenAI #VeštačkaInteligencija #benčmarkovi #MašinskoUčenje

Otvorena analitika
Na sajtu 2 pregleda
min čitanja 1 08.07.2026
Na Instagramu 3 pregleda
Na Instagramu 1 doseg
Instagram

OpenAI je revidirao procenu SWE-Bench Pro: oko 30% zadataka je neispravno

Otvorite objavu na Instagramu ↗