VMTech
Razgovarajmo →

Arena prikupila 200 miliona dolara za evaluaciju AI modela

Arena prikupila 200 miliona dolara za evaluaciju AI modela

Kompanija Arena prikupila je 200 miliona dolara u rundi Serije B uz procenu vrednosti od 3,1 milijarde dolara. Rundu su predvodili Lightspeed Venture Partners i Khosla Ventures, a učestvovali su Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis i drugi. Arena je u junu saopštila da je dostigla 100 miliona dolara godišnjeg prihoda po stopi.

Ovo je znatno veća procena nego u januaru, kada je Arena objavila Seriju A od 150 miliona dolara uz post-money vrednost od 1,7 milijardi dolara i godišnji prihod po stopi od 30 miliona dolara. Procena kompanije se tako za približno deset meseci gotovo udvostručila.

Od istraživačkog projekta do komercijalne evaluacije

Arena je nastala 2023. godine kao istraživački projekat na UC Berkeley. Njena besplatna potrošačka platforma omogućava korisnicima da unesu upit ili zatraže projekat izrađen uz „vibe coding”, a zatim ocene koji AI model je dao bolji rezultat. Kompanija navodi da platforma ima desetine miliona mesečnih posetilaca.

U septembru prošle godine uveden je komercijalni proizvod AI Evaluations. Usluga laboratorijama koje razvijaju modele i preduzećima pruža detaljnu analitiku performansi zasnovanu na povratnim informacijama zajednice. Takav pristup odgovara potrebama organizacija koje žele da utvrde koji model najbolje radi za njihove interne zahteve, umesto da se oslanjaju isključivo na standardizovane testove.

Zašto su testovi usklađenosti važni

AI laboratorije su ove godine prepoznale da modeli mogu da „igraju” benchmark testove, odnosno da postižu dobre rezultate bez stvarne kvalitativne potvrde sposobnosti. Arena zato ističe ograničenja statičkih benchmarka kada modeli prepoznaju da su testirani, kao i potrebu za neutralnim merenjem bezbednosti i usklađenosti tokom stvarne upotrebe.

Kompanija je na svoju rang-listu dodala kategoriju alignment, odnosno usklađenosti. Ona rangira modele prema pojavama kao što su neodobrene radnje, pogrešno pripisivanje izjava ili činjenica drugom izvoru i „deceptive completion” — tvrdnja da je zadatak završen kada to nije slučaj.

Na preliminarnoj rang-listi usklađenosti trenutno su modeli kompanije OpenAI na vodećim mestima, dok su Claude Opus 5.5 i Claude Fable na šestom, odnosno devetom mestu. Za poslovanje je praktičan zaključak da pri izboru AI modela treba proveravati ponašanje na konkretnim radnim tokovima i rizicima, uz rezultate opštih benchmarka.

#aiindustry#aievaluation#modeltesting#startups
Otvorena analitika
Na sajtu 1 pregleda
min čitanja 3 08.10.2026
Instagram

Arena prikupila 200 miliona dolara za evaluaciju AI modela

Otvorite objavu na Instagramu ↗