AIUC obezbedio 40 miliona dolara za reviziju AI agenata

Artificial Intelligence Underwriting Company (AIUC), startap koji su pokrenuli Rune Kvist, rani zaposleni u Anthropicu, i Rajiv Dattani, bivši COO organizacije METR, prikupio je 40 miliona dolara u Seriji A. Rundom je rukovodio Ribbit Capital, uz učešće fonda First Harmonic. Sa prethodnih 15 miliona dolara semenskog finansiranja, AIUC je dostigao ukupno 55 miliona dolara prikupljenog kapitala.
Kompanija razvija nezavisni sloj revizije i sertifikacije za AI agente namenjene preduzećima i kompanijama koje razvijaju modele i agente. AIUC među klijentima navodi Cursor, Lovable, Harvey i ElevenLabs. Njena polazna tačka nije pitanje da li je model dovoljno sposoban, već da li organizacija može proverljivo da utvrdi granice njegovog ponašanja.
Standard AIUC-1 po uzoru na SOC 2
AIUC je standard AIUC-1 oblikovao po uzoru na široko prihvaćeni bezbednosni standard SOC 2. Pri njegovom razvoju okupio je konzorcijum od oko 250 lidera za bezbednost i upravljanje rizikom, odnosno ljudi koji u organizacijama odlučuju o nabavci agenata. Njihova pitanja o očekivanim kontrolama i dokazima postaju osnova za testove.
Agent se zatim proverava kroz skup od približno 5.000 testova. Testovi obuhvataju scenarije jailbreaka, halucinacija i curenja podataka. Rezultat je izveštaj od oko 100 strana koji navodi gde agent radi bezbedno i pouzdano, ali i gde postoje ograničenja ili rizici.
AIUC koristi AI agente za izvođenje testova i veštačku inteligenciju za analizu prikupljenih podataka. Ipak, završnu reviziju potvrđuju ljudi. Takav pristup treba da obezbedi nezavisnu procenu pre odluke o kupovini ili uvođenju agenta u poslovne procese.
Zašto je nezavisna procena važna
Kvist navodi da banke, bolnice, vlade i vojne organizacije ne odustaju nužno od primene AI zato što modeli nisu dovoljno pametni. Prepreka su obaveze koje imaju prema sopstvenim korisnicima i odsustvo garancije o tome šta sistem hoće, a šta neće uraditi.
Dattanijevo iskustvo u METR-u dodatno povezuje ovaj pristup sa postojećom praksom nezavisnog testiranja naprednih AI sistema. METR je doskoro bio pretežno usmeren na proveru učinka agenata, odnosno na to da li mogu pouzdano da obave zadatke. U širem kontekstu, rast Anthropica prati potrebu za poverenjem pokazuje da razvoj kompanije prati rastuća potreba tržišta za jasnijim okvirima poverenja u AI sisteme.
Za preduzeća je praktičan zaključak da nabavku autonomnih AI agenata treba posmatrati i kao pitanje kontrole rizika: pored funkcionalnosti, potrebno je proveriti rezultate testiranja, poznata ograničenja i način na koji je nezavisna procena potvrđena.

