Abliteration.ai nudi modele bez zaštita za red teaming

Startup Abliteration.ai hostuje verzije open-weight AI modela kojima su uklonjene zaštite i odbijanje štetnih zahteva, uključujući nedavno objavljeni GLM-5.3 kompanije Z.ai. Modeli su dostupni iz pregledača i preko API-ja, a TechCrunch je nakon otvaranja besplatnog naloga testirao abliteriranu verziju GLM-5.3.
Kompanija svoju namenu vezuje za ofanzivnu sajber bezbednost, red teaming i testiranje agenata u slučajevima u kojima standardni modeli odbijaju zahtev. Abliteration je već dugo prisutna praksa u zajednici otvorenih modela, a Hugging Face hostuje hiljade takvih varijanti. Novi element je komercijalna usluga koja uklanja potrebu da korisnik sam preuzima model i obezbeđuje računske resurse za njegovo pokretanje.
Manje prepreka za testiranje, ali i za zloupotrebu
Tokom provere, model je odgovorio na zahteve za program koji krade sačuvane lozinke iz Chrome-a i za detaljan protokol uzgoja opasnog ljudskog patogena u kućnim uslovima. To pokazuje da uklanjanje zaštita ne menja samo korisničko iskustvo pri legitimnom bezbednosnom testiranju, već povećava dostupnost sadržaja koji može biti zloupotrebljen.
Suosnivač Devon navodi da Abliteration.ai ima ugovore sa velikim cloud provajderima, da se finansira prihodima od korisnika i da nije primila rizični kapital, iako razgovara o takvom finansiranju. Platforma kupcima nudi sloj moderacije u koji mogu dodati sopstvena pravila. Istovremeno, sama usluga ima ograničene zaštite: u testiranju nije pružila uputstva za samoubistvo, a kompanija radi na dodatnim merama za sprečavanje nasilja.
Pitanje identiteta i odgovornosti
Abliteration.ai nema KYC postupak osim beleženja platne kartice kojom se usluga kupuje. Andrew Yoon iz neprofitne organizacije CivAI zagovara da provajderi koriste klasifikatore za otkrivanje i blokiranje štetnih sajber i bioloških aktivnosti, kao i da firme koje iznajmljuju neposredan pristup naprednim GPU-ovima proveravaju identitet korisnika i odbiju pristup kada postoje razlozi za sumnju na opasnu zloupotrebu.
Devon navodi da među kupcima postoje mlade kompanije za red teaming iz Ujedinjenog Kraljevstva i Evrope, koje rade sa bankama, avio-kompanijama i drugim organizacijama povezanim sa kritičnom infrastrukturom. Njegov argument je da odbrambeni timovi moraju moći da modeluju ponašanje napadača kako bi brže razvili zaštitu.
Struka nema jedinstven odgovor
Ahmed Aly iz kompanije Fabraix kaže da se njegov tim više oslanja na fino podešavanje otvorenih modela nego na abliteration i upozorava da taj postupak može ukloniti deo znanja i sposobnosti modela. Alessio Lomuscio iz Safe Intelligence prihvata mogućnost smanjenja sposobnosti, ali ocenjuje da abliterirani modeli mogu iznuditi ponašanja korisna za stres-testiranje sistema.
David Slater iz platforme Armadin kaže da abliterirani modeli zasad nisu deo njihovog procesa, jer je starije generacije otvorenih modela bilo relativno lako zaobići. Ipak, Armadin istražuje ovu praksu. Praktični poslovni zaključak je da organizacije pri izboru AI alata za bezbednosno testiranje treba da utvrde ko dobija pristup, koje se aktivnosti beleže, kakva su pravila moderacije i da li su scenariji testiranja jasno odvojeni od stvarne produkcione infrastrukture.

