PrismML smanjio Qwen3.8 27B na 5,9 GB uz 98% rezultata

AI laboratorija PrismML objavila je Bonsai 2 27B, kompresovanu verziju otvorenog modela Alibaba Qwen3.8 27B, koja zauzima 5,9 GB. Kompanija tvrdi da novi model ostvaruje 98% zbirnih rezultata originala na benchmark testovima, uz devetostruko do desetostruko manje memorije, što ga prema njenim navodima čini pogodnim za rad na ličnim računarima i potencijalno snažnijim pametnim telefonima.
PrismML su osnovali istraživači sa Caltecha, a vodi ga profesor Babak Hassibi, stručnjak za tehnologije kompresije. Startap je prikupio semensku investiciju od 22,25 miliona dolara, uz podršku fondova Khosla Ventures i Cerberus Capital, kao i Caltecha. Među savetnicima je Ion Stoica, suosnivač kompanije Databricks i direktor Berkeley Sky Computing Lab-a.
Ternarne težine kao osnova kompresije
Pristup PrismML-a zasniva se na smanjivanju težina modela, odnosno vrednosti koje model usvaja i čuva tokom obuke. Uobičajeni zapis koristi 16 bita po težini, dok Bonsai pristup koristi ternarne vrednosti: +1, −1 ili 0. Manji skup vrednosti znatno smanjuje prostor potreban za skladištenje modela.
Prvi Bonsai, predstavljen u martu, dostigao je 95% zbirnih benchmark rezultata Qwen modela. PrismML navodi da je ta verzija preuzeta više od 11 miliona puta, dok su njeni još manji modeli ostvarili dodatnih 2,6 miliona preuzimanja. Novi rezultat od 98% ukazuje na napredak kompresije između dve generacije proizvoda.
Lokalno izvršavanje i ograničenja poređenja
Benchmark paritet nije isto što i potpuno jednako ponašanje u svim zadacima. Hassibi navodi da kompresija verovatno uvek ima izvestan uticaj, dok sami benchmark testovi ne predstavljaju savršenu meru rada u stvarnim uslovima. Na tačnost takođe utiče softversko okruženje, odnosno sistem u kojem se model pokreće.
PrismML najavljuje rad na kompresiji znatno većih modela, u rasponu od nekoliko stotina milijardi parametara. Hassibi očekuje da kod većih modela postoji više prostora za smanjenje bez gubitka sposobnosti. Stoica kao važnu posledicu ističe mogućnost da napredni modeli rade direktno na uređaju koji korisnik već poseduje, bez slanja podataka u cloud.
Šta to znači za kompanije
Za organizacije koje uvode generativnu AI, kompresovani modeli otvaraju praktično pitanje raspodele rada između lokalnih uređaja i cloud infrastrukture. Potencijalne prednosti lokalnog rada su manji prenos podataka i korišćenje postojećeg hardvera, ali odluku treba zasnivati na proveri kvaliteta odgovora, zahteva konkretnog uređaja, bezbednosnih pravila i ukupnog troška za svaki poslovni proces.

