Otpečaćeni podnesak produbljuje spor NYT-a sa OpenAI-jem i Microsoftom

Otpečaćeni delovi podneska u tužbi koju je The New York Times podneo protiv kompanija OpenAI i Microsoft iznose navode o obimu prikupljanja novinskog sadržaja za obuku modela. U dokumentu se tvrdi da skupovi podataka za srednju obuku sadrže više od 91.692 kopije radova koje su objavili NYT, Daily News i Center for Investigative Reporting, dok skup izveden iz Common Crawl-a obuhvata više od dva miliona dokumenata sa domena nytimes.com.
Reč je o novim informacijama u višegodišnjem sporu o tome da li su kompanije prekršile autorska prava pri obuci generativnih AI modela. Veliki deo novih navoda potiče iz podneska lista The New York Times, dok su prateći eksponati i dalje zapečaćeni. Zato citati iz dokumenata nisu dostupni u punom izvornom kontekstu.
Navodi o uticaju na izdavače
Podnesak prenosi internu prezentaciju Microsofta iz januara 2024. godine, u kojoj se pad poseta označava kao „začarani krug” koji bi mogao da oslabi modele i veb u celini. U istoj dokumentaciji navodi se da je neuobičajeno da krajnji proizvod ugrožava ekonomsku osnovu svojih ključnih dobavljača sadržaja.
Microsoftovi podaci, kako se navodi u podnesku, pokazuju da je Copilotov „answer engine” smanjio stopu klikova ka domenu The New York Timesa do 93% u poređenju sa tradicionalnom Bing pretragom. Nick Turley, rukovodilac proizvoda ChatGPT u OpenAI-ju, navodno je u internoj komunikaciji ocenio da su izdavači suočeni sa egzistencijalnom pretnjom jer su četbotovi u velikoj meri zamena za izvorni sadržaj.
Satya Nadella je tokom iskaza rekao da sadržaj iza naplatnog zida treba licencirati za korišćenje u povezivanju izvora ili obuci. Naveo je i da bi, da je znao da je OpenAI prikupljao i koristio takav sadržaj, Microsoft mogao da zahteva ponovno obučavanje modela.
Podaci, naplatni zidovi i autorska prava
Tužba dalje navodi da je OpenAI isporučio kompletan skup za obuku GPT-3 Microsoftu radi procene primene modela u komercijalnim proizvodima, kao i da je Microsoft prosleđivao podatke kroz inicijative Project Taxi i Project Mango. Za Project Mango se tvrdi da je sadržao najmanje 160.903 jedinstvena rada novinskih izdavača.
U podnesku se iznose i tvrdnje o zaobilaženju naplatnih zidova, oslanjanju skupova WebText i WebText2 na prikupljene novinske tekstove, kao i uklanjanju obaveštenja o autorskim pravima iz podataka pre nego što dođu do modela. OpenAI i Microsoft nisu odgovorili na zahteve za komentar navedene u članku.
Pravni okvir ostaje otvoren
Pravno pitanje da li se obuka AI sistema na materijalu zaštićenom autorskim pravom može smatrati fer korišćenjem nema konačan odgovor. Sudovi su u dosadašnjim predmetima uglavnom bili naklonjeni argumentima AI kompanija da obuka može predstavljati takvu upotrebu, ali novi navodi se odnose i na moguću zamenu izvornog sadržaja i štetu po njegovo tržište.
Širi kontekst čine i sporovi izdavača sa OpenAI-jem i Microsoftom koji pokazuju da se sporovi izdavača sa OpenAI-jem i Microsoftom ne svode na jedan medijski brend. Za preduzeća je praktičan zaključak da pri uvođenju generativne AI treba proveravati poreklo podataka, uslove licenci i način na koji AI odgovori mogu preusmeriti korisnike od izvornog sadržaja.

