VMTech
Обсудить проект

В иске NYT раскрыты оценки Microsoft рисков ИИ для издателей

В иске NYT раскрыты оценки Microsoft рисков ИИ для издателей

В рассекреченных фрагментах иска The New York Times к OpenAI и Microsoft появились внутренние оценки компаний о сборе контента для обучения ИИ. Директор Microsoft по прикладным исследованиям Брент Хехт в меморандуме от января 2023 года назвал практику «крупнейшей кражей труда в истории человечества», а набор данных на основе Common Crawl содержал более 2 млн документов с nytimes.com.

Новые сведения приведены в ходатайстве NYT по делу об авторских правах, которое длится три года. Значительная часть исходных приложений по-прежнему закрыта, поэтому цитаты в публикации представлены без полного первоначального контекста.

Что утверждает NYT

Иск касается использования защищённых публикаций для обучения генеративных моделей. В документах говорится, что промежуточные обучающие наборы OpenAI содержали более 91 692 копий работ NYT, Daily News и Center for Investigative Reporting. В данных проекта Project Mango, как утверждает газета, насчитывалось не менее 160 903 уникальных произведений новостных издателей.

NYT также заявляет, что OpenAI и Microsoft обменивались данными: OpenAI передала Microsoft полный датасет обучения GPT-3 для оценки внедрения моделей в коммерческие продукты, а Microsoft предоставляла данные через инициативы Project Taxi и Project Mango. Отдельно в материалах описаны предполагаемые попытки обходить платный доступ и удалять уведомления об авторских правах из данных до передачи модели.

Контекст усиливают и иски издателей к разработчикам генеративного ИИ показывают, что претензии издателей к разработчикам генеративного ИИ выходят за рамки одного процесса.

Риск замещения контента

Внутренний документ Microsoft, процитированный в иске, указывает на риск подрыва экономики поставщиков контента, от которого зависит «цепочка поставок» данных для больших языковых моделей. Там же снижение трафика описывается как «петля обречённости»: ухудшение положения сайтов может одновременно вредить и моделям, и вебу.

Microsoft сообщала, что её Copilot Answer Engine снижал переходы на домен NYT до 93% по сравнению с традиционным поиском Bing. Руководитель ChatGPT Ник Тёрли, согласно документам, характеризовал продукты наподобие чат-бота как «экзистенциальную угрозу» издателям, поскольку они в значительной мере заменяют оригинальные материалы и могут становиться ещё более замещающими.

Генеральный директор Microsoft Сатья Наделла на допросе заявил, что платный контент должен лицензироваться для заземления ответов или обучения. Он также сказал, что потребовал бы от OpenAI переобучить модели, если бы узнал об использовании материалов из-за платного доступа.

Юридический контекст и вывод

OpenAI и Microsoft не ответили на запросы о комментариях. Вопрос о законности обучения ИИ на защищённых произведениях пока не получил однозначного судебного ответа, хотя суды в целом благоприятно относились к аргументам ИИ-компаний о добросовестном использовании. Позиция NYT строится в том числе на том, что ответы ИИ способны подменять исходный рынок публикаций.

Для компаний, внедряющих ИИ, этот спор подчёркивает практическую необходимость фиксировать происхождение обучающих данных, условия лицензирования и влияние продукта на поставщиков контента. Внутренние оценки трафика и замещения могут стать существенной частью юридической и коммерческой оценки таких систем.

#aiethics#copyright#openai#microsoft
Открытая аналитика
На сайте 5 просмотров
мин чтения 4 17.09.2026
Instagram

В иске NYT раскрыты оценки Microsoft рисков ИИ для издателей

Открыть публикацию в Instagram ↗