Amazon сканирует редкие книги для обучения языковых моделей

Amazon закупает редкие книги, удаляет их корешки и сканирует страницы для обучения моделей искусственного интеллекта, сообщило 404 Media. Издание поместило трекер в редкий экземпляр и проследило его путь до объекта Amazon VGT3 в Лас-Вегасе; на обозначении комплекса изображён динозавр с книгой в лапах.
Как книги оказались в цепочке обучения ИИ
Amazon подтвердила 404 Media, что приобретает книги «через коммерческие каналы», чтобы улучшать продукты и сервисы, которыми пользуются клиенты. Компания не уточнила, какие именно модели или сервисы используют материалы после оцифровки.
Для работы больших языковых моделей требуется очень большой объём текста. Значительная часть доступных интернет-данных уже могла быть включена в наборы обучения, поэтому книги, которых нет в сети, либо издания, давно снятые с печати, становятся отдельным источником текстовых материалов.
Особую ценность таких изданий источник связывает с тем, что тексты, опубликованные до 2022 года, не могли быть созданы современными языковыми моделями. Обучение на большом объёме сгенерированного ИИ текста может ухудшать качество ответов модели; этот риск в индустрии называют model collapse.
Контекст для Amazon и рынка моделей
Практика оцифровки книг дополняет более широкий курс Amazon на развитие ИИ-инфраструктуры и сервисов. Инвестиции компании в Anthropic и планы партнёра по крупным расходам на AWS отражены в материале о инвестиции Amazon в Anthropic и расходы на AWS, где обучение моделей также связано с масштабом облачной платформы.
Сообщение 404 Media не раскрывает объём закупок, перечень книг и условия их дальнейшего использования. Оно также не утверждает, что Amazon использует каждый отсканированный текст в конкретной модели.
Что это означает для компаний
История показывает, что для разработчиков ИИ важны не только вычислительные мощности, но и доступ к массивам качественного текста. Бизнесу, который создаёт или внедряет генеративные модели, стоит фиксировать происхождение обучающих данных, условия их получения и способы контроля качества датасетов.

