VMTech
Обсудить проект

Amazon сканирует редкие книги для обучения языковых моделей

Amazon сканирует редкие книги для обучения языковых моделей

Amazon закупает редкие книги, удаляет их корешки и сканирует страницы для обучения моделей искусственного интеллекта, сообщило 404 Media. Издание поместило трекер в редкий экземпляр и проследило его путь до объекта Amazon VGT3 в Лас-Вегасе; на обозначении комплекса изображён динозавр с книгой в лапах.

Как книги оказались в цепочке обучения ИИ

Amazon подтвердила 404 Media, что приобретает книги «через коммерческие каналы», чтобы улучшать продукты и сервисы, которыми пользуются клиенты. Компания не уточнила, какие именно модели или сервисы используют материалы после оцифровки.

Для работы больших языковых моделей требуется очень большой объём текста. Значительная часть доступных интернет-данных уже могла быть включена в наборы обучения, поэтому книги, которых нет в сети, либо издания, давно снятые с печати, становятся отдельным источником текстовых материалов.

Особую ценность таких изданий источник связывает с тем, что тексты, опубликованные до 2022 года, не могли быть созданы современными языковыми моделями. Обучение на большом объёме сгенерированного ИИ текста может ухудшать качество ответов модели; этот риск в индустрии называют model collapse.

Контекст для Amazon и рынка моделей

Практика оцифровки книг дополняет более широкий курс Amazon на развитие ИИ-инфраструктуры и сервисов. Инвестиции компании в Anthropic и планы партнёра по крупным расходам на AWS отражены в материале о инвестиции Amazon в Anthropic и расходы на AWS, где обучение моделей также связано с масштабом облачной платформы.

Сообщение 404 Media не раскрывает объём закупок, перечень книг и условия их дальнейшего использования. Оно также не утверждает, что Amazon использует каждый отсканированный текст в конкретной модели.

Что это означает для компаний

История показывает, что для разработчиков ИИ важны не только вычислительные мощности, но и доступ к массивам качественного текста. Бизнесу, который создаёт или внедряет генеративные модели, стоит фиксировать происхождение обучающих данных, условия их получения и способы контроля качества датасетов.

#aitraining#amazon#dataprovenance#llmdata
Открытая аналитика
На сайте 1 просмотров
мин чтения 2 17.08.2026
Instagram

Amazon сканирует редкие книги для обучения языковых моделей

Открыть публикацию в Instagram ↗