VMTech
Обсудить проект

MIT: крупные датасеты ослабляют связь AI-изображений с примерами обучения

MIT: крупные датасеты ослабляют связь AI-изображений с примерами обучения

Исследователи MIT Computer Science and Artificial Intelligence Laboratory (CSAIL) описали эффект «затухания атрибуции» в генеративных диффузионных моделях: с ростом обучающего набора вклад отдельного изображения в конкретный результат уменьшается. В экспериментах на датасетах от 256 до более чем 160 тыс. картинок удаление одного примера, всех работ художника или всех фотографий человека часто почти не меняло сгенерированное изображение.

Работа Zheng Dai и профессора MIT Дэвида Гиффорда опубликована в открытом доступе в Nature Communications. Авторы изучали вопрос, можно ли достоверно установить, какой именно обучающий пример повлиял на готовую AI-картинку. Для крупных моделей обычная проверка потребовала бы многократного переобучения без каждого из миллионов исходных объектов.

Как исследователи проверяли влияние данных

Вместо одной большой модели команда собрала архитектуру diffusion ensemble — ансамбль небольших компонентов, каждый из которых обучается на своей части данных. Если нужно исключить определённую картинку, отключаются компоненты, использовавшие её при обучении. Так получается контрфактическая версия модели без повторного обучения и без приближённой оценки влияния.

Качество ансамблей сравнили с 24 обычными диффузионными моделями, обученными на тех же данных. По стандартным метрикам изображения оказались сопоставимыми. Авторы также отметили, что с увеличением объёма данных ансамбли лучше сопоставлялись с обычными моделями, чем на небольших выборках.

Что показали эксперименты

Учёные обучили 24 ансамбля на семи публичных коллекциях, включая CIFAR-10, CelebA, MetFaces и ArtBench. Для каждого результата они рассматривали альтернативные версии, которые модель выдала бы после удаления отдельного обучающего примера. Максимальное расхождение между исходной и такой альтернативной картинкой назвали контрфактическим радиусом.

По мере роста датасета этот радиус сокращался по обратному степенному закону. Эффект сохранялся при попиксельном и семантическом сравнении изображений, а также при четырёх метриках сходства, фиксированном числе эпох, текстовых запросах и моделях с классовым условием. На малом масштабе команда дополнительно обучила 1 282 отдельные модели традиционным способом и увидела тот же результат.

Последствия для прав и контроля

Авторы подчёркивают, что вывод относится к диффузионным моделям, распространённым в генерации аудиовизуального контента и научных задачах. Сохраняется открытым вопрос, проявляется ли такое же затухание атрибуции у больших языковых моделей.

Для компаний результат не отменяет необходимость проверять лицензии, правила использования данных и риски копирования. Но он показывает ограничение подхода, при котором происхождение каждого результата пытаются свести к одному конкретному объекту из обучающей выборки: в крупных моделях такая связь может не обнаруживаться не из-за несовершенства инструмента, а потому что влияние отдельного примера не меняет выход модели.

#artificialintelligence#generativeai#copyright#machinelearning
Открытая аналитика
На сайте 1 просмотров
мин чтения 3 18.08.2026
Instagram

MIT: крупные датасеты ослабляют связь AI-изображений с примерами обучения

Открыть публикацию в Instagram ↗