MIT: крупные датасеты ослабляют связь AI-изображений с примерами обучения

Исследователи MIT Computer Science and Artificial Intelligence Laboratory (CSAIL) описали эффект «затухания атрибуции» в генеративных диффузионных моделях: с ростом обучающего набора вклад отдельного изображения в конкретный результат уменьшается. В экспериментах на датасетах от 256 до более чем 160 тыс. картинок удаление одного примера, всех работ художника или всех фотографий человека часто почти не меняло сгенерированное изображение.
Работа Zheng Dai и профессора MIT Дэвида Гиффорда опубликована в открытом доступе в Nature Communications. Авторы изучали вопрос, можно ли достоверно установить, какой именно обучающий пример повлиял на готовую AI-картинку. Для крупных моделей обычная проверка потребовала бы многократного переобучения без каждого из миллионов исходных объектов.
Как исследователи проверяли влияние данных
Вместо одной большой модели команда собрала архитектуру diffusion ensemble — ансамбль небольших компонентов, каждый из которых обучается на своей части данных. Если нужно исключить определённую картинку, отключаются компоненты, использовавшие её при обучении. Так получается контрфактическая версия модели без повторного обучения и без приближённой оценки влияния.
Качество ансамблей сравнили с 24 обычными диффузионными моделями, обученными на тех же данных. По стандартным метрикам изображения оказались сопоставимыми. Авторы также отметили, что с увеличением объёма данных ансамбли лучше сопоставлялись с обычными моделями, чем на небольших выборках.
Что показали эксперименты
Учёные обучили 24 ансамбля на семи публичных коллекциях, включая CIFAR-10, CelebA, MetFaces и ArtBench. Для каждого результата они рассматривали альтернативные версии, которые модель выдала бы после удаления отдельного обучающего примера. Максимальное расхождение между исходной и такой альтернативной картинкой назвали контрфактическим радиусом.
По мере роста датасета этот радиус сокращался по обратному степенному закону. Эффект сохранялся при попиксельном и семантическом сравнении изображений, а также при четырёх метриках сходства, фиксированном числе эпох, текстовых запросах и моделях с классовым условием. На малом масштабе команда дополнительно обучила 1 282 отдельные модели традиционным способом и увидела тот же результат.
Последствия для прав и контроля
Авторы подчёркивают, что вывод относится к диффузионным моделям, распространённым в генерации аудиовизуального контента и научных задачах. Сохраняется открытым вопрос, проявляется ли такое же затухание атрибуции у больших языковых моделей.
Для компаний результат не отменяет необходимость проверять лицензии, правила использования данных и риски копирования. Но он показывает ограничение подхода, при котором происхождение каждого результата пытаются свести к одному конкретному объекту из обучающей выборки: в крупных моделях такая связь может не обнаруживаться не из-за несовершенства инструмента, а потому что влияние отдельного примера не меняет выход модели.

