🤖 MIT CSAIL: сгенерированные картинки часто не имеют конкретного источника

Чжэн Дай и Дэвид Гиффорд описали в Nature Communications «затухание атрибуции»: чем больше обучающих данных у диффузионной модели, тем слабеет связь картинки с конкретными примерами выборки. Точную проверку дал ансамбль мелких моделей на кусках данных — достаточно выключить компоненты, видевшие пример.

🌍 Спорам о копирайте это вредит: если удаление картины или всех фото человека не меняет выдачу модели, трудно доказать производность от конкретного автора. Целые куски данных атрибуции поддаются, но это не правовое заключение.

👤 Инженерам и MLOps-командам: обучение на шардах делает «забывание» данных точным и упрощает отработку запросов на удаление. Цена — качество и стоимость ансамбля вместо одной модели.

Источник 1: https://news.mit.edu/2026/when-ai-art-has-no-author-generated-images-often-cant-be-traced-to-training-data-0818