Исследователи MIT CSAIL — Чжэн Дай и профессор Дэвид Гиффорд — 18 августа 2026 года опубликовали в Nature Communications работу о феномене «затухания атрибуции» (attribution decay): чем больше обучающих данных у диффузионной модели, тем слабее связь между конкретным примером из обучающей выборки и конкретной сгенерированной картинкой. Точность обеспечило необычное построение — «ансамбль диффузии» из множества мелких моделей, где для проверки «что если убрать этот пример» достаточно выключить компоненты, которые его видели. На семи датасетах авторы показали: при больших объёмах выборки удаление одного снимка, всех работ одного автора или всех фото одного человека перестаёт менять выход модели. Для отрасли это новый аргумент в спорах о копирайте и одновременно инструмент точной проверки подобных заявлений.

image
image

Что произошло

18 августа 2026 года в Nature Communications вышла статья Чжэн Дай и профессора Дэвида Гиффорда из MIT CSAIL о том, какой след оставляет отдельный обучающий пример в выдаче диффузионных моделей. Вместо миллионов переобучений модели ради контрфактического «что если убрать этот пример» авторы собрали «ансамбль диффузии»: много мелких моделей, каждая обучена на своём куске данных, поэтому исключение примера сводится к выключению компонентов, которые его видели, и становится точным, тогда как influence functions, TracIn и TRAK дают лишь приближённые оценки. Благодаря теореме Шпенера компонент хватает O(log N) вместо O(N), хотя при корпусе порядка миллиарда примеров это всё равно десятки полноценных обучений. Всего собрали 24 ансамбля на выборках от 256 до 162 770 изображений из семи датасетов, среди них MNIST, Fashion-MNIST, CelebA, MetFaces и ArtBench; в стресс-тестах использовали 1 282 отдельно обученные модели. Само «затухание атрибуции» описывается обратной степенной зависимостью: с ростом обучающей выборки контрфактический радиус убывает, и на больших объёмах удаление одной картинки, всех работ художника или всех фото человека не меняет сгенерированный результат.

Контекст

Проблема прослеживаемости генераций старая: influence functions, TracIn и TRAK приближённо оценивали вклад обучающих примеров, а точная проверка требовала переобучать модель для каждого гипотетического удаления — на реальных объёмах данных это миллионы обучений, которые никто не может себе позволить. Работа MIT CSAIL переводит вопрос из вычислительной плоскости в архитектурную: если обучать не одну модель, а ансамбль на шардах, исключение данных становится управляемой операцией, а не дорогой гипотезой. Профессор Гиффорд делает два важных уточнения: композиции целых кусков данных атрибуции всё же поддаются, а компании, заявляющие, что их выходы не являются производными произведениями, обязаны строго доказывать это подобными контрфактическими методами. Иначе говоря, затухание индивидуальной атрибуции не отменяет вопрос происхождения генераций, но смещает его с уровня отдельной картинки на уровень датасетов и модели в целом — именно там теперь будут строиться аргументы о происхождении данных.

Почему это важно для индустрии

Главный адресат результата — юридические команды AI-компаний и идущие копирайтные споры. Если удаление конкретной картины художника или всех фото человека не меняет выход модели, считать сгенерированное изображение производной работой конкретного автора становится трудно, и требования о компенсациях и лицензировании теряют опору. Одновременно у правообладателей и аудиторов появляется критерий проверки: заявления вендоров о чистоте обучающих данных можно требовать подкрепить контрфактическими замерами, а переговорный вес датасет-платформ и авторов корпусов от этого растёт. Инженерам работа даёт шаблон «обучай на шардах, чтобы уметь исключать данные», но цена высока: ансамбль из сотен и тысяч мелких моделей вместо одной крупной, без опубликованных оценок качества и стоимости. В горизонте полугода вероятны open-source-репликации и первые утилиты контрфактического аудита для средних датасетов, в перспективе двух лет — пункты о доказуемом исключении данных в договорах на обучающие корпуса и рынок verifiable training data с аудиторами и сертификацией; разворачивать же в проде сегодня нечего, и единственное, что конвертируется сразу, — аргумент в переговорах о лицензировании.

Почему это важно для пользователей

Сильнее всего новость заденет ML-инженеров и MLOps-команды, отвечающие за управление данными, машинное «забывание» (unlearning) и отработку запросов на удаление: на просьбу «удалите из модели вот это фото» на больших объёмах обучения всё чаще придётся отвечать, что измеримого влияния конкретного примера нет, и аудит придётся планировать на уровне датасетов, а не отдельных файлов. Попробовать метод на себе прямо сейчас нельзя — это исследовательский результат без сервиса, поэтому реалистичный первый шаг для таких команд — воспроизведение ансамбля в research-контуре на небольших внутренних выборках. Авторам и фотографам стоит пересмотреть ожидания: массовый UX-паттерн «покажи, чья картинка вошла в эту генерацию» на уровне отдельного примера, судя по статье, не переживёт, поэтому позицию в спорах выгоднее строить на корпусе работ или целом датасете. Всем остальным это фильтр маркетинга: обещания генеративных сервисов о происхождении выходов имеет смысл оценивать по готовности показать метод измерения, а пока таких методов нет, скепсис — рациональная позиция по умолчанию.

Что пока неизвестно / ограничения

Прямые измерения сделаны на академических датасетах: выборки от 256 до примерно 163 тысяч изображений и ансамбли из сотен и тысяч мелких моделей в стресс-тестах; как эффект ведёт себя в коммерческих моделях с миллиардами примеров, работа не показывает, и разговоры об автоматическом снижении юридических рисков на этом уровне — экстраполяция, а не факт. В публикации нет суммарного compute-бюджета ансамблей, замеров задержки, сравнения качества генерации с обычной монолитной моделью и сведений о доступности кода или API, так что до внедрения остаётся открытым главный вопрос — сколько стоит качество генерации при замене крупной модели ансамблем. Правовые выводы тоже не следуют из математики автоматически: как контрфактическая проверка будет учитываться в конкретных тяжбах о производных произведениях, покажет только будущая практика.

Источники

Автор

Look at AI, редакция